Eu vou combinar, mesclar e eliminar duplicatas dos seus conjuntos de dados desorganizados

Algumas informações foram traduzidas automaticamente.

México

Eu falo Espanhol, Inglês, Francês

Candidato a PhD em Astrofísica, Consultoria Estatística

Candidato a PhD em astrofísica. Passo meus dias fazendo estatísticas com dados desorganizados, incompletos e correlacionados — catálogos de galáxias onde nada é limpo e cada barra de erro precisa ser ...
Sobre este Serviço

Duas listas com as mesmas pessoas, produtos ou lugares, sem ID compartilhado: nomes escritos de forma diferente, erros de digitação, campos ausentes. O VLOOKUP do Excel desiste imediatamente.


Eu faço ligação probabilística de registros: ao invés de "combinar / não combinar", cada par candidato recebe uma pontuação de quão provável é que seja a mesma entidade, com base em quanto a concordância em cada campo realmente vale. Concordar em um sobrenome raro é uma forte evidência; concordar em um comum é fraco. O método conhece a diferença.


Por que isso importa para você: você escolhe o limiar. Alta confiança para mesclagem automática, e uma lista separada de pares ambíguos para uma revisão humana, ao invés de mesclar silenciosamente dois clientes diferentes ou manter o mesmo duas vezes.


Eu uso isso em catálogos astronômicos, onde mesclar os objetos errados invalida a ciência. Seus dados merecem o mesmo cuidado.


O que entrego: seu conjunto de dados mesclado com uma pontuação de confiança em cada correspondência; uma lista separada de "precisa revisão" para casos ambíguos; um relatório de qualidade mostrando quantos foram combinados, quantos não foram, e por quê; e duplicatas encontradas dentro de cada arquivo, não só entre eles.


Envie uma amostra pequena primeiro, se quiser ver como funciona antes de fazer o pedido.

Tecnologia:

Python

Especialidade:

Manipulação de dados

Validação de dados

etl