Farei limpeza de dados, deduplicação e normalização com python
Desenvolvedor Full Stack e especialista em automação com 88 avaliações de cinco estrelas
Nível 2
Atendeu a critérios de alto desempenho e tem um histórico comprovado de atendimento às expectativas dos clientes.
Sobre este Serviço
Conjunto de dados bagunçado te atrasando? Faço limpeza profissional de dados em CSV, Excel, JSON e dumps de SQL. Duplicatas removidas, campos normalizados, datas analisadas, valores ausentes tratados.
O que eu limpo:
+ Dumps de CSV, Excel, JSON, SQL, TSV, Parquet
+ Catálogos de produtos raspados e listas de preços
+ Listas de clientes e mailing
+ Exportações de pesquisas e envios de formulários
+ Arquivos de transações ou inventário bagunçados
Operações que realizo:
+ Deduplicação com regras de chave personalizadas
+ Normalização de strings (maiúsculas/minúsculas, espaços, codificação)
+ Análise de datas, telefones e endereços
+ Tratamento de valores ausentes (imputar, remover, marcar)
+ Detecção de outliers e mapeamento de campos
Ferramentas que uso:
+ Pandas, numpy, SQL, regex, Python
O que você recebe:
+ Conjunto de dados estruturado limpo no formato escolhido
+ Script de limpeza em Python que você pode rodar novamente
+ Documentação de todas as regras aplicadas
Tenho 89 avaliações de cinco estrelas no meu perfil e mais de 30 projetos de scraping que geraram dados bagunçados que limpei do começo ao fim. Sei exatamente como arquivos quebrados ficam.
Importante: Me envie uma mensagem ANTES de fazer o pedido com um arquivo de exemplo e suas regras de limpeza. Confirmarei o escopo e o prazo.
Meu portfólio
Perguntas frequentes
Tradução automática
Quais formatos de arquivo você suporta?
CSV, Excel (xlsx e xls), JSON, TSV, dumps de SQL, Parquet e texto simples. Se o seu formato for incomum, envie uma amostra e eu confirmo antes de você fazer o pedido.
Quantas linhas você consegue limpar?
Básico cobre até 5.000 linhas, Padrão até 50.000, Premium é ilimitado. Para conjuntos de dados muito grandes, eu crio um pipeline e processo em partes.
Como você decide o que conta como uma duplicata?
Você me informa os campos-chave. Se estiver em dúvida, proponho um conjunto de regras baseado nos dados e você aprova antes de eu executar.
Como você lida com valores ausentes?
Três opções: imputar de outras linhas ou fontes externas, excluir a linha ou marcar para revisão. Eu confirmo por coluna antes de executar.
Eu recebo o script em Python ou apenas os dados limpos?
Ambos, a partir do Padrão. O script é reutilizável em arquivos futuros e vem com uma lista de regras documentada.
Meus dados são confidenciais?
Sim. Trabalho em um espaço de trabalho privado, excluo seus arquivos após a entrega mediante solicitação e assino um NDA se necessário.
Você consegue lidar com datas e endereços em formatos mistos?
Sim. Datas são convertidas para ISO 8601, telefones para E.164, endereços padronizados. Casos extremos são sinalizados para sua revisão.

