Farei limpeza, pré-processamento e manipulação de dados em python
Cientista de Dados criando ML, Power BI, Estatísticas, Apps de IA
Sobre este Serviço
Dados bagunçados, duplicados, quase vazios? Vou transformar isso em tabelas limpas, confiáveis e prontas para análise.
Sou Muhammad, cientista de dados e engenheiro de dados com mestrado. Eu limpo e estruturo os dados para que cada etapa, dashboards, modelos, relatórios, se baseiem em algo que você pode confiar.
O que eu faço:
- Limpeza de dados: duplicados, tipos errados, valores ausentes, textos inconsistentes
- Manipulação e reestruturação (Python/Pandas, SQL)
- Pipeline ETL: extrair, transformar, carregar de múltiplas fontes
- Mesclar e juntar conjuntos de dados bagunçados com segurança
- Engenharia de features e colunas
- Validação de dados e verificações de qualidade
- Pipeline Medallion (bronze-prata-ouro) e armazéns em star schema
- PySpark para grandes conjuntos de dados
Formatos: Excel, CSV, JSON, bancos de dados SQL e outros.
Por que me escolher:
- Pipeline reproduzível, documentado, não hacks pontuais
- Cada transformação é rastreável e pode ser reexecutada
- Validação cuidadosa para evitar que algo quebre silenciosamente
- Comunicação rápida e amigável
Trabalhos recentes incluem um pipeline medallion que atingiu 5.3x de compressão com builds byte-identical, totalmente reproduzíveis em 11 tabelas prontas para modelagem.
Por favor, envie uma mensagem antes de fazer o pedido com uma amostra dos seus dados para que eu possa confirmar o escopo e o pacote adequado.
Tecnologia:
Python
•
R
•
SQL
Meu portfólio
Perguntas frequentes
Tradução automática
Devo entrar em contato com você antes de fazer o pedido?
Sim, envie uma amostra para que eu possa confirmar o escopo e o pacote.
Vou receber um script reutilizável ou apenas arquivos limpos?
Os pacotes Standard e Premium incluem scripts documentados e reexecutáveis; o pacote Basic entrega o arquivo limpo mais um log.
Você consegue lidar com grandes volumes de dados ou big data?
Sim, uso PySpark e Spark para conjuntos de dados muito grandes para o Pandas.
O processo será reproduzível?
Sim, cada etapa é documentada para que você possa reexecutar em novos dados.
Meus dados são confidenciais?
Sim, e posso assinar um NDA mediante solicitação.

