Vou limpar, transformar e construir pipelines de ETL
Sussurrador de dados
Sobre este Serviço
Ajudo empresas e pesquisadores a transformar dados confusos, inconsistentes ou brutos em conjuntos de dados limpos, confiáveis e prontos para análise, com pipelines completos construídos em Python ou R. Também ofereço consultoria para equipes que precisam de aconselhamento ou uma segunda opinião, além (ou em vez de) trabalho prático de construção.
Trabalho prático de engenharia
- Limpar e validar conjuntos de dados confusos (valores ausentes, entradas corrompidas, formatos inconsistentes, registros duplicados)
- Construir pipelines de ETL para automatizar extração, transformação e carregamento de dados de CSV, Excel, APIs ou bancos de dados
- Normalizar nomes de colunas, tipos de dados e estruturas inconsistentes de múltiplas fontes (integração de dados)
- Projetar modelos e esquemas de dados para armazenamento limpo e escalável
- Configurar e gerenciar data warehouses (Snowflake, BigQuery, Redshift)
- Construir pipelines de transformação com dbt e orquestrar execuções recorrentes com Apache Airflow
- Armazenar e gerenciar dados em armazenamento na nuvem (Amazon S3)
- Governança de dados: regras de validação, verificações de qualidade e padrões de documentação
- Migrar dados entre sistemas, formatos ou plataformas
- Lidar com dados de séries temporais: lacunas, queda de sensores, padrões sazonais, interpolação
- Análises básicas de previsão e tendências em dados de séries temporais limpos
Perguntas frequentes
Tradução automática
Quais formatos de arquivo você aceita?
CSV, Excel (.xlsx), JSON e a maioria das exportações de bancos de dados SQL. Se seus dados vêm de uma API, compartilhe a documentação e confirmarei a viabilidade antes de você fazer o pedido.
Você escreve o código em Python ou R?
Ambos — vou recomendar aquele que melhor se encaixa nas suas ferramentas e equipe, ou usar aquele que você especificar.
Você consegue lidar com feeds de dados recorrentes/automatizados, não apenas um arquivo único?
Sim, é para isso que servem os pacotes de pipeline de ETL — o script é criado para rodar novamente com novos dados, não apenas limpar o que você envia uma vez.
E se meu conjunto de dados for maior que os limites do pacote?
Sem problema, me envie uma mensagem antes de fazer o pedido com a quantidade de linhas e eu envio uma cotação personalizada.

