Vou construir pipelines de ETL, ELT com python, spark, airflow e dbt
Engenheiro de Dados e IA, Python, PySpark, Airflow e Cloud ETL
Sobre este Serviço
Sobre este serviço:
Precisa que seus dados sejam limpos, transformados e fluam de forma confiável do fonte até o destino? Eu construo pipelines ETL/ELT usando ferramentas modernas de engenharia de dados como Python, PySpark, SQL, Apache Airflow, dbt e Databricks, seguindo a arquitetura Medallion (Bronze/Silver/Gold) para camadas de dados limpas e em estilo de produção.
Trabalhos recentes incluem um pipeline que ingere dados ao vivo via API, orquestra tudo pelo Airflow com alertas automáticos de falhas, transforma usando mais de 10 modelos dbt com mais de 60 testes de qualidade de dados, e exibe os resultados em um dashboard Power BI além de um pipeline separado no Databricks que processa dados de e-commerce de ponta a ponta com PySpark.
O que eu ofereço:
- Design e desenvolvimento de pipelines ETL/ELT (batch)
- Limpeza, validação e testes de qualidade de dados
- Implementação da arquitetura Medallion (Bronze/Silver/Gold)
- Orquestração com Apache Airflow
- Transformação de dados com dbt, SQL, PySpark
- Desenvolvimento de pipelines no Databricks
- Ingestão de dados via API
- Integração de dashboards (Power BI)
Por que trabalhar comigo:
- Projetos reais e verificáveis, cada entrega é apoiada por um repositório público no GitHub
- Comunicação clara, prazos realistas
- Código limpo, documentado, em estilo de produção, não scripts descartáveis
Destination Platform:
PostgreSQL
•
Amazon S3
•
Outros
Ferramentas e plataformas:
Fábrica de dados do Azure
•
Outros
Meu portfólio
Perguntas frequentes
Tradução automática
Que tipo de pipelines de dados você consegue construir?
Construo pipelines de ETL/ELT que extraem dados de APIs, bancos de dados, arquivos planos (CSV/Excel) ou sites. Limpo, transformo e testo esses dados usando Python, PySpark e dbt, e entrego em formato estruturado no seu banco de dados ou data warehouse (como PostgreSQL ou Databricks).
Não sou técnico, você ainda pode me ajudar?
Com certeza. A maioria dos meus clientes não são engenheiros. Me diga seu objetivo final em português simples (por exemplo, "Preciso consolidar meus dados diários de vendas e estoque"), e eu cuido da arquitetura técnica e explico de forma simples.
Você consegue automatizar uma pipeline para rodar diariamente ou semanalmente?
Sim. Sou especializado em usar Apache Airflow para orquestrar e automatizar fluxos de trabalho. Dependendo do seu pacote, posso configurar execuções agendadas, dependências de tarefas e alertas automáticos por email se alguma parte do pipeline falhar.
Você pode ajudar com web scraping?
Sim. Posso criar web scrapers usando Python para extrair dados de sites públicos, garantindo que o projeto siga requisitos legais e regras do site. Também posso integrar diretamente com APIs, o que sempre recomendo primeiro para maior estabilidade.
O que é a "Arquitetura Medallion"?
É um padrão de design de dados considerado uma melhor prática, que organiza os dados em três camadas: Bronze (dados brutos), Silver (dados limpos e filtrados) e Gold (dados prontos para uso empresarial). Uso isso para garantir que seus relatórios finais sejam construídos com dados altamente confiáveis e testados.
Isso pode se integrar com ferramentas de BI?
Sim. Eu projeto a camada final do seu pipeline de dados de modo que ferramentas como Power BI, Tableau ou outras plataformas de análise possam se conectar diretamente e consultar os dados de forma eficiente.
O que é enriquecimento de dados com IA?
Enriquecimento de dados com IA significa usar IA ou ferramentas de LLM para adicionar mais significado e estrutura a dados brutos e desorganizados. Por exemplo, feedbacks de clientes não estruturados podem ser categorizados automaticamente por sentimento, ou entidades específicas (como nomes ou locais) podem ser extraídas de grandes blocos de texto.
Você pode adicionar enriquecimento com IA ou LLM aos meus dados?
Sim. Posso integrar fluxos de trabalho de IA/LLM ao seu pipeline para tarefas como sumarização, classificação, marcação e conversão de textos não estruturados em campos de banco de dados limpos e consultáveis antes de chegar ao seu dashboard.
Você usa testes de qualidade de dados?
Sim. Acredito fortemente que a qualidade dos dados deve estar embutida no pipeline, não adicionada depois. Uso dbt para implementar testes automatizados (checando nulos, duplicados ou valores aceitos) para que seu pipeline te avise sobre dados ruins antes que quebrem seus relatórios.

