Vou construir pipelines ETL na AWS com airflow, spark e python
Engenheiro de Dados Sênior
Sobre este Serviço
Engenheiro de Dados Sênior há mais de 10 anos construindo ETL de produção para clientes da Fortune 500 (Expedia, Ford, HP).
Eu crio pipelines de dados confiáveis e prontos para produção na AWS usando Python, PySpark, Airflow e Spark, não scripts descartáveis. Engenharia de verdade: particionamento, joins de broadcast, orquestração e testes.
Histórico:
Reduzi um job HiveQL de 64 horas para menos de 3 horas (95,6% mais rápido)
Migrei 500 TB de Hadoop para AWS, totalmente validado
Criei e gerenciei minha própria plataforma SaaS multi-inquilino do começo ao fim
O que você recebe: pipelines de código limpo, documentado e implantável que sua equipe pode manter, não uma caixa preta.
Baseado no México (sobreposição de fuso horário dos EUA), colaboração em tempo real durante seu horário comercial. Inglês fluente.
Não tem certeza de qual pacote é o ideal? Me envie uma mensagem primeiro e vamos definir juntos.
Ferramentas e plataformas:
AWS Glue DataBrew
•
Outros
Meu portfólio
Perguntas frequentes
Tradução automática
Q: Você trabalha com fontes de dados fora da AWS?
A: Sim — faço ingestão de bancos de dados (PostgreSQL, MySQL), APIs, arquivos e fontes de streaming como Kafka, levando os dados para S3, Redshift ou seu data warehouse preferido.
Q: Vou receber o código fonte e a documentação?
A: Sempre. Você recebe código limpo, controlado por versão, além de documentação para que sua equipe possa rodar e manter tudo de forma independente.
Q: Não tenho certeza de qual pacote preciso. Você pode ajudar?
A: Com certeza. Me envie uma mensagem com suas fontes, destino e volume, e eu recomendarei o pacote ideal ou criarei uma oferta personalizada.
Q: Você pode consertar ou otimizar um pipeline existente ao invés de criar um novo?
A: Sim. Faço auditoria em pipelines quebrados ou lentos e os otimizo — meu trabalho com HiveQL reduziu um job de 64 horas para menos de 3.

