Precisa de processamento de dados escalável e de alto desempenho para seu negócio?
Sou um Engenheiro de Dados profissional especializado em PySpark, Python, SQL e Arquiteturas de Dados na Nuvem. Ajudo empresas a transformar conjuntos de dados brutos e não estruturados em pipelines de dados limpos, confiáveis e acionáveis.
O que posso fazer por você:
- Construir pipelines de ETL/ELT robustos em batch e em tempo real usando PySpark.
- Processar grandes conjuntos de dados em CSV, Parquet, JSON ou SQL com alto desempenho.
- Integrar PySpark com Databricks, AWS (S3, Glue, Redshift), GCP e Azure.
- Otimizar código lento de PySpark (reparticionamento, cache, joins de broadcast, correção de erros de out-of-memory).
- Limpar, validar e estruturar conjuntos de dados sujos para análises ou Machine Learning.
Por que me escolher?
- Código de produção, totalmente comentado.
- Instruções completas de configuração.
- Segurança e confidencialidade de dados 100% garantidas.