Vou construir pipelines de dados robustas e escaláveis usando pyspark, databricks e airflow
Engenheira de Dados Certificada
Sobre este Serviço
Precisa de pipelines de dados escaláveis e prontos para produção? Eu construo arquiteturas de dados de alto desempenho usando Databricks, PySpark, SQL, Apache Airflow e Apache Kafka. Desde ingestão simples de arquivos até streaming em tempo real complexo, entrego soluções otimizadas e econômicas na nuvem.
O que eu ofereço:
- ETL/ELT de ponta a ponta: Pipelines de dados seguros usando PySpark e SQL.
- Otimização de Databricks: Configuração de Delta Lake, Delta Live Tables (DLT) e Unity Catalog.
- Orquestração: DAGs automatizados no Apache Airflow com tratamento de erros.
- Streaming em tempo real: Streaming de eventos com baixa latência via Apache Kafka.
- Otimização de desempenho: Redução de custos de computação na nuvem com consultas otimizadas.
Por que me escolher?
- Código limpo, de nível de produção e reutilizável.
- Experiência em nuvem empresarial (AWS / Azure).
- Documentação arquitetural gratuita incluída.
Perguntas frequentes
Tradução automática
1. Que informações ou acessos você precisa para começar?
Preciso de uma descrição clara das suas fontes de dados, do formato final esperado e de acesso temporário e seguro ao seu ambiente (como tokens de acesso pessoal do Databricks, buckets de armazenamento na nuvem ou ambientes do Airflow).
2. Você trabalha com processamento em batch e streaming em tempo real?
Sim. Eu construo pipelines ETL padrão em batch usando PySpark e SQL do Databricks, além de pipelines de streaming em tempo real com baixa latência usando Apache Kafka e Databricks Delta Live Tables (DLT).
3. Os pipelines de dados serão totalmente automatizados?
Sim. Eu vou criar DAGs personalizados no Apache Airflow para orquestrar, agendar, monitorar e automatizar toda a sua pipeline de dados, incluindo tratamento de erros robusto e alertas de falhas.
4. Vou receber o código fonte e a documentação?
Sim. Você terá 100% de propriedade de todo o código fonte (como notebooks PySpark, scripts SQL e arquivos DAG do Airflow), junto com documentação técnica clara e fácil de entender sobre como executá-lo.

