Vou construir pipelines de dados em tempo real com apache kafka, spark e aws

Algumas informações foram traduzidas automaticamente.

Índia

Eu falo Inglês

Engenheiro de dados

Sou um engenheiro de dados orientado a resultados, com mais de 5 anos de experiência em Big Data, AWS e liderança técnica. Especializo-me em criar pipelines nativos de nuvem em grande escala e arquite...
Sobre este Serviço

PIPELINES QUE SOBREVIVEM À PRODUÇÃO, NÃO APENAS A DEMO.


Eu construo pipelines de dados em batch e streaming que rodam todos os dias sem precisar de alguém vigiando.


O QUE EU ENTREGO

- Ingestão em streaming: Kafka, Kinesis, RabbitMQ, NiFi, CDC do seu banco de dados

- Transformações com PySpark / Spark SQL, ajustadas - não a configuração padrão

- Data lake no S3 com Apache Iceberg: evolução de esquema, viagem no tempo, MERGE upserts

- Carregamentos de warehouse em Redshift, Snowflake, Athena ou BigQuery

- Histórico SCD Tipo 2, deduplicação, reexecuções idempotentes, tratamento de dados que chegam atrasados

- DAGs do Airflow, retries, alertas e dashboards no CloudWatch/Grafana

- CI/CD, testes e documentação para facilitar a manutenção


RESULTADOS COMPROVADOS

Mais de 3,5 anos em uma plataforma de streaming de uma telecom europeia: mais de 100 pipelines em produção, 0,6 TB/dia (18 TB/mês), milhões de usuários em 8 países. Mais de 50% de redução no tempo de computação em mais de 100 jobs PySpark. 60% menos falhas em jobs. Uptime acima de 99,9%.


Também migrei uma carga de trabalho do Redshift para Apache Iceberg: consultas mais rápidas em mais de 40% com menor custo.


Envie sua fonte, seu destino e seu volume. Você receberá um escopo fixo e um prazo real antes de fazer o pedido.


Idioma:

Inglês

•

Alemão

•

Hindi

•

Esloveno

Experiência técnica:

Apache NiFi

•

Apache Airflow

•

apache spark

Especialidade:

Pipelines de dados

•

Desenvolvimento de ETL

Setor:

Vídeo e áudio

•

Data analytics

•

Serviços financeiros

Meu portfólio