Vou construir pipelines de dados de produção com pyspark, python e sql

Algumas informações foram traduzidas automaticamente.

Índia

Eu falo Inglês, Hindi

Engenheiro de Dados e Backend

Mais de 13 anos construindo plataformas de dados e sistemas de backend — Goldman Sachs, Walmart Global Tech, Ola e duas startups financiadas onde liderei equipes de 6 a 12 engenheiros. O que eu realm...
Sobre este Serviço

Passei mais de 13 anos construindo pipelines de dados na Goldman Sachs, Walmart Global Tech, Ola e duas startups apoiadas por investidores. As pipelines que gerenciei movimentam terabytes por dia. Agora, vou criar a sua.


O QUE VOCÊ RECEBE

- Uma pipeline funcional em PySpark / Python / SQL, não um simples dump de notebook

- Idempotente e reexecutável, para que seja seguro rodar novamente após uma falha

- Lida com nulls, duplicatas, dados atrasados e drift de esquema ao invés de travar

- Código comentado e legível, além de um vídeo curto explicando passo a passo


EU TRABALHO COM

PySpark, Pandas, Polars, SQL (Postgres, MySQL, Redshift, BigQuery), Airflow, dbt, Kafka, Iceberg, AWS (S3, EMR, Glue, Lambda)


TRABALHOS TÍPICOS

- CSV/JSON/Parquet bagunçado transformado em uma tabela limpa e modelada

- Um job ou consulta Spark que precisa realmente terminar

- Extração agendada de uma API ou banco de dados

- Funções de janela, lógica de deduplicação, cargas incrementais, CDC


ANTES DE PEDIR

Me envie uma mensagem com uma amostra de dados e o resultado esperado. Eu te digo qual pacote se encaixa ou se não sou a pessoa certa para isso. A definição do escopo é gratuita.


Estou no horário IST e trabalho sobrepondo o horário dos EUA e da UE.

Destination Platform:

Google BigQuery

Amazon Redshift

ClickHouse

Ferramentas e plataformas:

Hevo Data

Kafka Connect

Debezium