Vou construir pipelines de ETL automatizados usando pyspark e python

Algumas informações foram traduzidas automaticamente.

Índia

Eu falo Inglês
Engenheiro de Dados que arquitetou e construiu uma plataforma de dados de saúde do zero, atualmente processando mais de 5 milhões de registros de pacientes e mais de 10 TB de dados clínicos provenient...
Sobre este Serviço

Precisa de processamento de dados escalável e de alto desempenho para seu negócio?

Sou um Engenheiro de Dados profissional especializado em PySpark, Python, SQL e Arquiteturas de Dados na Nuvem. Ajudo empresas a transformar conjuntos de dados brutos e não estruturados em pipelines de dados limpos, confiáveis e acionáveis.

O que posso fazer por você:

  • Construir pipelines de ETL/ELT robustos em batch e em tempo real usando PySpark.
  • Processar grandes conjuntos de dados em CSV, Parquet, JSON ou SQL com alto desempenho.
  • Integrar PySpark com Databricks, AWS (S3, Glue, Redshift), GCP e Azure.
  • Otimizar código lento de PySpark (reparticionamento, cache, joins de broadcast, correção de erros de out-of-memory).
  • Limpar, validar e estruturar conjuntos de dados sujos para análises ou Machine Learning.

Por que me escolher?

  • Código de produção, totalmente comentado.
  • Instruções completas de configuração.
  • Segurança e confidencialidade de dados 100% garantidas.

Destination Platform:

PostgreSQL

•

mySQL

•

Microsoft SQL Server

Ferramentas e plataformas:

AWS Glue DataBrew