Vou construir e otimizar pipelines de dados em larga escala com apache spark

Algumas informações foram traduzidas automaticamente.

Índia

Eu falo Telugu, Inglês, Hindi

Engenheiro de Dados Sênior

Engenheiro de Dados Sênior com mais de 8 anos de experiência construindo e otimizando pipelines de dados distribuídos em grande escala. Experiente em Apache Spark, Scala, PySpark, Hive, Hadoop, SQL e...
Sobre este Serviço

Especialista em Otimização de Apache Spark e Arquitetura de Pipelines de Dados

Se seus jobs no Spark estão falhando com erros de Out-of-Memory (OOM), timeout em broadcasts ou custando demais na nuvem, posso ajudar.

Sou um Engenheiro de Dados Sênior com mais de 8 anos de experiência em empresas, construindo, resolvendo problemas e otimizando pipelines de dados distribuídos em grande escala. Tenho especialização em processar cargas de trabalho de vários terabytes e resolver gargalos complexos de Big Data usando Apache Spark, Scala, PySpark, Hadoop e Hive.

O que posso fazer por você:

  • Otimização de Performance no Spark: Resolver problemas de skew de dados, otimizar joins caros e ajustar a alocação de memória para evitar falhas nos jobs e reduzir drasticamente o tempo de execução.
  • Desenvolvimento de Pipelines ETL: Projetar e construir pipelines de ingestão de dados robustos, escaláveis e tolerantes a falhas, do zero, usando as melhores práticas de particionamento e armazenamento.
  • Depuração em Produção: Analisar lineage, shuffles e uso de recursos do cluster para corrigir problemas silenciosos de performance no seu código existente.
  • Stack Tecnológico Principal: Apache Spark, Scala, Python/PySpark, Hadoop, Hive, SQL e plataformas de nuvem (AWS).

Seja para uma solução rápida para um problema de query ou uma arquitetura de dados empresarial completa, estou pronto para ajudar.