Vou construir pipelines de dados e ETL com pyspark e databricks

Algumas informações foram traduzidas automaticamente.

Índia

Eu falo Inglês

Engenheiro de Dados para PySpark, Databricks, SQL e Python

Oi, sou o Abhishek, um Engenheiro de Dados em tempo integral na GHD, trabalhando com PySpark, Databricks, SQL, Python e Azure. Ajudo empresas e engenheiros com: - Construção e conserto de pipelines d...
Sobre este Serviço

Precisa de um pipeline de dados confiável ou de um job de Spark que está muito lento ou que fica falhando? Sou um Engenheiro de Dados em tempo integral que trabalha com PySpark, Databricks, SQL e Azure todos os dias.


O QUE POSSO FAZER POR VOCÊ:

  1. Construir pipelines ETL/ELT em PySpark e Databricks (CSV, JSON, Parquet, APIs, bancos de dados)
  2. Carregar dados no Delta Lake, Databricks, Azure Synapse, PostgreSQL ou SQL Server
  3. Cargas incrementais, Delta MERGE / upserts, tabelas de histórico SCD Tipo 2
  4. Consertar jobs de Spark lentos ou que falham: skew de dados, shuffles, joins, arquivos pequenos, erros de out-of-memory
  5. Verificações de qualidade de dados, deduplicação e tabelas de relatórios limpas
  6. Agendamento com Azure Data Factory ou Databricks Workflows

O QUE VOCÊ RECEBE:

  1. Código limpo, comentado e estilo produção
  2. Um documento curto explicando como rodar e manter
  3. Tempos de execução antes/depois para trabalhos de otimização

Por favor, envie uma mensagem antes de fazer o pedido com suas fontes de dados, volumes e objetivo, assim posso confirmar o pacote certo e o prazo. Não é necessário fornecer credenciais de produção; dados de exemplo ou um sandbox são suficientes para começar.

Destination Platform:

Azure Synapse Analytics

Ferramentas e plataformas:

Fábrica de dados do Azure

•

Outros