Vou construir um pipeline de dados ETL que limpa e enriquece ao longo do caminho

Algumas informações foram traduzidas automaticamente.

Paquistão

Eu falo Urdu, Inglês

259 pedidos finalizados

Engenheiro de Dados Python: Web Scraping, pipelines ETL e enriquecimento de dados

Eu pego dados de sites que foram feitos para manterem esses dados: renderização em JavaScript, logins, limites de taxa, proteção contra bots. Depois, crio o pipeline que garante que eles continuem che...

Nível 2

Atendeu a critérios de alto desempenho e tem um histórico comprovado de atendimento às expectativas dos clientes.

Sobre este Serviço

Os dados chegam de seis lugares diferentes e nenhum deles concorda. Uma API REST, duas planilhas que alguém mantém manualmente, uma saída de scraper e uma exportação de CRM com nomes de colunas diferentes de todos eles. Alguém passa uma manhã por semana juntando tudo.


O que a pipeline faz

  • Extrai de sites, APIs REST, bancos de dados e arquivos
  • Limpa, deduplica e reorganiza em um esquema que você define
  • Enriquece os registros com outras fontes: dados de empresas, contatos, geodados
  • Carrega no BigQuery, PostgreSQL, MySQL, Sheets ou seu CRM
  • Executa de acordo com uma agenda, orquestrada no Airflow ou n8n


Feita para não falhar silenciosamente

  • Tenta novamente e limita a taxa em cada fonte
  • Valida dentro da pipeline, para que linhas ruins sejam capturadas antes de chegar
  • Alertas quando uma execução falha ou um campo começa a chegar vazio


Criei a pipeline por trás de mais de 1 milhão de perfis de advogados nos EUA, rodando sem supervisão.


Você recebe a pipeline funcionando, o código fonte e os documentos de configuração escritos para quem herdar. Me diga suas fontes e seu destino, e eu farei o escopo e o orçamento antes de você fazer o pedido.

Destination Platform:

Google BigQuery

PostgreSQL

mySQL

Amazon S3

Ferramentas e plataformas:

AWS Glue DataBrew

Meu portfólio