Eu vou construir pipelines de dados que
Engenheiro de IA e ML para ajuste fino de LLM, RAG e Ciência de Dados
Sobre este Serviço
Eu construo pipelines ETL de estilo produção usando PySpark para transformação, Airflow para orquestração e Delta Lake para armazenamento, a mesma stack que uso no meu trabalho diário de engenharia de dados.
O que está incluso:
- Transformação de Bronze para Prata (dados brutos para limpos) em PySpark
- Design de DAG no Airflow com agendamento adequado e gerenciamento de dependências
- Configuração de tabela Delta Lake com versionamento
- Opcional: dashboard Trino/Metabase em cima dos dados limpos
- Arquitetura de pipeline totalmente interna, auto-hospedada, sem dependência de plataformas ETL gerenciadas por terceiros (Fivetran, Airbyte Cloud, etc.) se você preferir ter controle total da stack
Antes de começar a projetar o pipeline, vou perguntar sobre o volume de dados e o formato da fonte, pois há muita diferença entre um CSV de 10 mil linhas e uma fonte de streaming, e vou fazer uma estimativa honesta ao invés de usar um modelo genérico.
Perguntas frequentes
Tradução automática
Você trabalha com fontes de dados na nuvem (S3, GCS, Azure Blob)?
Sim — especifique sua fonte nas requisitos.
Você consegue consertar um pipeline quebrado existente ao invés de criar um novo?
Sim, envie uma mensagem primeiro com os detalhes — o preço difere de gigs de construção nova.
Preciso da minha própria instância de Airflow?
Não, posso configurar uma (local/Docker) como parte da entrega, ou trabalhar na sua se você fornecer acesso.
Você consegue construir isso sem depender de ferramentas ETL gerenciadas por terceiros?
Sim — eu construo pipelines totalmente internos/self-hospedados (PySpark + Airflow + Delta Lake) ao invés de integrar ferramentas como Fivetran ou Airbyte Cloud. Disponível na tier Premium.
