Eu vou construir pipelines de dados que

Algumas informações foram traduzidas automaticamente.

Índia

Eu falo Inglês

Engenheiro de IA e ML para ajuste fino de LLM, RAG e Ciência de Dados

Desenvolvedor de IA/ML com experiência prática em produção em ajuste fino de LLM (QLoRA/PEFT), sistemas RAG (ChromaDB, busca vetorial do MongoDB Atlas, memória agentic) e engenharia de dados (PySpark,...
Sobre este Serviço

Eu construo pipelines ETL de estilo produção usando PySpark para transformação, Airflow para orquestração e Delta Lake para armazenamento, a mesma stack que uso no meu trabalho diário de engenharia de dados.

O que está incluso:

  • Transformação de Bronze para Prata (dados brutos para limpos) em PySpark
  • Design de DAG no Airflow com agendamento adequado e gerenciamento de dependências
  • Configuração de tabela Delta Lake com versionamento
  • Opcional: dashboard Trino/Metabase em cima dos dados limpos
  • Arquitetura de pipeline totalmente interna, auto-hospedada, sem dependência de plataformas ETL gerenciadas por terceiros (Fivetran, Airbyte Cloud, etc.) se você preferir ter controle total da stack

Antes de começar a projetar o pipeline, vou perguntar sobre o volume de dados e o formato da fonte, pois há muita diferença entre um CSV de 10 mil linhas e uma fonte de streaming, e vou fazer uma estimativa honesta ao invés de usar um modelo genérico.

Destination Platform:

Amazon Redshift

Databricks Lakehouse

Ferramentas e plataformas:

AWS Glue DataBrew