Eu vou construir ou otimizar pipelines de dados pyspark databricks
Design de Sistemas Agênticos IA FullStack e Automação, MLOps
Sobre este Serviço
Precisa de um pipeline PySpark ou Databricks que seja confiável, escalável e fácil de entender?
Vou revisar, construir, corrigir ou otimizar um pipeline de dados limitado usando PySpark, Spark SQL, Delta Lake e Azure Databricks quando for adequado.
Posso resolver problemas de jobs lentos, shuffle excessivos, skew em joins, particionamento, pruning, funções de janela, recursos temporais, processamento incremental, Delta Lake, verificações de qualidade de dados e refatoração de UDFs em Python.
Sua entrega pode incluir código corrigido, resultados de desempenho, implementação do pipeline, verificações de validação, orientações de benchmark, documentação e transferência técnica.
Meu trabalho recente inclui processamento distribuído de bilhões de registros de rede de pacotes no Azure Databricks sem UDFs em Python. Foco em melhorias explicáveis e fáceis de manter.
Os pacotes cobrem jobs definidos, fontes e transformações. Custos de nuvem, credenciais de produção, administração da plataforma e dashboards não relacionados são excluídos, a menos que incluídos em uma oferta personalizada.
Por favor, envie uma mensagem antes de fazer o pedido com o código, esquemas, escala de dados, runtime atual e resultado desejado.
Meu portfólio
Perguntas frequentes
Tradução automática
Você consegue otimizar um job PySpark existente?
Sim. Posso revisar a lógica de execução, joins, shuffles, skew, particionamento, cache, funções de janela, uso de UDFs, leituras/gravações e estrutura do job. Os ganhos reais dependem dos dados, configuração do cluster e implementação atual.
Você pode garantir uma melhora específica no performance?
Não. Vou identificar gargalos e validar melhorias quando o acesso à execução representativa estiver disponível, mas o runtime depende da distribuição dos dados, recursos do cluster, concorrência, armazenamento e configuração da plataforma.
Você trabalha apenas com Azure Databricks?
Minha experiência mais recente é com Azure Databricks e PySpark, mas os conceitos de Spark também se aplicam a outros ambientes gerenciados de Spark. Confirme sua plataforma antes de fazer o pedido.
Você precisa de acesso aos dados de produção?
Nem sempre. Amostras sanitizadas, esquemas, planos de execução, screenshots do Spark UI, logs e dados de teste reproduzíveis geralmente são suficientes. Nunca envie credenciais de produção sem restrições através do Fiverr.
Custos de nuvem e do cluster estão incluídos?
Não. O comprador paga pelos custos do Databricks, nuvem, armazenamento, banco de dados e infraestrutura. Sempre que possível, use um ambiente não de produção com controle de custos.
Você fornecerá o código fonte e documentação?
Sim. Os entregáveis seguem o pacote escolhido e podem incluir notebooks, módulos Python, SQL, exemplos de configuração, testes, resultados, instruções README e um manual operacional.
Você consegue construir uma plataforma de ponta a ponta?
Este serviço cobre pipelines limitados e jobs conectados. Uma plataforma de dados completa, migração organizacional, programa de governança ou operação contínua de produção requer descoberta e uma oferta personalizada de marco.
O que conta como uma revisão?
Uma revisão corrige o trabalho entregue de acordo com os requisitos acordados. Novas fontes, transformações, notebooks, plataformas, esquemas ou lógica de negócios alterada são escopo adicional.

