Vou construir pipelines de ETL com pyspark e databricks
Engenheiro de dados
Sobre este Serviço
Olá, eu sou Arbind Sah, e posso te ajudar a construir pipelines de ETL escaláveis, processar Big Data ou otimizar sistemas baseados na nuvem.
Sou especializado em Python, SQL e ferramentas nativas da nuvem para agilizar integração de dados, automação e análises para empresas de todos os tamanhos.
O que posso fazer por você:
-Design e otimização de pipelines de ETL e Data usando PySpark e Databricks para transformação de dados confiável e pronta para produção. Soluções Utilizam Redshift, BigQuery, Spark e Databricks para lidar com grandes volumes de dados de forma eficiente.
-Infraestrutura na nuvem: Construir e gerenciar infraestrutura na AWS (EC2, RDS, S3, Lambda) e GCP, incluindo implantações em containers com Docker.
-Otimização e segurança de banco de dados: Melhorar performance de consultas, implementar segurança robusta e garantir conformidade com os padrões do setor.
-Migração de dados e reconciliação de schema: Migrar e consolidar dados entre PostgreSQL, MySQL e plataformas na nuvem, lidando com incompatibilidades de tipos, valores nulos e mapeamento complexo de schemas.
Com foco forte em computação na nuvem, automação de dados e análises, garanto soluções de dados escaláveis, seguras e de alto desempenho.
Conecte-se comigo para otimizar seus fluxos de trabalho de dados e alcançar máxima eficiência!
Meu portfólio
Perguntas frequentes
Tradução automática
Quais informações você precisa de mim para começar?
Idealmente, seus dados de origem (ou uma amostra), o sistema/formato de destino e o que significa "sucesso" para a migração ou pipeline. Se você não tiver certeza, me envie uma mensagem e eu te ajudo a definir o escopo.
Você consegue trabalhar com dados bagunçados ou inconsistentes?
Sim — lidar com nulls, incompatibilidades de tipos e formatos inconsistentes é uma parte central do que eu faço, não uma exceção que evito.
Você fornece documentação junto com o pipeline entregue?
Sim, todos os pipelines vêm com documentação clara para que sua equipe possa manter e expandir o trabalho após a entrega.
E se minha fonte ou destino de dados não estiver listado nas suas especialidades?
Me envie uma mensagem com os detalhes primeiro — trabalho principalmente com PostgreSQL, MySQL, PySpark/Databricks e AWS/GCP, mas fico feliz em discutir outras stacks antes de você fazer o pedido.
Você pode consertar ou otimizar um pipeline existente ao invés de criar um novo?
Sim — depurar e otimizar pipelines ETL existentes é algo que faço regularmente, não apenas criar do zero.
Como você lida com grandes conjuntos de dados?
Eu uso PySpark e Databricks para processamento distribuído, então dados de grande escala são tratados de forma eficiente, ao invés de sobrecarregar um único script.
Quanto tempo demora um projeto típico?
Depende do volume e da complexidade dos dados — para um cronograma claro, me envie uma mensagem com os detalhes do seu projeto antes de fazer o pedido.
Você assina NDAs?
Sim, fico feliz em assinar um NDA se seu projeto exigir — é só enviar antes de começarmos.

