Vou escrever jobs em pyspark para dados em batch e streaming
Sobre este Serviço
Você precisa de um Engenheiro de Dados qualificado para otimizar seu processamento de dados, pipelines ETL e arquitetura de data lake? Não procure mais! Tenho expertise aprofundada em criar soluções robustas usando PySpark, EMR, Apache Hive e até Apache Hudi. Com uma forte experiência em processamento de dados em batch e streaming, estou aqui para melhorar seus fluxos de trabalho de dados com eficiência e precisão.
Serviços que ofereço:
Jobs ETL em PySpark:
Transforme, limpe e processe seus dados de forma eficiente usando PySpark. Criarei pipelines ETL personalizadas, adaptadas às suas necessidades específicas, garantindo resultados de alta qualidade.
Jobs em batch e streaming:
Seja processando dados em grande volume ou lidando com streams em tempo real, posso projetar e implementar ambos usando as melhores práticas do mercado.
Especialista em EMR:
Aproveite o poder do Amazon Elastic MapReduce (EMR) para processamento distribuído de dados. Criarei clusters EMR, otimizarei a execução dos jobs e ajustarei o desempenho.
Outros:
Posso integrar seu job com Apache Hive e também oferecer minha expertise em Apache Hudi. Além disso, posso fazer o dump dos seus dados no Amazon S3, caso esteja trabalhando com um DataLake.
Ansioso para começar a trabalhar com você. Abraços!
Tecnologia:
Apache Hadoop
•
apache spark
•
Excel
•
Python
•
SQL
•
NoSQL
