g
gb_proplus

GB DATAWORKS

@gb_proplus

DATA ENGINEERING

Índia
Inglês, Hindi, Marata, Francês
Algumas informações são exibidas no idioma inglês.
Sobre mim
Data Engineer with 2 years of experience in Big Data, Data Engineering, and Data Analysis. Proficient in Python, PySpark, AWS (Glue, Lambda, Step Functions, S3, SNS, SQS, SES, Redshift), Snowflake, Databricks, SQL, Hadoop, Hive, and Azure Data Factory. Skilled in ETL, Data Modeling, Data Migration, and building scalable pipelines. Experienced with Machine Learning, Data Mining, and cloud-based solutions, with strong expertise in PoC and gap analysis for enterprise applications.... Saiba mais

Habilidades

g
gb_proplus
GB DATAWORKS
offline • 
Tempo médio de resposta: 1 hora

Conheça meus serviços

ETLs de dados
I will build scalable etl data pipelines using python sql AWS azure

Portfólio

Experiência profissional

ProArch

DATA ENGINEER

ProArch • Período integral

Aug 2024 - May 20261 yr 9 mos

Project Overview : Clinician Insights is a healthcare data engineering project designed to build a scalable and secure ETL pipeline for processing clinical data. The system ingests raw data from multiple healthcare source systems such as patient registration, clinician management, visit encounters, and diagnosis platforms.The project follows a Bronze–Silver–Gold architecture, where raw data is ingested into Amazon S3, cleaned and standardized using AWS Glue and PySpark, and finally transformed into analytics-ready datasets. The curated data supports clinician performance analysis, patient visit summaries, and operational reporting. Roles and Responsibility • Ingested raw healthcare data into Amazon S3 (Bronze layer) • Developed and enhanced AWS Glue ETL jobs using PySpark • Performed data cleaning, validation, and standardization • Removed duplicate patient and visit records • Handled missing and null values in critical columns • Standardized categorical fields such as gender and diagnosis codes • Converted date and timestamp fields into consistent formats • Joined related datasets like patient, visit, and diagnosis data • Performed post-transformation data validation using Athena • Assisted in debugging Glue job failures using CloudWatch logs Challenges • Poor Data Quality: • Raw data contained duplicates, missing values, and inconsistent formats, which required robust validation and cleansing logic in PySpark. • Glue Job Failures: • Schema mismatches and unexpected null values caused job failures, resolved through CloudWatch log analysis and code optimization. • Performance Issues: • Large healthcare datasets led to performance bottlenecks, which were mitigated by optimizing Spark transformations and reducing unnecessary data shuffles.