Ik bouw je etl data pipeline met Python, SQL, Airflow en AWS
Gegevensingenieur
Over deze dienst
Worstel je met rommelige, verspreide data die moeilijk te vertrouwen is? Ik bouw betrouwbare ETL pipelines die ruwe data omzetten in schone, query-klare informatie, zoals productieteams dat doen.
Ik werk met Python, SQL, Apache Airflow, PySpark en AWS om je data van bron naar een gestructureerd datawarehouse te verplaatsen, met validatie onderweg zodat slechte data vroeg wordt opgemerkt.
Wat ik kan helpen met:
ETL/ELT pipeline ontwerp en ontwikkeling
Apache Airflow orkestratie (geplande DAGs)
Data-inname van API's, CSV's en databases
Data transformatie met Python/PySpark
Data warehouse modellering (feit- en dimensietabellen, PostgreSQL)
Data kwaliteit validatie en automatische controles
Ik heb end-to-end pipelines gebouwd die meer dan 100.000 records verwerken uit meerdere bronnen, gestructureerd in schone, analytics-klare warehouses.
Ik geef om schone code en duidelijke communicatie, zodat je weet wat er op elk moment gebeurt, niet alleen een black box aan het einde.
Heb je een andere data bron of behoefte? Stuur me eerst een bericht, ik check graag of het past voordat je bestelt.
Bestemmingsplatform:
Amazon Redshift
•
PostgreSQL
•
MySQL
•
Amazon S3
Tools & platforms:
AWS Glue DataBrew
•
Overige
