Ik bouw ETL-pijplijnen voor data engineering met Apache Airflow
Junior data scientist, machine learning engineer, Python, ETL-pipelines
Over deze dienst
Is je data opgeslagen in APIs of bestanden zonder automatische manier om het te verzamelen en op te slaan? Ik bouw productieklare ETL-pijplijnen en data engineering workflows met Apache Airflow 3, Python en SQL die je data op een schema extraheren, transformeren en laden, volledig geautomatiseerd, zonder handmatige arbeid.
Wat ik lever:
- Geautomatiseerde pijplijn met onafhankelijke extract, transformeer en laad taken
- Apache Airflow 3 met TaskFlow API en dagelijkse planning
- Multi-container Docker stack voor een schone, reproduceerbare deployment
- PostgreSQL of MySQL database met gestructureerde, querybare records
- Volledige broncode geleverd via GitHub
Waarom ik? Ik heb een peer-reviewed IEEE conferentiepublicatie, dubbele DataCamp-certificeringen (Certified Data Scientist en Certified Associate Data Scientist) en een onderzoeksstage bij een AI-lab in het Verenigd Koninkrijk. Mijn ETL data pipeline draait live in productie en verzamelt jaarlijks meer dan 365 gestructureerde records zonder handmatige interventie.
Ik werk met: REST APIs en bestandgebaseerde data bronnen, waarbij ik data laad in SQL databases zoals PostgreSQL of MySQL.
Opmerking: Stuur me alsjeblieft een bericht voordat je bestelt om je data bron en wensen te bespreken.
Bestemmingsplatform:
PostgreSQL
•
MySQL
Tools & platforms:
Overige
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Met welke data bronnen kan ik verbinden?
Momenteel REST APIs. Als je een andere bron hebt, zoals CSV-bestanden of een database, stuur me eerst een bericht zodat we de haalbaarheid kunnen bespreken.
Doe je volledige data engineering of alleen basis ETL-scripts?
Volledige data engineering: pipeline-architectuur, Apache Airflow orchestratie, Docker containerisatie en productieklare code, geen eenmalig script.
Moet ik Apache Airflow al geïnstalleerd hebben?
Nee. Ik zet de pipeline-omgeving voor je op, inclusief Docker-configuratie indien nodig.
Zal de pipeline automatisch draaien zonder dat ik iets doe?
Ja. De standaard- en premium-pakketten omvatten volledig geplande automatisering met Apache Airflow die op jouw ingestelde schema draait zonder handmatige triggers.
Ontvang ik de broncode?
Ja, alle pakketten bevatten de volledige Python broncode en DAG-bestanden.
Kun je werken met mijn bestaande database?
Ja, zolang je de inloggegevens veilig kunt verstrekken. Ik raad aan dit vooraf te bespreken voordat je bestelt.
Controleert de pipeline op slechte of ongeldige data?
Ja. Binnenkomende data wordt gevalideerd voordat het wordt geladen, waarbij types, verplichte velden en duidelijk ongeldige waarden worden gecontroleerd, zodat een verkeerd record wordt opgemerkt in plaats van stilletjes in je database terecht te komen.
Wat gebeurt er als een stap in de pipeline faalt?
Elke taak probeert het een paar keer automatisch opnieuw voordat hij faalt, en je kunt een e-mail krijgen als een run uiteindelijk mislukt, zodat problemen meteen worden opgemerkt in plaats van dagen later.

