Ik bouw productie pyspark, python en sql data pipelines
Data- en backend engineer
Over deze dienst
Ik heb meer dan 13 jaar ervaring in het bouwen van data pipelines bij Goldman Sachs, Walmart Global Tech, Ola en twee venture-backed startups. Pipelines die ik beheerde verplaatsen dagelijks terabytes aan data. Nu bouw ik die van jou.
WAT JE KRIJGT
- Een werkende PySpark / Python / SQL pipeline, geen notebook dump
- Idempotent en herhaalbaar, dus veilig om te herhalen na een fout
- Omgaat met nulls, duplicates, late data en schema drift in plaats van crashen
- Leesbare, commentaar gevulde code, plus een korte video waarin ik het uitleg
IK WERK MET
PySpark, Pandas, Polars, SQL (Postgres, MySQL, Redshift, BigQuery), Airflow, dbt, Kafka, Iceberg, AWS (S3, EMR, Glue, Lambda)
TYPISCHE OPDRACHTEN
- Rommelige CSV/JSON/Parquet omzetten in een schone, gemodelleerde tabel
- Een Spark job of query die echt af moet maken
- Een geplande extractie van een API of database
- Window functies, dedup logica, incrementele loads, CDC
VOORDAT JE BESTELT
Stuur me een bericht met een datavoorbeeld en hoe de output eruit moet zien. Ik vertel je welke package het beste past, of dat ik niet de juiste persoon ben. Het bepalen van de scope is gratis.
Ik werk in IST-tijd en heb overlapping met US en EU uren.
Veelgestelde vragen
Automatische vertaling
Kun je werken met mijn data als die vertrouwelijk is?
Ja. Ik werk met een schema-only sample of synthetische data die jouw structuur matcht, en ik bewaar niets na levering. Ik ben graag bereid een NDA te tekenen voordat je iets stuurt.
Hoe groot kunnen de data zijn?
Comfortabel tot terabytes — ik heb pipelines draaien die ongeveer 3TB per dag verwerken. Grote jobs voer ik uit op Spark of DuckDB in plaats van Pandas, zodat ze echt afmaken.
Heb ik Spark nodig of alleen SQL?
Stuur me een bericht. Vaak is het antwoord "je hebt geen Spark nodig," en ik vertel je dat zelfs als de Spark-versie een grotere opdracht zou zijn.
Kan ik dit na levering onderhouden?
Dat is het punt. Commentaar in de code, een README en een video walkthrough. Als je team Python kan lezen, kunnen ze het beheren.

