Ik bouw realtime data pipelines met apache kafka, spark en aws
Over deze dienst
PIPELINES DIE DE PRODUCTIE OVERLEVEN, NIET ALLEEN DE DEMO.
Ik bouw batch- en streaming data pipelines die elke dag draaien zonder dat iemand ze in de gaten houdt.
WAT IK LEVER
- Streaming ingestie: Kafka, Kinesis, RabbitMQ, NiFi, CDC van je database
- PySpark / Spark SQL transformaties, geoptimaliseerd - niet de standaardconfiguratie
- Data lake op S3 met Apache Iceberg: schema-evolutie, time travel, MERGE upserts
- Data warehouse laden in Redshift, Snowflake, Athena of BigQuery
- SCD Type 2 geschiedenis, deduplicatie, idempotente herhalingen, late data handling
- Airflow DAGs, retries, waarschuwingen en CloudWatch/Grafana dashboards
- CI/CD, tests en documentatie zodat het onderhoudbaar is
TRACK RECORD
Meer dan 3,5 jaar op het streaming platform van een Europese telecom: 100+ productie pipelines, 0,6 TB/dag (18 TB/maand), miljoenen gebruikers in 8 landen. Meer dan 50% minder compute tijd door 100+ PySpark jobs. 60% minder job failures. 99,9%+ uptime.
Ik heb ook een Redshift workload gemigreerd naar Apache Iceberg: queries 40%+ sneller en goedkoper.
Stuur me je bron, bestemming en volume. Je krijgt een vaste scope en een echte planning voordat je bestelt.
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Batch of streaming — welke heb ik nodig?
Als er in jouw bedrijf niets binnen het uur reageert, is batch goedkoper en eenvoudiger, en dat vertel ik je ook. Streaming is de moeite waard voor fraude, live personalisatie, waarschuwingen en dashboards in real-time.
Kun je binnen ons AWS-account werken?
Ja, met een scoped IAM-rol. Ik kan ook in mijn eigen sandbox werken met voorbeeldgegevens en deploybare scripts aanleveren, als je geen toegang wilt geven.
Repareer je bestaande kapotte pipelines?
Ja — en dat is meestal goedkoper dan een rebuild. Bestel eerst mijn audit dienst, of stuur me een bericht met de jobcode en ik geef je een offerte op maat.
