Ik bouw een full stack open source productie data pipeline met cicd automatisering
Gegevensingenieur
Over deze dienst
Ben je op zoek naar flexibele ondersteuning bij data engineering, of het nu gaat om een
snelle oplossing of het bouwen van een volledige pipeline? Ik bied drie niveaus van betrokkenheid:
Uren Support Snelle debugging, kleine Spark/ETL taken of consultatie
Parttime Betrokkenheid Gerichte 20-uur pipeline- of dbt-modelontwikkeling
Volledige projectbouw Complete end-to-end lakehouse setup (50+ uur)
Ik ben een Data Engineer met praktische ervaring in het bouwen van een volledige zelf-gehoste
data lakehouse op Kubernetes, die ongeveer 5 miljoen rijen verwerkt met Apache Spark,
Apache Iceberg, Trino, dbt-Trino en Google BigQuery.
Wat ik lever:
Apache Spark ETL pipelines voor ingestie, opschoning en transformatie
Data kwaliteit checks met PyDeequ
dbt-Trino Gold layer modellen Star Schema, Data Vault, OBT, Marts
Dagster orkestratie en CI/CD automatisering
Volledige documentatie (Standaard & Premium tiers)
Stuur me een bericht voordat je bestelt, zodat we je specifieke wensen kunnen bespreken.
Warehouse Platform:
Snowflake
•
BigQuery
•
Databricks
Projecttype:
Nieuwbouw
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Q: Werk je met cloudplatforms zoals AWS of GCP?
A: Ja — ik ondersteun Google BigQuery, AWS S3 en elke S3-compatibele opslag zoals MinIO.
Q: Kan je werken met mijn bestaande data-infrastructuur?
A: Ja — ik kan integreren met je bestaande databases, cloudopslag of data warehouse.
Q: Lever je documentatie mee met de code?
A: Ja — alle pakketten bevatten volledige code documentatie en een samenvatting van de oplevering.
Q: Kan je real-time streaming pipelines aan?
A: Ja — ik werk met Apache Flink voor streaming en Spark Structured Streaming voor micro-batch verwerking.
Q: Wat als ik na levering wijzigingen nodig heb?
A: Revisies zijn inbegrepen in alle pakketten. Extra revisies zijn beschikbaar tegen meerprijs.

