Ik zet databricks Unity catalog, medallion layers en pyspark ETL pipelines op
Data Engineer, Python Developer, AI Automation en AI Agents
Gescreend door Fiverr Pro
Hamza Anwar is geselecteerd door het team van Fiverr Pro vanwege diens expertise.
Gescreend voor
Data engineering
Over deze dienst
Vetted Pro
De meeste data lake projecten falen bij Silver. De ruwe data komt in Bronze en blijft daar rommelig liggen, niet vertrouwd, onbruikbaar. Ik bouw de volledige pipeline van ruwe ingestie tot een Gold layer waarmee je BI tools daadwerkelijk kunnen queryen.
Ik ben een Python Data Engineer met praktische ervaring in Databricks, die de volledige lakehouse stack dekt, inclusief medallion architectuur, PySpark pipelines, Delta Lake, Unity Catalog en Databricks Workflows. Ik heb ook een Master in Business Intelligence, dus ik weet precies hoe de data eruit moet zien op de Gold layer zodat rapportages echt werken.
Wat ik voor jou maak:
- Medallion architectuur (Bronze / Silver / Gold) ontworpen rondom jouw data bronnen en bedrijfslogica
- PySpark notebooks gedocumenteerd, getest, klaar voor productie.
- Delta tabellen met juiste partitionering, Z-ordering en vacuuming.
- Unity Catalog setup met schemas, catalogs en toegangsbeleid.
- Databricks Workflows om je pipelines automatisch te plannen, monitoren en opnieuw te proberen.
- BI-klaar Gold layer waarmee je team vanaf dag één kan queryen.
Weet je niet precies wat je nodig hebt? Stuur me je data bronnen en je einddoel, dan vertel ik je precies wat logisch is om te bouwen.
Warehouse Platform:
Databricks
Projecttype:
Nieuwbouw
Klanten waar ik mee heb gewerkt
Acuity Healthcare
Built an automated healthcare executive leads pipeline in Python that scrapes Indeed, enriches contacts via Apollo, anymailfinder, verifies emails through Million Verifier, and delivers 2,000 job-matched leads per batch to Excel.
mrt 2026-mei 2026
Mijn portfolio
Andere Data engineering diensten die ik aanbied
Veelgestelde vragen
Automatische vertaling
Wat is medallion architectuur en heb ik het nodig?
Medallion is een gelaagde aanpak voor het organiseren van data in een lakehouse. Bronze bevat ruwe data. Silver reinigt en vormt het. Gold aggregeert het tot bedrijfs-klare tabellen. Als je meerdere data bronnen hebt en betrouwbare, querybare data voor rapportage of ML nodig hebt, is dit het juiste patroon.
Heb ik een bestaande Databricks workspace nodig?
Ja, je hebt een Databricks workspace nodig die is opgezet op Azure, AWS of GCP. Ik werk binnen jouw omgeving zodat alles in jouw account blijft. Als je niet zeker weet wat je eerst moet opzetten, stuur me een bericht en ik wijs je de juiste richting.
Welke data bronnen kan ik in Bronze laten ingestie?
REST API's, relationele databases (PostgreSQL, MySQL, SQL Server), cloud storage bestanden (CSV, JSON, Parquet, Avro op S3 of ADLS), streaming bronnen via Auto Loader, en third-party platforms. Vertel me je bronnen en ik bevestig wat eenvoudig is en wat extra werk vereist.
Wat is Unity Catalog en waarom is het belangrijk?
Unity Catalog is de data governance laag van Databricks. Het laat je controleren wie toegang heeft tot welke tabellen, data lineage volgen en schemas beheren over meerdere workspaces in één overzicht. Voor teams met meerdere gebruikers of regelgeving is het de moeite waard om vanaf het begin in te stellen.
Kan de Gold layer verbinden met Power BI of Tableau?
Ja. Gold Delta tabellen verbinden native met Power BI via de Databricks connector, en hetzelfde geldt voor Tableau en Looker Studio. Ik structureer de Gold layer zodat je BI tool het direct kan queryen zonder verdere transformatie.

