Ik bouw een etl data pipeline die schoonmaakt en verrijkt onderweg

Sommige informatie is automatisch vertaald.

Pakistan

Ik spreek Urdu, Engels

259 bestellingen voltooid

Python Data Engineer: web scraping, ETL pipelines en data verrijking

Ik haal data van sites die zo gebouwd zijn dat ze het bewaren: JavaScript rendering, logins, rate limits, anti-bot bescherming. Vervolgens zorg ik dat de data blijft binnenkomen. Zes jaar en meer dan...

Niveau 2

Voldoet aan hoge prestatiecriteria en heeft een bewezen staat van dienst in het voldoen aan de verwachtingen van de klant.

Over deze dienst

Data komt uit zes verschillende plekken en geen ervan is het met elkaar eens. Een REST API, twee spreadsheets die iemand handmatig bijhoudt, een scraper output en een CRM-export met verschillende kolomnamen. Iemand besteedt een ochtend per week aan het in elkaar zetten ervan.


Wat de pipeline doet

  • Haalt data uit websites, REST APIs, databases en bestanden
  • Reinigt, dedupliceert en vormt om naar één schema dat jij bepaalt
  • Verrijkt records met andere bronnen: bedrijfsgegevens, contacten, geodata
  • Laadt in BigQuery, PostgreSQL, MySQL, Sheets of je CRM
  • Loopt volgens een schema, georganiseerd in Airflow of n8n


Gemaakt zodat hij niet stilletjes faalt

  • Probeer opnieuw en limieten op elke bron
  • Validatie binnen de pipeline, zodat slechte rijen worden opgevangen voordat ze landen
  • Waarschuwingen wanneer een run faalt of een veld leeg begint te worden


Ik heb de pipeline gebouwd achter meer dan 1 miljoen Amerikaanse advocaatprofielen, die onbemand draaien.


Je krijgt de werkende pipeline, de source code en setup-documentatie geschreven voor degene die het overneemt. Vertel me je bronnen en je bestemming, en ik maak een scope en offerte voordat je bestelt.

Bestemmingsplatform:

Google BigQuery

PostgreSQL

MySQL

Amazon S3

Tools & platforms:

AWS Glue DataBrew

Google Cloud Dataflow

Mijn portfolio