Ik bouw datastromen die

Sommige informatie is automatisch vertaald.

India

Ik spreek Engels

AI en ML Engineer voor LLM Fine Tuning RAG en Data Science

AI/ML ontwikkelaar met praktische ervaring in LLM fine-tuning (QLoRA/PEFT), RAG systemen (ChromaDB, MongoDB Atlas vector search, agentic memory), en data engineering (PySpark, Airflow, Delta Lake). Mo...
Over deze dienst

Ik bouw productie-achtige ETL-pijplijnen met PySpark voor transformatie, Airflow voor orkestratie en Delta Lake voor opslag, hetzelfde stack dat ik dagelijks gebruik in mijn data engineering werk.

Wat wordt behandeld:

  • Bronzen-naar-Zilveren (raw-naar-schoon) transformatielogica in PySpark
  • Ontwerp van Airflow DAG met juiste planning en afhankelijkheidsbeheer
  • Delta Lake tabelopzet met versiebeheer
  • Optioneel: Trino/Metabase dashboard bovenop de opgeschoonde data
  • Volledig in-house, zelfgehoste pijplijnarchitectuur zonder afhankelijkheid van third-party managed ETL-platforms (Fivetran, Airbyte Cloud, etc.) als je liever de volledige stack in eigen beheer hebt

Voor we beginnen met het ontwerpen van de pipeline vraag ik naar je datavolume en bronformaat, omdat er veel verschil is tussen een CSV met 10k rijen en een streamingbron, en ik zal eerlijk inschatten in plaats van een generiek sjabloon te hergebruiken.

Bestemmingsplatform:

Amazon Redshift

Databricks Lakehouse

Tools & platforms:

AWS Glue DataBrew

Google Cloud Dataflow