Ik bouw geautomatiseerde ETL data pipelines met pyspark en python

Sommige informatie is automatisch vertaald.

India

Ik spreek Engels
Data Engineer die een healthcare data platform van de grond af aan heeft ontworpen en gebouwd, dat nu meer dan 5 miljoen patiëntgegevens en meer dan 10 TB klinische data verwerkt afkomstig uit EHR-sys...
Over deze dienst

Heb je schaalbare, high-performance data verwerking nodig voor je bedrijf?

Ik ben een professionele Data Engineer gespecialiseerd in PySpark, Python, SQL en Cloud Data Architecturen. Ik help bedrijven om ruwe, ongestructureerde datasets om te zetten in schone, betrouwbare en bruikbare data pipelines.

Wat ik voor je kan doen:

  • Robuuste batch- en real-time ETL/ELT pipelines bouwen met PySpark.
  • Grote CSV-, Parquet-, JSON- of SQL-datasets verwerken met hoge prestaties.
  • PySpark integreren met Databricks, AWS (S3, Glue, Redshift), GCP en Azure.
  • Langzame PySpark code optimaliseren (repartitioning, caching, broadcast joins, out-of-memory fouten oplossen).
  • Ongestructureerde datasets schoonmaken, valideren en structureren voor analytics of Machine Learning.

Waarom voor mij kiezen?

  • Productieklaar, volledig commentaar gegeven code.
  • Uitgebreide setup instructies.
  • 100% data beveiliging en vertrouwelijkheid.

Bestemmingsplatform:

PostgreSQL

•

MySQL

•

Microsoft SQL Server

Tools & platforms:

AWS Glue DataBrew

•

Azure Data Factory

•

Overige