Ik bouw pyspark en databricks data pipelines en etl

Sommige informatie is automatisch vertaald.

India

Ik spreek Engels

Data Engineer voor PySpark, Databricks, SQL en Python

Hoi, ik ben Abhishek, een fulltime Data Engineer bij GHD die werkt met PySpark, Databricks, SQL, Python en Azure. Ik help bedrijven en engineers met: - Het bouwen en oplossen van data pipelines (ETL/...
Over deze dienst

Heb je een betrouwbare data pipeline nodig, of een Spark job die te langzaam is of steeds faalt? Ik ben een fulltime Data Engineer die elke dag werkt met PySpark, Databricks, SQL en Azure.


WAT IK VOOR JOU KAN DOEN:

  1. ETL/ELT pipelines bouwen in PySpark en Databricks (CSV, JSON, Parquet, APIs, databases)
  2. Data laden in Delta Lake, Databricks, Azure Synapse, PostgreSQL of SQL Server
  3. Incremental loads, Delta MERGE / upserts, SCD Type 2 historie tabellen
  4. Fouten in langzame of falende Spark jobs oplossen: data skew, shuffles, joins, kleine bestanden, out-of-memory errors
  5. Data kwaliteit controles, deduplicatie en schone rapportagetabellen
  6. Planning met Azure Data Factory of Databricks Workflows

WAT JE KRIJGT:

  1. Netjes, gecommentarieerd, productieklare code
  2. Een kort document dat uitlegt hoe je het moet uitvoeren en onderhouden
  3. Voor/na runtimes voor optimalisatie

Stuur me eerst een bericht voordat je bestelt met je data bronnen, volumes en doel, zodat ik het juiste pakket en de planning kan bevestigen. Geen productie credentials nodig; voorbeeldgegevens of een sandbox volstaan om te starten.

Bestemmingsplatform:

Azure Synapse Analytics

Tools & platforms:

Azure Data Factory

•

Overige