Ik bouw of optimaliseer pyspark databricks data pipelines
FullStack Agentic AI Systems Design en Automatisering, MLOps
Over deze dienst
Heb je een betrouwbare, schaalbare en begrijpelijke PySpark- of Databricks-pipeline nodig?
Ik beoordeel, bouw, repareer of optimaliseer een bounded data pipeline met behulp van PySpark, Spark SQL, Delta Lake en Azure Databricks waar nodig.
Ik kan trage jobs aanpakken, overmatige shuffles, join skew, partitionering, pruning, window functies, temporele functies, incrementeel verwerken, Delta Lake, data-kwaliteitscontroles en Python UDF refactoring.
Jouw levering kan bestaan uit gecorrigeerde code, prestatiebevindingen, pipeline-implementatie, validatiecontroles, benchmarkrichtlijnen, documentatie en een technische overdracht.
Mijn recente werk omvat gedistribueerde verwerking van meer dan miljarden package-network records in Azure Databricks zonder Python UDFs. Ik focus op uitlegbare, onderhoudbare verbeteringen.
Packages omvatten gedefinieerde jobs, bronnen en transformaties. Cloudkosten, productiecredentials, platformbeheer en niet-gerelateerde dashboards worden uitgesloten, tenzij opgenomen in een aangepaste aanbieding.
Stuur me een bericht voordat je bestelt met de code, schema's, datavolume, huidige runtime en gewenste resultaat.
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Kun je een bestaande PySpark-job optimaliseren?
Ja. Ik kan de uitvoeringslogica, joins, shuffles, skew, partitionering, caching, window functies, UDF-gebruik, lezen/schrijven en jobstructuur beoordelen. Werkelijke verbeteringen hangen af van data, clusterconfiguratie en de bestaande implementatie.
Kun je een specifieke prestatieverbetering garanderen?
Nee. Ik identificeer knelpunten en valideer verbeteringen wanneer representatieve uitvoeringsgegevens beschikbaar zijn, maar de runtime hangt af van dataverdeling, clusterbronnen, gelijktijdigheid, opslag en platformconfiguratie.
Werk je alleen met Azure Databricks?
Mijn meest recente ervaring ligt bij Azure Databricks en PySpark, maar Spark-concepten gelden ook voor andere beheerde Spark-omgevingen. Bevestig je platform voordat je bestelt.
Heb je toegang nodig tot productiegegevens?
Niet per se. Gecertificeerde monsters, schema's, uitvoeringsplannen, Spark UI-screenshots, logs en reproduceerbare testgegevens zijn vaak voldoende. Stuur nooit onbeperkte productiecredentials via Fiverr-vereisten.
Zijn cloud- en clusterkosten inbegrepen?
Nee. De koper betaalt voor Databricks, cloud, opslag, database en andere infrastructuurkosten. Gebruik indien mogelijk een kostenbeheerde niet-productieomgeving.
Zul je broncode en documentatie leveren?
Ja. Leveringen volgen het geselecteerde pakket en kunnen notebooks, Python-modules, SQL, configuratievoorbeelden, tests, bevindingen, README-instructies en een operationeel handboek omvatten.
Kun je een end-to-end platform bouwen?
Deze dienst dekt bounded pipelines en verbonden jobs. Een volledig data platform, organisatiebrede migratie, governanceprogramma of continue productie vereist ontdekking en een aangepaste mijlpaalaanbieding.
Wat telt als een revisie?
Een revisie corrigeert geleverd werk volgens de afgesproken vereisten. Nieuwe bronnen, transformaties, notebooks, platformen, schema's of gewijzigde bedrijfslogica vallen onder extra scope.

