Ik bouw een voorspellingsmodel met volledige statistische validatie
Data scientist
Over deze dienst
Code uitvoeren om een model te passen en wat resultaten te krijgen is niet moeilijk, maar dat is zinloos als je er niet op kunt vertrouwen.
De meeste "Data analisten" kunnen alleen modellen aanpassen, maar begrijpen niet de wiskundige en algoritmische achter-de-schermen processen die plaatsvinden om tot een uiteindelijke voorspelling te komen.
Ik bouw supervised machine learning modellen (classificatie of regressie) met de statistische strengheid die betrouwbare voorspellingen scheidt van misleidende. Dit betekent juiste validatie, eerlijke prestatie-rapportage en resultaten die je daadwerkelijk aan stakeholders kunt uitleggen.
Mijn doel is het leveren van een model dat je kunt inzetten, verdedigen en waarop je beslissingen kunt baseren, niet alleen het leveren van de beste metriek op de training- of testset.
Wat er inbegrepen is: Elke stap en techniek die nodig is om een betrouwbaar model te krijgen met jouw data, dit kan onder meer bestaan uit data schoonmaken en voorbereiden, een exploratieve analyse, categorische codering, ... tot het passen, valideren en afstemmen van het model om het robuust te maken.
Ik werk in Python of R, en zal schone, goed commentaar gevende en reproduceerbare code presenteren.
Programmeertaal:
Python
•
R
•
SQL
Frameworks:
Scikit-learn
•
keras
•
PyTorch
•
Panda
Tools:
Jupyter-notitieboek
•
tensorflow
•
Excel
•
RStudio
Veelgestelde vragen
Automatische vertaling
Garandeer je een specifiek nauwkeurigheidsniveau?
Nee, en je moet sceptisch zijn tegenover iedereen die dat beweert. Modelprestaties hangen af van data kwaliteit en de aard van het probleem. Wat ik wel garandeer is eerlijke evaluatie, juiste validatiemethodologie en een duidelijke uitleg van wat het model wel en niet kan doen.
Wat heb je van mij nodig om te beginnen?
Een dataset, een beschrijving van het voorspellingsdoel en de beschikbare features, en context over hoe het model gebruikt zal worden. Hoe meer context, hoe beter ik de pipeline kan bouwen voor het model.
Mijn data is vertrouwelijk. Is het veilig om te delen?
Ik behandel alle klantgegevens met strikte vertrouwelijkheid en gebruik ze uitsluitend voor de afgesproken scope van werk. Ik anonymiseer gegevens indien nodig. Zodra een opdracht is voltooid, verwijder ik alle gegevens die ermee verband houden.

