Ik finetune LLM, evalueer datasets en train een op maat gemaakt AI-model voor kwaliteit en veiligheid
AI data annotatie, LLM response evaluatie specialist
Over deze dienst
Heb je een expert nodig voor menselijke validatie in de loop voor je AI-modellen?
Ik bied strenge evaluatie van LLM-antwoorden, prompt testing en beoordeling van AI data kwaliteit om te zorgen dat je grote taalmodellen feitelijke, veilige en betrouwbare outputs leveren.
Geleverde diensten:
- Evaluatie van LLM-antwoorden
- Feitelijkheid evaluatie & hallucinatie detectie
- Instructievolging beoordeling
- Relevantie & volledigheid evaluatie
- Veiligheid van AI evaluatie & toxiciteit review
- Foutclassificatie & ernsttaxonomy
- Pairwise voorkeur ranking (RLHF)
- Prompt testing & red-teaming
- Gezondheidszorg LLM evaluatie
- Data kwaliteit assurance & dataset voorbereiding
Tools & formaten:
Microsoft Excel, Google Sheets, CSV, JSON en op maat gemaakte evaluatierubrieken.
Kwaliteitscontrole:
Elk prompt-antwoord paar wordt meerdere keren handmatig beoordeeld volgens jouw exacte evaluatierichtlijnen, beoordelingscriteria en ground-truth referenties.
Neem contact met me op om je richtlijnen te bespreken of vraag een voorbeeld evaluatie aan!
Gerelateerde zoekopdrachten:
llm evaluatie, ai evaluatie, prompt testing, feitelijkheid evaluatie, ai veiligheid, rlhf, data annotatie, respons kwaliteit, hallucinatie detectie, tekst evaluatie data annotatie data labeling beeld annotatie ai data-annotation
Programmeertaal:
Python
•
keras
•
Pytorch
•
R
•
Tensorflow
AI model frameworks en tools:
tensorflow
•
PyTorch
•
keras
Datatype:
Tekst
•
Afbeeldingen
•
Multimodal
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Welke evaluatiedimensies behandel je?
Ik beoordeel antwoorden op feitelijkheid, instructievolging, relevantie, volledigheid, veiligheid, redeneerlogica en toon/helderheid volgens een gestandaardiseerde 1–5 beoordelingsrubriek.
Hoe verifieer je feitelijkheid en detecteer je hallucinaties?
Ik vergelijk gegenereerde claims met je aangeleverde broncontext, vertrouwde ground-truth referenties en primaire documentatie om gefabriceerde feiten, contextverschuivingen of onondersteunde extrapolaties te identificeren.
Kun je antwoorden evalueren met mijn bedrijfs eigen rubric of richtlijnen?
Ja. Ik pas me strikt aan jouw bestaande annotatierichtlijnen, beoordelingscriteria, randgevallenregels en specifieke foutdefinities aan.
Welke deliverables en bestandsformaten lever je?
Ik lever gestructureerde evaluatie spreadsheets in Microsoft Excel (.xlsx), Google Sheets of CSV/JSON, compleet met dimensiescores, foutcategorie tags, ernstratings en onderbouwing notities.
Kan ik een kleine proef uitvoeren voordat ik een volledige opdracht plaats?
Ja. Stuur me je richtlijnen en 3–5 voorbeeld prompt-antwoord paren, en ik voer een gratis proef evaluatie uit zodat je mijn beoordelingsdiepte en rationale kunt verifiëren.

