Als een Machine Learning Engineer die gespecialiseerd is in NLP en symbolische AI, bied ik uitgebreide evaluatie, benchmarking en red-teaming voor je Large Language Models (LLMs) en RAG-pijplijnen. Ik help engineeringteams om edge-case failures te identificeren, hallucinaties te elimineren en strikte beveiligingsmaatregelen te handhaven.
Wat ik aanbied:
- LLM Benchmark & Prestatie-auditing: Evaluatie van modelnauwkeurigheid, latency, contextgebruik en redeneervermogen op basis van aangepaste testkaders.
- Hallucinatie- & Edge-Case Detectie: Stress-testen van systeem prompts, RAG retrieval nauwkeurigheid en feitelijke consistentie onder adversariale omstandigheden.
- Red Teaming & Beveiligingstesten: Identificeren van kwetsbaarheden zoals prompt injectie aanvallen, jailbreaks en leaks van systeem prompts.
- Schema- & Uitvoervalidatie: Verifiëren van strikte JSON/Pydantic structuurconformiteit, uitvoering van functieaanroepen en betrouwbaarheid van API-integraties.
- Gedetailleerd auditrapport & actielijst: Uitgebreide foutenanalyse met praktische prompt engineering oplossingen en aanbevelingen voor guardrails.