Ik auditeer je ai benchmark of llm eval cijfers op statistische geldigheid
Over deze dienst
Je krijgt een duidelijk oordeel of je benchmark of eval nummer de checks doorstaat die het eerder heeft overgeslagen voordat je het publiceert. Ik neem één hoofdsresultaat (een leaderboard-positie, een LLM-als-rechter winpercentage, een "beats baseline met X%" of een schaalwet exponent) en test het adversarial: correctie voor multiple comparison, statistische power, rechterbias en reproductie van je ruwe data.
Je krijgt een van twee eerlijke antwoorden: het overleeft, hier is de gecorrigeerde statistiek die je kunt citeren, of het zit binnen de ruis, hier is waarom en de korte oplossing.
Wat dit onderscheidt is bewijs, geen beloftes. Ik schreef het boek over deze failure mode (Measured, Not Believed), bouwde de open-source tool die de checks uitvoert (evalgate), en reproduceerde publiekelijk drie echte overclaims MT-Bench, RewardBench en een gepubliceerde schaalwet. Elke uitspraak die ik doe is reproduceerbaar uit je data; ik laat zien hoe. En als je nummer echt is, certificeer ik het als auditor die alleen maar fouten vindt, is dat een cynicus, geen auditor.
Veelgestelde vragen
Automatische vertaling
Wat als mijn nummer blijkt te kloppen?
Dan certificeer ik het en krijg je een citable schone bill of health. Dat is een geldige, veel voorkomende uitkomst — geen mislukte opdracht. Een auditor die alleen maar fouten vindt, is een cynicus; als je resultaat standhoudt, laat ik dat zien.
Is mijn data vertrouwelijk?
Ja. Rapporten zijn privé en er wordt niets gepubliceerd. Een geredigeerde of geanonimiseerde slice van je data is meestal genoeg om het nummer te reproduceren, dus je hoeft zelden gevoelige informatie te delen.
Doe je alleen een tool draaien?
Nee. De checks zelf zijn standaard; de waarde ligt in het adversarial uitvoeren van alles en het hebben van het oordeel om een echte confound te onderscheiden van een artefact van hoe de data is opgebouwd. Je krijgt redenering, niet alleen output.
Welke package heb ik nodig?
Als je één nummer hebt dat je gaat publiceren, begin dan met Basic of Standard. Als je een launch post, model card of meerdere claims tegelijk auditte, kies dan Premium. Niet zeker? Stuur me het nummer waar je het minst zeker over bent.
Kun je deze checks integreren in onze CI?
Ja — dat is een doorlopende maandelijkse retainer in plaats van een eenmalig Catalog-project. Stuur me je stack en eval-cadence en ik bepaal de scope apart.

