Ik auditeer je ai benchmark of llm eval cijfers op statistische geldigheid

Sommige informatie is automatisch vertaald.

Finland

Ik spreek Fins, Engels

Expert in trading bot

Ik ben een Quantitative Engineer die op maat gemaakte trading bots en API-pijplijnen bouwt. Ik verkoop geen "snel rijk worden" scripts. Ik bouw solide, betrouwbare trading architectuur. Mijn Python-c...
Over deze dienst

 Je krijgt een duidelijk oordeel of je benchmark of eval nummer de checks doorstaat die het eerder heeft overgeslagen voordat je het publiceert. Ik neem één hoofdsresultaat (een leaderboard-positie, een LLM-als-rechter winpercentage, een "beats baseline met X%" of een schaalwet exponent) en test het adversarial: correctie voor multiple comparison, statistische power, rechterbias en reproductie van je ruwe data.


 Je krijgt een van twee eerlijke antwoorden: het overleeft, hier is de gecorrigeerde statistiek die je kunt citeren, of het zit binnen de ruis, hier is waarom en de korte oplossing.


 Wat dit onderscheidt is bewijs, geen beloftes. Ik schreef het boek over deze failure mode (Measured, Not Believed), bouwde de open-source tool die de checks uitvoert (evalgate), en reproduceerde publiekelijk drie echte overclaims MT-Bench, RewardBench en een gepubliceerde schaalwet. Elke uitspraak die ik doe is reproduceerbaar uit je data; ik laat zien hoe. En als je nummer echt is, certificeer ik het als auditor die alleen maar fouten vindt, is dat een cynicus, geen auditor.