Ik bouw een llm evaluatie-harnas met guardrails en een ci kwaliteitscontrole


Over deze dienst
Automatische vertaling
Jouw LLM-app werkt in de demo. De vraag is wat er naar gebruikers wordt gestuurd na de volgende promptwijziging - en de meeste teams weten dat niet. Dat is wat ik bouw: de LLM-evaluatielaag voor jouw feature.
Wat je krijgt:
- Eval-harnas: een gouden set van gelabelde testgevallen voor jouw pipeline, automatisch beoordeeld. Exacte controles waar exact eerlijk is, judge scoring waar de formulering varieert - dus een correct antwoord dat anders geformuleerd is, wordt nog steeds goedgekeurd.
- CI-kwaliteitscontrole (Standard+): het harnas draait bij elke wijziging en faalt de build wanneer de kwaliteit achteruitgaat. Stille regressies stoppen met leveren.
- Guardrails (Advanced): een invoerbeveiliging tegen prompt-injectie en jailbreaks, een uitvoerbeveiliging die gelekte secrets en PII redigeert - elk met zijn eigen toegewijde testbatterij, inclusief false-positive controles op onschuldige lookalikes. Een guard die echte gebruikers blokkeert, is gewoon een ander soort storing.
Hoe ik werk: alleen eerlijke cijfers. Elke metric die ik rapporteer, is reproduceerbaar uit toegewijde testgevallen - je kunt alles zelf opnieuw uitvoeren. Als jouw setup hier niet van profiteert, zeg ik dat voordat je betaalt, niet achteraf.
Werkt met OpenAI, Claude, Gemini of je eigen modellen. Python-gebaseerd, integreert met GitHub Actions of elke CI.
Maak kennis met Jigon Y
Data and Automation Engineer, Python, Web Tools, Clean Data
- Afkomstig uitZuid-Korea
- Lid sindsjul 2026
- Gem. reactietijd2 uur
Talen
Koreaans, Engels
Automatische vertaling
Mijn portfolio
Andere AI-development diensten die ik aanbied
Veelgestelde vragen
Automatische vertaling
Moet ik mijn API-sleutels of codebase delen?
Voor Starter niet - ik kan de harness bouwen op basis van sample inputs en outputs die je aanlevert. CI-integratie vereist repo-toegang of een sandbox. Sleutels blijven van jou: gebruik een beperkte test-sleutel, of je team voert de live calls uit.
Welke modellen en frameworks ondersteun je?
OpenAI, Claude, Gemini of je eigen modellen. De harness is plain Python + Pytest, dus werkt met elke stack en elke CI - GitHub Actions, GitLab CI, Jenkins. Geen framework lock-in.
Welke cijfers krijg ik echt?
Pass/fail per testgeval, samenvattende scores per run, en voor guardrails: blokkeringpercentage plus false-positive percentage op een gecommitteerde batterij. Elk cijfer is reproduceerbaar - voer de suite zelf opnieuw uit en krijg hetzelfde resultaat.

