Ik bouw een llm evaluatieharnas voor je ai-agent of chatbot


Over deze dienst
Automatische vertaling
De meeste AI-agenten worden zonder nummer geleverd. Je verandert een prompt, wisselt van model, voegt een tool toe, en niemand kan zeggen of het beter is geworden of stilletjes slechter.
Ik bouw het evaluatieharnas dat dat antwoord geeft.
Ik ben een AI-engineer met 4 jaar productie-ervaring. Ik was de enige auteur van de conversational agent achter een US supply-chain platform's in-product assistent, een multi-agent LangGraph pipeline over een 125-parameters tool surface, en ik heb de drie-pass validatielaag gebouwd: 38 enum-checked velden, LLM-gebaseerde waarde correctie en een hallucinatie-pass.
WAT JE KRIJGT
- Een testset opgebouwd uit je echte verkeer of je specificatie
- Metrics die passen bij jouw use case: exacte match, semantische gelijkenis, trouw, tool-call nauwkeurigheid, latency en kosten
- LLM-als-jury scoring met gekalibreerde rubrics
- Een commando dat de suite runt en een gescoord rapport oplevert
- Regression baselines zodat je twee versies kunt vergelijken
- Optionele CI gating zodat een slechte prompt nooit in productie komt
Stack: Python, pytest, LangChain, LangGraph, OpenAI, Anthropic, Llama, Ragas, DeepEval, MLflow.
Vertel me wat je agent doet en ik vertel je wat ik zou meten.
Maak kennis met Akash L
AI Engineer, LLM Agents, RAG and MLOps
- Afkomstig uitIndia
- Lid sindsmrt 2020
Talen
Tamil, Engels
Automatische vertaling
Veelgestelde vragen
Automatische vertaling
Ik heb geen testset. Kun je nog steeds helpen?
Ja. De meeste klanten niet. Ik bouw er een op basis van je productie logs, je documentatie of een specificatie van wat de agent moet doen, en ik laat je de cases zien voordat ik iets beoordeel.
Moet ik je toegang geven tot mijn codebase?
Nee. Het harnas kan draaien tegen een API-endpoint of een dunne wrapper die je levert. Repo-toegang helpt alleen als je CI gating direct wilt integreren. Ik teken een NDA op verzoek.
Welke frameworks en modellen ondersteun je?
LangChain, LangGraph, LlamaIndex, CrewAI of een eenvoudige Python app, draaiend op OpenAI, Anthropic, Llama of elk model achter een API. Als het tekst invoert en tekst of tool calls uit geeft, kan ik het beoordelen.

