Ik bouw een evaluation harness voor een ai agent met regressietests


Over deze dienst
Automatische vertaling
Jouw agent slaagde voor de demo. Toen veranderde een prompt, werd een modelversie doorgevoerd, en niemand merkte het totdat een gebruiker het ontdekte.
Ik bouw de evaluation harness die het als eerste oppikt.
WAT JE KRIJGT
- Een failure taxonomy geschreven voor JOUW agent, niet een generieke checklist
- Een uitvoerbare eval harness met benoemde metrics: taakvoltooiing, tool-call correctheid, argumentcorrectheid, trouw, latency, kosten
- Regressietests die falen op de exacte gedragingen die jij belangrijk vindt
- Een technisch rapport dat je kunt doorsturen naar je CTO
- Alles in jouw repo, jouw framework, jouw eigendom
VOOR WIE DIT IS
Teams die al een LLM-agent gebruiken die niet kunnen antwoorden: "Heeft die verandering het erger gemaakt?"
HOE HET WERKT
1. Je stuurt de repo of API van je agent, plus 3 failures die je irriteren
2. Ik reproduceer ze en breng de failure surface in kaart
3. Ik bouw en run de harness, en geef je een walkthrough
Ik bouw geen agents. Ik maak bestaande agents testbaar.
Vertel me je stack voordat je bestelt, dan bevestig ik of het past, of vertel ik je eerlijk dat je dit nog niet nodig hebt.
Maak kennis met Janak G
AI Automation Engineer
- Afkomstig uitIndia
- Lid sindsjul 2026
- Gem. reactietijd1 uur
Talen
Engels
Automatische vertaling
Mijn portfolio
Andere AI-development diensten die ik aanbied
Veelgestelde vragen
Automatische vertaling
Bouw je de agent voor mij?
Nee. Deze service test en verstevigt een agent die je al hebt. Als je er een nodig hebt die gebouwd moet worden, ben ik niet de juiste verkoper en zal ik dat aangeven voordat je bestelt, niet achteraf.
Wat heb je van mij nodig om te beginnen?
Repo-toegang of een callable endpoint, 3 voorbeeld failures die je irriteren, jouw framework en modelprovider, en ongeveer 30 minuten van een technische persoon bij kickoff.
Ondersteun je framework?
Elke Python- of TypeScript-stack voor agents, inclusief LangChain, LlamaIndex, OpenAI SDK, en maatwerk orchestratie. Vertel me je stack voordat je bestelt, dan bevestig ik of het past in schrift.
Zul je de gevonden bugs oplossen?
Alleen basisdiagnoses en tests. Standaard en Premium omvatten fixes binnen de afgesproken scope, en elke fix wordt geleverd met een test die eerst faalde en daarna slaagt. Geen fix wordt claimd zonder dat bewijs.
Kan je garanderen dat mijn agent nauwkeuriger wordt?
Nee, en ik claim dat ook niet. Nauwkeurigheid hangt af van je agent en je data. Wat ik wel garandeer is dat je het kunt meten, en dat regressies zichtbaar worden in plaats van stil te blijven.
Zijn mijn code en data vertrouwelijk?
Ja. Je code, prompts en data worden nooit hergebruikt, opnieuw gepubliceerd, of opgenomen in portfolio zonder jouw schriftelijke toestemming. Portfolio werk gebruikt mijn eigen demo agents.
Wat als ik bestel en het blijkt dat ik dit niet nodig heb?
Stuur me eerst een bericht en ik beoordeel de geschiktheid gratis. Als je al hebt besteld en het echt niet past, annuleer ik de opdracht zelf voordat ik begin met werken.
Hoe werkt het maandprogramma?
Premium is maand 1. Maanden 2 tot 6 kosten 390 dollar per maand, gefactureerd als abonnement waar mogelijk of als maandaanbieding anders. Het eindigt na 6 maanden en verlenging is een nieuwe beslissing, nooit automatisch.
Hoe snel kunt u leveren?
Basic 4 dagen, Standaard 7, Premium 10, gerekend in werkdagen vanaf volledige requirements. Snellere opties bestaan als extra's wanneer ik capaciteit heb. Ik geef data waarop ik kan houden, niet data die goed klinken.

