Ik doe een red team-test op je llm-agent voor prompt-injectie en geheugenaanvallen


Over deze dienst
Automatische vertaling
Is je LLM-agent veilig om voor echte gebruikers te zetten? Ik val het aan zoals een echte tegenstander dat zou doen en vertel je precies wat er kapot gaat en hoe je het kunt oplossen.
Ik ben een AI-veiligheidsonderzoeker met publicaties op ICML en IJCNLP en arXiv-werk over geheugenaanvallen tegen LLM-agents. Ik heb ook LLM-judge evaluatiebenchmarks ontwikkeld, zodat mijn tests systematisch en reproduceerbaar zijn, niet slechts een paar slimme prompts.
Wat ik test:
- Prompt-injectie (direct en via documenten, webpagina’s of tool-uitvoer)
- Jailbreaks en beleidsdoorbrekingen
- Misbruik van tools en functie-aanroepen
- Geheugen- en contextvergiftiging bij agents met langetermijngeheugen
- Systeemprompt en datalekken
Wat je krijgt:
Een duidelijk geschreven rapport met elke bevinding, een reproduceerbaar voorbeeld, een ernstingsrating en een concrete oplossing. Hogere pakketten voegen de aanvalssuite als code toe zodat je het opnieuw kunt uitvoeren, plus een retest na je patch.
Werkt met OpenAI, Anthropic, open-source modellen, LangChain, LlamaIndex en aangepaste agent stacks. Stuur me eerst een bericht met een korte beschrijving van je agent en ik bevestig de scope. Ik test alleen systemen die jij bezit of waarvoor je toestemming hebt.
Maak kennis met Sidharth P
AI Safety Researcher and LLM Fine Tuning Expert
- Afkomstig uitIndia
- Lid sindsapr 2017
Talen
Telugu, Engels, Hindi
Automatische vertaling
Mijn portfolio
Andere AI-development diensten die ik aanbied
Veelgestelde vragen
Automatische vertaling
Heb je toegang nodig tot mijn productieomgeving?
Nee. Ik kan een staging-kopie, een API-endpoint met een testkey, of een prompt en tool-specificatie die je deelt testen. Ik test alleen systemen die jij bezit of waarvoor je toestemming hebt, en ik heb nooit echte gebruikersgegevens nodig.
Wat moet ik delen om te beginnen?
Een testendpoint of staging-versie van je agent, de systeemprompt, de tools die het kan aanroepen en wat het nooit mag doen. Als het langetermijngeheugen heeft of documenten of webpagina’s leest, vertel het me, want dat zijn veelvoorkomende aanvalspaden.
Houd je mijn systeem en bevindingen vertrouwelijk?
Ja. Je prompts, code, data en bevindingen worden alleen gebruikt voor jouw project en alleen met jou gedeeld. Ik publiceer of hergebruik niets dat specifiek is voor jouw systeem.
Welke modellen en frameworks ondersteun je?
Agents gebaseerd op OpenAI, Anthropic, Gemini of open-source modellen (Llama, Qwen, Mistral en anderen), gebruikmakend van LangChain, LlamaIndex, CrewAI, MCP tools of een aangepaste stack. Als het tekst kan verwerken, kan ik het testen.

