Ik evalueer en vergelijk je llm-systeem en ai-uitvoer

S
samanazharr
S
samanazharr
Saman A.
Sommige informatie is automatisch vertaald.

Over deze dienst

Automatische vertaling

Als een Machine Learning Engineer die gespecialiseerd is in NLP en symbolische AI, bied ik uitgebreide evaluatie, benchmarking en red-teaming voor je Large Language Models (LLMs) en RAG-pijplijnen. Ik help engineeringteams om edge-case failures te identificeren, hallucinaties te elimineren en strikte beveiligingsmaatregelen te handhaven.


Wat ik aanbied:

  • LLM Benchmark & Prestatie-auditing: Evaluatie van modelnauwkeurigheid, latency, contextgebruik en redeneervermogen op basis van aangepaste testkaders.
  • Hallucinatie- & Edge-Case Detectie: Stress-testen van systeem prompts, RAG retrieval nauwkeurigheid en feitelijke consistentie onder adversariale omstandigheden.
  • Red Teaming & Beveiligingstesten: Identificeren van kwetsbaarheden zoals prompt injectie aanvallen, jailbreaks en leaks van systeem prompts.
  • Schema- & Uitvoervalidatie: Verifiëren van strikte JSON/Pydantic structuurconformiteit, uitvoering van functieaanroepen en betrouwbaarheid van API-integraties.
  • Gedetailleerd auditrapport & actielijst: Uitgebreide foutenanalyse met praktische prompt engineering oplossingen en aanbevelingen voor guardrails.

Maak kennis met Saman A.

Saman A.

Data Annotation and LLM QA Expert

  • Afkomstig uitPakistan
  • Lid sindsfeb 2026
  • Gem. reactietijd1 uur
  • Talen

    Engels, Urdu
I am a Machine Learning Engineer specializing in NLP, with hands-on experience building, evaluating, and deploying production-grade LLM systems. My background spans the full pipeline: from dataset curation and prompt engineering to security auditing, hallucination mitigation, and containerized deployment. Recently, my work focuses on LLM Evaluation & Alignment: refining model outputs through rigorous fact-checking, benchmark testing, prompt injection defense, and human-in-the-loop quality control.

Automatische vertaling

Mijn portfolio