Ik bereid je dataset voor op llm fine tuning of rag ingestie

Sommige informatie is automatisch vertaald.

Pakistan

Ik spreek Urdu, Engels

Los de oorzaak op, niet de symptoom

Ik ben een Full Stack Developer die zich specialiseert in AI, automatisering en moderne webapplicaties. Ik ontwikkel AI-assistenten, LLM-integraties, RAG-systemen, SaaS-platforms, React/Next.js apps, ...
Over deze dienst

Ik maak je dataset schoon en prepareer deze voor LLM fine-tuning of RAG ingestie, geëxporteerd in het formaat dat je trainer verwacht (JSONL / Parquet / HuggingFace / OpenAI / Axolotl / LLaMA-Factory).


Wat je krijgt:

Ontbrekende waarden behandeld, dedupliceer (exact + fuzzy), outliers aangepakt

Label audit + gestratificeerde train/val/test splits

Tekst schoonmaak: HTML strip, Unicode normaliseren, taal detectie

Formaat export voor HuggingFace Datasets, OpenAI JSONL, Axolotl, of LLaMA-Factory

Data validatie rapport (Great Expectations)


Stack: Pandas, NumPy, Polars, LangChain, LlamaIndex, HuggingFace Datasets.


Dataset grootte: 50K rijen (Basic) / 500K rijen (Standaard) / 5M rijen (Premium). RAG chunking + embedding export inbegrepen bij Premium.


Stuur me een bericht met één zin over je use case, ik reageer binnen 2 uur met een vaste prijs.

Programmeertaal:

Python

AI model frameworks en tools:

Hugging Face Transformers

PyTorch

Datatype:

Tekst

AI engine:

GPT

Llama

Overige