Ik verzamel en schoon QA-gegevens voor llm en ai training
Python ontwikkelaar, Web Scraping en Data Analyse expert
Over deze dienst
Heb je schone, gestructureerde Q&A-gegevens nodig om een AI/LLM-model te finetunen of trainen?
Ik bouw datacollectie-pijplijnen die vraag-en-antwoordparen ophalen uit openbare, API-gebaseerde bronnen (geen fragiele HTML-scraping), de tekst schoonmaken, lage kwaliteit of PII-inhoud filteren en kant-en-klare instructie/antwoord JSONL leveren in het exacte formaat dat wordt gebruikt om modellen zoals GPT en Llama te finetunen.
Wat je krijgt:
- Schoon, gededupliceerd Q&A-paar in JSONL-formaat
- HTML verwijderd, codeblokken behouden, witruimte genormaliseerd
- Kwaliteitsfiltering (score-drempels, minimale lengte, PII-screening)
- Volledige bronvermelding voor licentiecompliance
- Een statistiekrapport (datasetgrootte, gemiddelde lengte, scoreverdeling)
Ik gebruik officiële publieke APIs in plaats van sites te scrapen die dat verbieden (zoals Reddit/Quora), zodat jouw dataset schoon, legaal en betrouwbaar is.
Vertel me je onderwerp/domein en hoeveel records je nodig hebt, en ik bevestig de scope voordat je bestelt.
Expertise:
Overige
Programmeertaal:
Python
Tools:
Jupyter-notitieboek
Veelgestelde vragen
Automatische vertaling
Van welke bronnen verzamel je?
Openbare, gedocumenteerde APIs (bijvoorbeeld Stack Exchange) die expliciet deze soort verzameling toestaan — niet platforms die dat verbieden door te scrapen.
In welk formaat wordt de data geleverd?
JSONL (instructie/antwoord paren), het standaardformaat voor het finetunen van LLM. CSV/JSON is ook op aanvraag beschikbaar.
Kun je een aangepast onderwerp/domein doen?
Ja — stuur me je onderwerp en het gewenste aantal records voordat je bestelt, zodat ik de haalbaarheid kan bevestigen.

