Ik verzamel en schoon QA-gegevens voor llm en ai training

Sommige informatie is automatisch vertaald.

Pakistan

Ik spreek Urdu, Engels

Python ontwikkelaar, Web Scraping en Data Analyse expert

Heb je web data nodig of rommelige spreadsheets die opgeschoond moeten worden tot duidelijke inzichten? Ik ben een Python-ontwikkelaar die gespecialiseerd is in data scraping, cleaning en analyse me...
Over deze dienst

Heb je schone, gestructureerde Q&A-gegevens nodig om een AI/LLM-model te finetunen of trainen?

Ik bouw datacollectie-pijplijnen die vraag-en-antwoordparen ophalen uit openbare, API-gebaseerde bronnen (geen fragiele HTML-scraping), de tekst schoonmaken, lage kwaliteit of PII-inhoud filteren en kant-en-klare instructie/antwoord JSONL leveren in het exacte formaat dat wordt gebruikt om modellen zoals GPT en Llama te finetunen.

Wat je krijgt:

  • Schoon, gededupliceerd Q&A-paar in JSONL-formaat
  • HTML verwijderd, codeblokken behouden, witruimte genormaliseerd
  • Kwaliteitsfiltering (score-drempels, minimale lengte, PII-screening)
  • Volledige bronvermelding voor licentiecompliance
  • Een statistiekrapport (datasetgrootte, gemiddelde lengte, scoreverdeling)

Ik gebruik officiële publieke APIs in plaats van sites te scrapen die dat verbieden (zoals Reddit/Quora), zodat jouw dataset schoon, legaal en betrouwbaar is.

Vertel me je onderwerp/domein en hoeveel records je nodig hebt, en ik bevestig de scope voordat je bestelt.

Expertise:

Overige

Programmeertaal:

Python

Tools:

Jupyter-notitieboek