Ik maak een massale dataset voor ai training
Python-ontwikkelaar, data-extractiespecialist
Gescreend door Fiverr Pro
Kawsar is geselecteerd door het team van Fiverr Pro vanwege diens expertise.
Gescreend voor
Data scraping
Gegevensverwerking
Over deze dienst
Je hebt een grote, schone dataset nodig om een AI-model te trainen of fijn af te stemmen, niet een rommelige scrape dump of een klein voorbeeldbestand.
Dat is het werk dat ik doe. Ik ben Kawsar, een Python ontwikkelaar die data scraping bouwt voor massale datasets voor AI training uit openbare bronnen, synthetische generatie en gestructureerde CSV- of JSON-exporten.
Wat ik lever:
- Op maat gemaakte AI training datasets, passend bij jouw pakket en schema
- Openbare webverzameling en/of synthetische rijen wanneer privacy-veilige data nodig is
- Schone CSV, JSON of Excel klaar voor ML en LLM voorbereiding
- Veldmapping, basis deduplicatie en een korte data woordenlijst
- Optioneel Python verzamel script op Premium
- Gratis voorbeeldrijen voordat de volledige build, zodat je eerst het schema kunt goedkeuren
- JSONL export klaar voor LLM fine-tuning (OpenAI, Hugging Face en Llama-achtige formaten)
Ik bouw op maat gemaakte datasets voor ML en AI teams. Het volume hangt af van het pakket en de moeilijkheid van de bron. Alleen openbare data.
Stuur me je schema, doelvolume en gebruiksgeval voordat je bestelt.
OPMERKING:
- Alleen openbare data. Koper levert schema en doel-URL's bij scraping
- Op maat gemaakt per bestelling
- Geen persoonlijke data verzamelen
- Geen school- of universiteitsopdrachten
Platform:
MySQL
•
PL/SQL
•
PostgreSQL
•
SQLite
•
SQL Server
Expertise:
Design
•
Normalisatie
•
SQL
•
NoSQL
•
Prestaties
Klanten waar ik mee heb gewerkt
MyHeritage
Internet Software & Services
I've been hired to carry out certain web extraction-related jobs in order to build a database for user reviews, which will be used to develop the product and make changes in certain instances.
mei 2022-mei 2023
Fiverr
Internet Software & Services
The project was to gather a detailed list of 5000 keywords from various profession types and list their Google Rank, Link, and even Local Search Results, etc. Information and make a Report with these!
jul 2024
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Wat voor soort datasets maak je?
Gestructureerde AI training datasets voor ML en LLM voorbereiding: tabellarische CSV/JSON, tekstcorpora en verzamelingen uit openbare bronnen. Beeldrijke CV-labeling kan worden ingeschat wanneer het past.
Scrap je het web of genereer je synthetische data?
Beide. We kiezen voor openbare verzameling, synthetische generatie of een mix op basis van jouw schema, privacybehoeften en doelvolume.
Train je mijn model ook?
Deze dienst is voor het maken van de dataset. Modeltraining en LLM fine-tuning zijn aparte diensten als je dat nodig hebt.
Welke bestanden krijg ik?
CSV, JSON, JSONL of Excel plus een korte data woordenlijst. Premium kan een Python script bevatten dat wordt gebruikt om de set te bouwen of te vernieuwen.
Moet ik een schema aanleveren?
Ja. Stuur kolomnamen, labels, formaten en voorbeeldrijen als je die hebt. Zo blijft de dataset model-klaar.
Wordt LoRA of AI influencer dataset werk inbegrepen?
Nee. Deze dienst is voor ML/AI trainingsdata, niet voor influencer LoRA packs.
Is dit voor school- of universiteitsopdrachten?
Nee. Ik doe geen school- of universiteitsopdrachten.

