Ik maak je rommelige dataset schoon, dedupliceer en normaliseer deze in Excel
Backend engineer voor betalingen, grootboeken en geverifieerde data
Over deze dienst
Het gevaarlijke deel van het schoonmaken van een dataset is niet de rommel die je kunt zien. Het zijn de 412 bijna-duplicaten die je niet ziet.
Twee rijen voor dezelfde klant met verschillende spelling van de naam. Drie productvermeldingen die hetzelfde product zijn. Data in zes formaten, waarvan twee ambigu zijn, waardoor de helft van je tijdlijn stilzwijgend verkeerd is.
Stuur me het bestand. Je krijgt het terug schoon, plus een wijzigingsrapport: rijen erin, rijen eruit, wat is samengevoegd, en elke rij die ik heb aangepast. Niets verdwijnt zonder dat in dat rapport te zien is.
Over bijna-duplicaten: ik markeer ze standaard voor jouw review in plaats van ze automatisch samen te voegen. Jij kent je data. Stilzwijgend twee rijen samenvoegen die er vergelijkbaar uitzien, is hoe een schone dataset een verkeerde wordt, en je komt er nooit achter.
Wat ik fix: exacte en fuzzy duplicates, inconsistente datums en getalformaten, gemengde valuta's, hoofdletters en spaties, gesplitste of samengevoegde kolommen, kapotte encodings, onjuiste URL's en codes, ontbrekende waarden, en het samenvoegen van meerdere bestanden tot één consistente dataset.
CSV, XLSX, JSON, TSV. Geen scraping betrokken - dit is je data, verwerkt.
Veelgestelde vragen
Automatische vertaling
Verwijder je rijen zonder het me te vertellen?
Nee. Elke verwijderde of aangepaste rij verschijnt in het wijzigingsrapport, en alles wat ambigu is wordt gemarkeerd voor jouw beslissing in plaats van stilzwijgend aangepast. Je kunt altijd reconstructie maken van wat ik heb gedaan.
Zijn mijn gegevens vertrouwelijk?
Ja. Alleen gebruikt voor jouw bestelling, nooit gedeeld, verwijderd 90 dagen na levering tenzij je anders vraagt. Als je het eerder wilt laten verwijderen, zeg het en ik bevestig wanneer het klaar is.
Wat telt als een duplicate in mijn data?
Jij vertelt het me, of ik stel een regel voor en jij bevestigt voordat ik het uitvoer. Zelfde e-mail, zelfde bedrijfsnaam, zelfde SKU, fuzzy titelgelijkenis - elk geeft een ander antwoord, en verkeerd kiezen vernietigt stilletjes rijen. Ik vraag liever eerst.
Mijn bestand is groter dan het top pakket.
Stuur me het aantal rijen en ik geef een offerte. Grote bestanden zijn meestal goedkoper per rij, niet duurder, en ik prijs het liever goed dan dat je het moet splitsen in bestellingen die niet passen.
Scrap je ook de data, of alleen schoonmaken wat ik heb?
Deze dienst is voor datasets die je al hebt, van waar je ze ook hebt. Als je de data eerst van openbare bronnen wilt verzamelen, stuur me dan een bericht en ik vertel je eerlijk of het haalbaar is voordat je iets bestelt.
