Ik maak je rommelige dataset schoon, dedupliceer en normaliseer deze in Excel

Sommige informatie is automatisch vertaald.

Venezuela

Ik spreek Spaans, Engels

Backend engineer voor betalingen, grootboeken en geverifieerde data

Ik bouw het deel van de software waar geld niet fout mag gaan. Sinds 2019 ben ik de backend engineer achter een cross-border payments platform: remittances, wallets, multi-provider payouts en een doub...
Over deze dienst

Het gevaarlijke deel van het schoonmaken van een dataset is niet de rommel die je kunt zien. Het zijn de 412 bijna-duplicaten die je niet ziet.


Twee rijen voor dezelfde klant met verschillende spelling van de naam. Drie productvermeldingen die hetzelfde product zijn. Data in zes formaten, waarvan twee ambigu zijn, waardoor de helft van je tijdlijn stilzwijgend verkeerd is.


Stuur me het bestand. Je krijgt het terug schoon, plus een wijzigingsrapport: rijen erin, rijen eruit, wat is samengevoegd, en elke rij die ik heb aangepast. Niets verdwijnt zonder dat in dat rapport te zien is.


Over bijna-duplicaten: ik markeer ze standaard voor jouw review in plaats van ze automatisch samen te voegen. Jij kent je data. Stilzwijgend twee rijen samenvoegen die er vergelijkbaar uitzien, is hoe een schone dataset een verkeerde wordt, en je komt er nooit achter.


Wat ik fix: exacte en fuzzy duplicates, inconsistente datums en getalformaten, gemengde valuta's, hoofdletters en spaties, gesplitste of samengevoegde kolommen, kapotte encodings, onjuiste URL's en codes, ontbrekende waarden, en het samenvoegen van meerdere bestanden tot één consistente dataset.


CSV, XLSX, JSON, TSV. Geen scraping betrokken - dit is je data, verwerkt.