Ik haal PDF-tekst en tabellen uit in een schoon geverifieerd Excel-bestand

Sommige informatie is automatisch vertaald.

India

Ik spreek Hindi, Engels

PDF- en webdata naar schoon, geverifieerd Excel

Ik zet ongestructureerde bronnen om in spreadsheets die je daadwerkelijk kunt gebruiken: PDFs en webpagina's in gestructureerd Excel, rommelige exports in schone, gededupliceerde data, raw transacties...
Over deze dienst

Stuur me een PDF en krijg een spreadsheet terug waarmee je daadwerkelijk kunt werken.


WAT JE KRIJGT

Een enkel .xlsx-bestand met een Text-blad (de lopende tekst van je document, in leesvolgorde, regelafbrekingen behouden) en een Tables-blad (elke tabel, rij voor rij, uitlijning intact). Cijfers worden als cijfers weergegeven, zodat ze meteen kunnen worden opgeteld en gefilterd in plaats van als tekst te blijven staan.


WAT IK DOE DAT DE MEESTEN NIET DOEN

Kopteksten, voetteksten en paginanummers worden verwijderd op basis van positie, niet door string matching - paginanummers veranderen op elke pagina, dus tekstmatching mist ze. Alles dat binnen je body copy verschijnt, blijft. Spanning van headercellen wordt ingevuld in plaats van leeg gelaten, wat meestal de uitlijning van kolommen stilletjes verbreekt.


VERIFICATIE

Waar je document zijn eigen totalen aangeeft, reken ik ze opnieuw uit op basis van de geëxtraheerde rijen en laat ik je de vergelijking zien. Je kunt de extractie controleren, niet alleen vertrouwen op de uitkomst.


VOORDAT JE BESTELT

Stuur me eerst een voorbeeldpagina. Ik vertel je eerlijk of het goed wordt geparseerd - gescande of alleen-afbeeldingen-PDF's hebben OCR nodig en dat zeg ik voordat je bestelt.

Technologie:

Excel

•

Google Sheets

Branche:

Financiële diensten en zakelijk

•

Vastgoed

Datatype:

Numeriek

•

Reeks

•

datum

•

Valuta