Ik haal gegevens uit pdf's en facturen met ai ocr
AI Engineer: LLM Agents, RAG, Document AI : Computer Vision en Video Analytics
Niveau 1
Voldoet aan bepaalde prestatiecriteria en toont een sterke potentie op de marktplaats.
Over deze dienst
Betaal je nog steeds iemand om gegevens van facturen, bonnetjes, ID's of formulieren handmatig over te typen?
Ik bouw OCR- en Document AI-systemen die je documenten lezen en schone, gestructureerde data direct in je spreadsheet, database of app plaatsen.
WAT IK HAAL
- Facturen en bonnetjes: regelitems, totalen, data, belasting, leveranciersgegevens
- ID- en KYC-documenten: paspoorten, rijbewijzen, nationale ID's
- Contracten en formulieren: clausules, velden, handtekeningen, selectievakjes
- Handgeschreven en gescande documenten, inclusief slechte scans
- Tabellen, zelfs wanneer ze over meerdere pagina's lopen
Elke pipeline bevat validatieregels die fouten opsporen voordat ze bij jou komen, gestructureerde JSON-, CSV- of Excel-uitvoer en een nauwkeurigheidsrapport zodat je weet hoe het presteert op jouw documenten, niet op een demo.
STACK: Python, PaddleOCR, Tesseract, AWS Textract, Google Document AI, Azure Document Intelligence, GPT-4 Vision.
WEET je niet zeker of het op jouw documenten werkt?
Begin met de Proof of Concept. Stuur 3-5 echte documenten en ik laat de extractie zien op JOUW data, met een nauwkeurigheidsrapport, voordat je je aan een volledige build commit.
Stuur me een bericht met 2-3 voorbeelden en de velden die je nodig hebt, en ik vertel je eerlijk wat mogelijk is.
Technologie:
Excel
•
Google Sheets
•
Python
•
Zapier
•
Overige
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Werkt dit op mijn specifieke documenten?
Dat is precies waarvoor het Proof of Concept pakket bedoeld is. Stuur 3-5 van je echte documenten en ik voer de extractie uit en laat je de resultaten zien met een nauwkeurigheidsrapport voordat je je aan iets groters verbindt. Als je documenten niet goed passen, weet je dat voor een klein bedrag.
Welke nauwkeurigheid kan ik verwachten?
Het hangt af van je documenten, en iedereen die je een prijs geeft voordat ze ze hebben gezien, raadt maar wat. Schone digitale PDFs met consistente layouts behalen meestal zeer hoge nauwkeurigheid. Slechte scans, handschrift en sterk variërende layouts zijn moeilijker. Daarom bevat elk pakket een nauwkeurigheidsrapport dat de meetmethode beschrijft.
Krijg ik de broncode en een werkende API?
Ja, vanaf het Standard pakket. Je krijgt de volledige broncode, en het Premium pakket bevat een API plus deployment naar je eigen server, gecontaineriseerd met Docker, en documentatie zodat je team het zelf kan onderhouden.
Zijn mijn documenten vertrouwelijk? Is mijn data veilig?
Ja, en ik zal er duidelijk over zijn. Ik heb alleen voorbeeld documenten nodig, en je kunt gevoelige waarden verwijderen voordat je ze stuurt. Als je documenten helemaal niet door een derde partij verwerkt kunnen worden, kan ik de hele pipeline bouwen met self-hosted open-source OCR zodat niets je infrastructuur verlaat.
Kan je handgeschreven tekst of scans van lage kwaliteit verwerken?
Vaak wel, maar eerlijk gezegd varieert het meer dan bij gedrukte tekst. Handschrift, vervaagde scans, scheve foto's en lage resolutie faxen verminderen allemaal de nauwkeurigheid, en de mate hangt af van je documenten. Pre-processing helpt enorm. Stuur voorbeelden van je slechtste documenten in de Proof of Concept en ik help je verder.
Welke outputformaten krijg ik?
Wat het beste past bij jouw workflow: gestructureerde JSON, CSV, Excel of direct in je database of app via API. Vertel me waar de data naartoe moet en ik lever het in dat formaat, in plaats van dat je zelf een bestand moet converteren.

