Analyse
Waarom de meeste documentherkenningstools breken bij formaatwijzigingen — en hoe dit te vermijden
Gepubliceerd: 2026-09-01
Artikel geschreven door Natys Vytautas, directeur UAB NVGroup.
Een traditionele documentherkenningstool (OCR) werkt volgens een sjabloon: de layout van één specifiek document wordt geleerd, en zolang het document er precies hetzelfde uitziet — werkt alles. Verandert de vervoerder, verandert het land, werkt zelfs dezelfde vervoerder zijn formulier bij — de sjabloon stopt met werken, en iemand moet hem handmatig opnieuw configureren.
CMR-vrachtbrieven, SMGS/CIM-spoordocumenten en B/L-zeevrachtmanifesten hebben één gemeenschappelijk kenmerk: ze worden uitgegeven door honderden verschillende landen, vervoerders en systemen, en geen enkele is verplicht een identieke visuele lay-out aan te houden. Precies hier breekt sjabloon-OCR het vaakst.
Een andere aanpak: betekenis lezen, niet positie
Ons systeem zoekt niet naar "het gewichtsveld in rij drie, kolom vier" — het leest het document zoals een mens dat zou doen, door te herkennen wie de afzender is, wie de geadresseerde, wat het gewicht is, ongeacht op welke plek van de pagina dit staat geschreven. Dat betekent:
- Een nieuw vervoerdersformaat mag het systeem niet breken. Er hoeft niet te worden gewacht tot iemand handmatig een nieuwe sjabloon configureert voor elke nieuwe documentvariant.
- Drie modules (CMR, spoor, zeevracht) delen dezelfde architecturale logica, aangepast aan de specifieke kenmerken van elk documenttype — een verbetering op één plek komt alle drie ten goede.
Waar het systeem zelf onwetendheid toegeeft — en waarom dit een voordeel is
Elke extractie krijgt een betrouwbaarheidsscore, berekend op basis van hoeveel van de vereiste gegevensvelden daadwerkelijk konden worden ingevuld — geen vast getal, gelijk voor alle documenten. Wanneer een document ongebruikelijk, van slechte kwaliteit of gewoon complexer dan gebruikelijk is — gokt het systeem niet, maar markeert het voor handmatige controle. Dat klinkt misschien als een beperking, maar is precies het tegenovergestelde: het is een bescherming tegen een stille, onopgemerkte fout die anders als "correct" in uw rapport terecht zou komen.
Taal is geen belemmering
Omdat het systeem betekenis leest, niet positie, kan het net zo goed werken met Latijns, Cyrillisch of ander schrift, zonder aparte aanpassing per taal — dezelfde module verwerkt zowel een CMR-vrachtbrief in het Nederlands als een SMGS-накладная in het Russisch als een B/L in Chinese karakters. We hebben dit getest met realistische documentvoorbeelden in beide talen — de belangrijkste identificatiegegevens werden nauwkeurig geëxtraheerd, en het systeem beoordeelde zijn eigen betrouwbaarheid in elk geval correct.
Wat wordt bewaard voor auditdoeleinden
Voor elk geëxtraheerd gegevenspunt bewaart het systeem ook het originele tekstfragment waaruit het is geëxtraheerd — niet alleen het eindresultaat. Dat betekent dat u altijd kunt teruggaan en controleren waar precies een specifiek getal of een naam vandaan komt, in plaats van alleen op een "zwarte doos" te vertrouwen.
De B/L-specifieke grens — bewust aangehouden
Bij zeevrachtmanifesten extraheert het systeem gegevens alleen voor intern gebruik — het bevestigt niet de juridische geldigheid of eigendomsstatus van het document. Dit is een bewuste grens: data-extractie en juridische documentbevestiging zijn twee verschillende zaken, en een duidelijke scheiding daartussen beschermt zowel u als ons tegen onterecht vertrouwen waar dat niet gepast zou zijn.