Demurrit Cargo Intelligence

Analyse

Hvorfor de fleste dokumentlæsningsværktøjer bryder sammen ved formatændringer

Udgivet: 2026-09-02

Skrevet af Natys Vytautas, stifter af UAB NVGroup.

Et traditionelt dokumentlæsningsværktøj (OCR) arbejder ud fra en skabelon: det lærer ét specifikt dokumentlayout, og så længe dokumentet ser nøjagtigt ens ud, fungerer det fint. Skift transportør, skift land, eller lad samme transportør opdatere deres formular — skabelonen holder op med at virke, og nogen skal omkonfigurere den manuelt.

CMR-fragtbreve, SMGS/CIM-jernbanedokumenter og B/L-søfragtmanifester deler alle ét træk: de udstedes af hundredvis af forskellige lande, transportører og systemer, hvoraf ingen er forpligtet til at følge et identisk visuelt layout. Det er præcis der, skabelonbaseret OCR bryder sammen oftest.

En anden tilgang: at læse betydning, ikke position

Vores system leder ikke efter "vægtfeltet i række tre, kolonne fire" — det læser dokumentet, som en person ville, og genkender, hvem afsenderen er, hvem modtageren er, hvad vægten er, uanset hvor på siden det er skrevet. Det betyder:

Hvor systemet erkender, hvad det ikke ved — og hvorfor det er en styrke

Hvert udtræk får en konfidensscore, beregnet ud fra hvor mange af de påkrævede datafelter der faktisk blev udfyldt — ikke et fast tal anvendt på hvert dokument. Når et dokument er usædvanligt, af dårlig kvalitet eller simpelthen mere komplekst end normalt, gætter systemet ikke — det markerer det til manuel gennemgang. Det kan lyde som en begrænsning, men det er det modsatte: det er beskyttelse mod, at en stille, ubemærket fejl ender i din rapport som "korrekt."

Sprog er ikke en barriere

Fordi systemet læser betydning frem for position, håndterer det latinsk skrift, kyrillisk eller logografiske skriftsystemer lige godt, uden separat konfiguration pr. sprog — samme modul behandler et engelsk CMR-fragtbrev, en russisk SMGS-накладная og et B/L på kinesisk skrift. Vi verificerede dette med realistiske dokumenteksempler i begge skrifttyper — nøgleidentifikatorer blev udtrukket præcist, og systemet vurderede korrekt sin egen konfidens i hvert tilfælde.

Hvad der bevares til revisionsformål

For hvert udtrukket datapunkt beholder systemet også det oprindelige tekstfragment, det stammer fra — ikke kun det endelige resultat. Det betyder, at du altid kan spore præcis, hvor et bestemt tal eller navn kom fra, i stedet for blot at stole på en sort boks.

B/L-grænsen — en bevidst en

For søfragtmanifester udtrækker systemet data kun til internt brug — det bekræfter ikke et dokuments juridiske gyldighed eller ejerskabsstatus. Det er en bevidst linje: dataudtræk og juridisk dokumentbekræftelse er to forskellige ting, og at holde den grænse klar beskytter både dig og os mod misplaceret tillid, hvor den ikke hører hjemme.

Relaterede artikler:

Hvor meget tid mister en speditør på manuel CMR-indtastning? →

Brændstoftyveri i vognparken: opdag det med data, ikke mistanke →

B/L-dataudtræk uden juridisk risiko: hvad man automatiserer, og hvad man ikke gør →

Læs mere om CMR-modulet
Book en samtale