Demurrit Cargo Intelligence

Analys

Varför de flesta dokumentläsningsverktyg går sönder vid formatändringar

Publicerad: 2026-09-02

Skrivet av Natys Vytautas, grundare av UAB NVGroup.

Ett traditionellt dokumentläsningsverktyg (OCR) arbetar utifrån en mall: det lär sig en specifik dokumentlayout, och så länge dokumentet ser exakt likadant ut fungerar det bra. Byt transportör, byt land, eller låt samma transportör uppdatera sitt formulär — mallen slutar fungera, och någon måste konfigurera om den för hand.

CMR-fraktsedlar, SMGS/CIM-järnvägsdokument och B/L-sjöfraktsmanifest delar alla ett drag: de utfärdas av hundratals olika länder, transportörer och system, av vilka inget är skyldigt att följa en identisk visuell layout. Det är exakt där mallbaserad OCR går sönder oftast.

Ett annat angreppssätt: att läsa betydelse, inte position

Vårt system letar inte efter "viktfältet i rad tre, kolumn fyra" — det läser dokumentet som en person skulle, och känner igen vem avsändaren är, vem mottagaren är, vad vikten är, oavsett var på sidan det står. Det innebär:

Var systemet erkänner vad det inte vet — och varför det är en styrka

Varje extraktion får en konfidenspoäng, beräknad utifrån hur många av de nödvändiga datafälten som faktiskt fylldes i — inte ett fast tal som tillämpas på varje dokument. När ett dokument är ovanligt, av dålig kvalitet eller helt enkelt mer komplext än normalt, gissar systemet inte — det flaggar det för manuell granskning. Det kan låta som en begränsning, men det är motsatsen: det är ett skydd mot att ett tyst, obemärkt fel hamnar i er rapport som "korrekt."

Språk är inget hinder

Eftersom systemet läser betydelse snarare än position hanterar det latinsk skrift, kyrilliska eller logografiska skriftsystem lika bra, utan separat konfiguration per språk — samma modul behandlar en engelsk CMR-fraktsedel, en rysk SMGS-накладная och ett B/L på kinesisk skrift. Vi verifierade detta med realistiska dokumentprov i båda skrifttyper — nyckelidentifierare extraherades korrekt, och systemet bedömde sin egen konfidens korrekt i varje fall.

Vad som bevaras för revisionsändamål

För varje extraherad datapunkt behåller systemet också det ursprungliga textfragment den kom ifrån — inte bara slutresultatet. Det betyder att ni alltid kan spåra exakt var ett specifikt tal eller namn kom ifrån, istället för att bara lita på en svart låda.

B/L-gränsen — en medveten sådan

För sjöfraktsmanifest extraherar systemet data endast för internt bruk — det bekräftar inte ett dokuments juridiska giltighet eller äganderättsstatus. Det är en medveten linje: datautvinning och juridisk dokumentbekräftelse är två olika saker, och att hålla den gränsen tydlig skyddar både er och oss från felplacerat förtroende där det inte hör hemma.

Relaterade artiklar:

Hur mycket tid förlorar en speditör på manuell CMR-inmatning? →

Bränslestöld i fordonsflottan: upptäck det med data, inte misstankar →

B/L-datautvinning utan juridisk risk: vad som ska automatiseras och vad som inte ska →

Läs mer om CMR-modulen
Boka samtal