Analyysi
Miksi useimmat asiakirjojenlukutyökalut hajoavat muotoilun muuttuessa
Julkaistu: 2026-09-02
Kirjoittanut Natys Vytautas, UAB NVGroupin perustaja.
Perinteinen asiakirjojenlukutyökalu (OCR) toimii mallin pohjalta: se oppii yhden tietyn asiakirja-asettelun, ja niin kauan kuin asiakirja näyttää täsmälleen samalta, se toimii hyvin. Vaihda kuljetusyritys, vaihda maa, tai anna saman kuljetusyrityksen päivittää lomakkeensa — malli lakkaa toimimasta, ja jonkun on konfiguroitava se uudelleen käsin.
CMR-rahtikirjoilla, SMGS/CIM-rautatieasiakirjoilla ja B/L-merirahtimanifesteilla on kaikilla yksi yhteinen piirre: niitä antavat sadat eri maat, kuljetusyritykset ja järjestelmät, joista mikään ei ole velvollinen noudattamaan identtistä visuaalista asettelua. Juuri siinä mallipohjainen OCR hajoaa useimmin.
Erilainen lähestymistapa: merkityksen lukeminen, ei sijainnin
Järjestelmämme ei etsi "painokenttää rivi kolme, sarake neljä" — se lukee asiakirjan kuten ihminen lukisi, tunnistaen kuka lähettäjä on, kuka vastaanottaja on, mikä paino on, riippumatta siitä, missä kohtaa sivua se on kirjoitettu. Se tarkoittaa:
- Uuden kuljetusyrityksen formaatin ei pitäisi rikkoa järjestelmää. Ei tarvitse odottaa, että joku konfiguroi käsin uuden mallin jokaiselle uudelle asiakirjavariaatiolle.
- Kaikki kolme moduulia (CMR, rautatie, meri) jakavat saman taustalla olevan arkkitehtuurin, sovitettuna kunkin asiakirjatyypin erityispiirteisiin — yhdessä paikassa tehty parannus hyödyttää kaikkia kolmea.
Missä järjestelmä myöntää, mitä se ei tiedä — ja miksi se on vahvuus
Jokainen poiminta saa luottamuspisteytyksen, joka lasketaan sen perusteella, kuinka moni vaadituista datakentistä todella täytettiin — ei kiinteän luvun perusteella, jota sovelletaan jokaiseen asiakirjaan. Kun asiakirja on epätavallinen, huonolaatuinen tai yksinkertaisesti tavallista monimutkaisempi, järjestelmä ei arvaa — se merkitsee sen manuaalisesti tarkistettavaksi. Tämä saattaa kuulostaa rajoitukselta, mutta se on päinvastoin: se on suoja sitä vastaan, että hiljainen, huomaamaton virhe päätyy raporttiinne "oikeana."
Kieli ei ole este
Koska järjestelmä lukee merkitystä eikä sijaintia, se käsittelee latinalaista kirjaimistoa, kyrillistä tai logografisia kirjoitusjärjestelmiä yhtä hyvin, ilman erillistä kielikohtaista konfigurointia — sama moduuli käsittelee englanninkielisen CMR-rahtikirjan, venäjänkielisen SMGS-накладная-asiakirjan ja kiinankielisen B/L:n. Vahvistimme tämän realistisilla asiakirjanäytteillä molemmilla kirjoitusjärjestelmillä — avaintunnisteet poimittiin tarkasti, ja järjestelmä arvioi oikein oman luottamustasonsa jokaisessa tapauksessa.
Mitä säilytetään tarkastustarkoituksiin
Jokaiselle poimitulle datapisteelle järjestelmä säilyttää myös alkuperäisen tekstikatkelman, josta se on peräisin — ei vain lopputulosta. Tämä tarkoittaa, että voitte aina jäljittää tarkalleen, mistä tietty luku tai nimi tuli, sen sijaan että luottaisitte pelkkään mustaan laatikkoon.
B/L-raja — tarkoituksellinen sellainen
Merirahtimanifesteille järjestelmä poimii dataa vain sisäiseen käyttöön — se ei vahvista asiakirjan oikeudellista pätevyyttä tai omistusoikeuden statusta. Tämä on tarkoituksellinen raja: datan poiminta ja oikeudellinen asiakirjan vahvistus ovat kaksi eri asiaa, ja tämän rajan pitäminen selkeänä suojaa sekä teitä että meitä väärään paikkaan kohdistetulta luottamukselta.