Analīze
Kāpēc lielākā daļa dokumentu lasīšanas rīku salūzt, mainoties formātam -- un kā no tā izvairīties
Rakstu sarakstīja Natys Vytautas, UAB NVGroup vadītājs.
Tradicionāls dokumentu lasīšanas (OCR) rīks darbojas pēc šablona: tas iemācās vienu konkrētu dokumenta izkārtojumu, un, kamēr dokuments izskatās tieši tāpat, viss darbojas labi. Mainās pārvadātājs, mainās valsts, vai tas pats pārvadātājs atjaunina savu veidlapu -- šablons pārstāj darboties, un kādam tas jāpārkonfigurē manuāli.
CMR pavadzīmēm, SMGS/CIM dzelzceļa dokumentiem un jūras kravu B/L manifestiem ir viena kopīga iezīme: tos izsniedz simtiem dažādu valstu, pārvadātāju un sistēmu, no kurām nevienai nav pienākuma ievērot identisku vizuālo izkārtojumu. Tieši tur šablonu OCR salūzt visbiežāk.
Cita pieeja: lasīt nozīmi, nevis pozīciju
Mūsu sistēma nemeklē "svara lauku trešajā rindā, ceturtajā kolonnā" -- tā lasa dokumentu tā, kā to lasītu cilvēks, atpazīstot, kurš ir nosūtītājs, kurš saņēmējs, kāds ir svars, neatkarīgi no tā, kurā lapas vietā tas rakstīts. Tas nozīmē:
- Jauns pārvadātāja formāts nedrīkst salauzt sistēmu. Nav jāgaida, kamēr kāds manuāli konfigurēs jaunu šablonu katram jaunam dokumenta variantam.
- Visi trīs moduļi (CMR, dzelzceļš, jūra) izmanto to pašu pamata arhitektūru, pielāgotu katra dokumenta tipa specifikai -- uzlabojums, kas veikts vienā vietā, dod labumu visiem trim.
Sistēmas arhitektūra balstīta uz semantisku lasīšanu, nevis fiksētiem šabloniem -- tas nozīmē, ka tā vienlīdz labi spēj strādāt ar latīņu, kirilicas vai hieroglifu rakstību bez atsevišķas pielāgošanas katrai valodai. Mēs to testējām ar reālistiskiem SMGS (krievu val.) un B/L (ķīniešu val.) dokumentu paraugiem -- galvenie identifikatori (pavadzīmes numurs, B/L numurs) abos gadījumos iegūti precīzi.
Kur sistēma pati atzīst, ka kaut ko nezina -- un kāpēc tas ir ieguvums
Katra ekstrakcija saņem ticamības novērtējumu. Kad dokuments ir neparasts, sliktas kvalitātes vai vienkārši sarežģītāks nekā parasti -- sistēma nemin, bet atzīmē to manuālai pārskatīšanai. Tas var izklausīties kā ierobežojums, bet patiesībā tas ir pilnīgi pretējais: tā ir aizsardzība pret klusu, nepamanītu kļūdu, kas citādi nonāktu jūsu atskaitē kā "pareiza".
Valoda nav šķērslis
Tā kā sistēma lasa nozīmi, nevis pozīciju, tā vienlīdz labi spēj strādāt ar latīņu, kirilicas vai hieroglifu rakstību bez atsevišķas konfigurācijas katrai valodai -- to pašu moduli izmanto gan CMR pavadzīme angļu valodā, gan SMGS накладная krievu valodā, gan B/L ķīniešu rakstībā. Mēs to pārbaudījām ar reālistiskiem dokumentu paraugiem abās rakstībās -- galvenie identifikatori iegūti precīzi, un sistēma pati pareizi novērtēja savu ticamību katrā gadījumā.
Kas tiek saglabāts audita nolūkos
Katram iegūtajam datu punktam sistēma saglabā arī oriģinālo teksta fragmentu, no kura tas iegūts -- ne tikai gala rezultātu. Tas nozīmē, ka jebkurā brīdī varat atgriezties un pārbaudīt, no kurienes konkrēti radies konkrēts skaitlis vai nosaukums, nevis vienkārši uzticēties "melnajai kastei".
B/L specifika -- robeža, kuru ievērojam apzināti
Jūras kravu manifestu gadījumā sistēma iegūst datus tikai iekšējai lietošanai -- tā neapstiprina dokumenta juridisko spēkā esamību vai īpašumtiesību statusu. Tā ir apzināta robeža: datu iegūšana un dokumenta juridiskais apstiprinājums ir divas dažādas lietas, un skaidra robeža starp tām aizsargā gan jūs, gan mūs no nepamatotas uzticēšanās tur, kur tā nav vietā.