Olemme skannanneet ja lukeneet noin 140 000 sivua maanmittaustietoa Valueguardille — yhteensä noin 6 miljoonaa datariviä. Toimeksianto toteutettiin kuukaudessa.

Suurin haaste ei ollut määrässä vaan UUID-koodeissa. UUID on 36 merkin pituinen satunnainen merkkijono, eikä siinä ole juoksevan tekstin tapaan sanakirjaa, asiayhteyttä tai kaavaa, joka paljastaisi väärin luetun merkin. Yksikin väärä merkki tekee koko koodista käyttökelvottoman — eikä virhe näy itse aineistossa, vaan vasta siinä, ettei tietue enää täsmää.

Juuri siksi koko aineisto luettiin kahdesti, kahdella toisistaan riippumattomalla OCR-ohjelmalla, ja tulokset verrattiin toisiinsa. Kun molemmat luennat ovat yhtä mieltä satunnaisesta 36 merkin jonosta, on hyvin epätodennäköistä, että ne olisivat tehneet täsmälleen saman virheen. Siellä missä ne eroavat, tiedetään sen sijaan tarkalleen, missä ongelma on — ja jokainen tällainen ero käytiin läpi silmämääräisesti skannattua kuvaa vasten.

Lisäksi jokainen sivu tarkastettiin rakenteellisesti: rivien ja sarakkeiden määrää sivua kohden verrattiin odotusarvoon, jolloin rakenteeltaan poikkeavat sivut nousivat esiin automaattisesti. Yhdessä näin tarkastetussa erässä runsas yksi rivi tuhannesta poimittiin tarkastettavaksi.

Lue lisää rekisterien ja taulukoiden OCR-muunnospalvelustamme — luemme osoiterekisterit, kiinteistötiedot ja taulukkoaineistot Exceliin, tietokantaan tai haettavaksi PDF-tiedostoksi.

Staplade och batchmärkta kartonger med lantmäterihandlingar efter avslutad skanning
Aineisto skannauksen valmistuttua — valmiina tuhottavaksi