Vi har skannet og lest inn cirka 140 000 sider matrikkeldata for Valueguard — til sammen omkring 6 millioner datarader. Oppdraget ble gjennomført på en måned.
Den store utfordringen lå ikke i volumet, men i UUID-kodene. En UUID er en 36 tegn lang tilfeldig streng, og i motsetning til løpende tekst finnes verken ordliste, kontekst eller mønster som kan avsløre et feiltolket tegn. Ett eneste feil tegn gjør hele koden ubrukelig — og feilen er usynlig i selve dataene; den viser seg først når posten ikke lenger lar seg matche.
Derfor ble hele materialet lest inn to ganger, med to uavhengige OCR-programmer, og resultatene ble sammenlignet med hverandre. Når begge lesningene er enige om en tilfeldig streng på 36 tegn, er risikoen svært liten for at de har gjort nøyaktig samme feil. Der de skiller seg fra hverandre, vet man derimot nøyaktig hvor problemet ligger — og hver eneste slik forskjell ble gjennomgått visuelt mot det skannede bildet.
I tillegg ble hver side kontrollert strukturelt: antall rader og kolonner per side ble sammenlignet med forventet verdi, slik at sider med avvikende oppbygning falt ut automatisk. I et gjennomgått parti ble godt én av tusen rader tatt ut til kontroll.
Les mer om vår tjeneste for OCR-konvertering av registre og tabeller — vi leser inn adresseregistre, eiendomsdata og tabellmateriale til Excel, database eller søkbar PDF.