Vi har skannet og indlæst cirka 140.000 sider matrikeldata for Valueguard — i alt omkring 6 millioner datarækker. Opgaven blev gennemført på en måned.
Den store udfordring lå ikke i mængden, men i UUID-koderne. En UUID er en 36 tegn lang tilfældig streng, og i modsætning til løbende tekst findes hverken ordbog, kontekst eller mønster, der kan afsløre et fejllæst tegn. Et enkelt forkert tegn gør hele koden ubrugelig — og fejlen er usynlig i selve dataene; den viser sig først, når posten ikke længere kan matches.
Derfor blev hele materialet indlæst to gange, med to indbyrdes uafhængige OCR-programmer, og resultaterne blev sammenlignet med hinanden. Når begge læsninger er enige om en tilfældig streng på 36 tegn, er risikoen meget lille for, at de har begået nøjagtig samme fejl. Hvor de afviger fra hinanden, ved man derimod præcis, hvor problemet ligger — og hver eneste af disse forskelle blev gennemgået visuelt mod det skannede billede.
Derudover blev hver side kontrolleret strukturelt: antallet af rækker og kolonner pr. side blev sammenlignet med den forventede værdi, så sider med afvigende opbygning faldt ud automatisk. I et gennemgået parti blev godt én ud af tusind rækker taget ud til kontrol.
Læs mere om vores service til OCR-konvertering af registre og tabeller — vi indlæser adresseregistre, ejendomsdata og tabelmateriale til Excel, database eller søgbar PDF.