Vi har skannat och läst in cirka 140 000 sidor lantmäteridata åt Valueguard — sammanlagt omkring 6 miljoner rader data. Uppdraget genomfördes på en månad.
Den stora utmaningen låg inte i volymen utan i UUID-koderna. En UUID är en 36 tecken lång slumpmässig sträng, och till skillnad från löpande text finns varken ordlista, kontext eller mönster som kan avslöja ett feltolkat tecken. Ett enda felläst tecken gör hela koden obrukbar — och felet syns inte i datan, bara i att posten inte längre går att matcha.
Just därför lästes allt material in två gånger, med två av varandra oberoende OCR-program, och resultaten jämfördes mot varandra. När båda läsningarna är överens om en slumpmässig 36-teckenssträng är risken mycket liten att de gjort exakt samma fel. Där de skiljer sig åt vet man i stället precis var problemet sitter — och varje sådan differens gicks igenom visuellt mot den skannade bilden.
Utöver det kontrollerades varje sida strukturellt: antal rader och antal kolumner per sida jämfördes mot förväntat värde, så att sidor med avvikande uppbyggnad föll ut automatiskt. I en genomgången batch föll drygt en promille av raderna ut för granskning på det sättet.
Läs mer om vår tjänst för OCR-konvertering av register och tabeller — vi läser in adressregister, fastighetsdata och tabellmaterial till Excel, databas eller sökbar PDF.