Abbiamo digitalizzato e acquisito circa 140.000 pagine di dati catastali per Valueguard — in tutto circa 6 milioni di righe di dati. L'incarico è stato portato a termine in un mese.
La vera difficoltà non stava nel volume ma nei codici UUID. Un UUID è una stringa casuale di 36 caratteri e, a differenza di un testo corrente, non offre né dizionario, né contesto, né schemi che possano rivelare un carattere letto male. Un solo carattere errato rende inutilizzabile l'intero codice — e l'errore è invisibile nei dati stessi: emerge soltanto quando il record non trova più corrispondenza.
Proprio per questo l'intero materiale è stato acquisito due volte, con due programmi OCR indipendenti, e i risultati sono stati confrontati fra loro. Quando entrambe le letture concordano su una stringa casuale di 36 caratteri, la probabilità che abbiano commesso esattamente lo stesso errore è molto bassa. Dove invece divergono si sa con precisione dove sta il problema — e ogni singola differenza è stata verificata visivamente sull'immagine digitalizzata.
A questo si aggiunge un controllo strutturale di ogni pagina: il numero di righe e di colonne per pagina è stato confrontato con il valore atteso, così che le pagine con struttura anomala emergessero automaticamente. In un lotto controllato in questo modo, poco più di una riga su mille è stata segnalata per la verifica.
Scopri di più sul nostro servizio di conversione OCR di registri e tabelle — acquisiamo registri di indirizzi, dati immobiliari e materiale tabellare in Excel, in un database o in PDF ricercabile.