Nous avons numérisé et saisi environ 140 000 pages de données cadastrales pour Valueguard — au total quelque 6 millions de lignes de données. Le projet a été mené à bien en un mois.

La véritable difficulté ne tenait pas au volume mais aux codes UUID. Un UUID est une chaîne aléatoire de 36 caractères et, contrairement à un texte suivi, il n'offre ni dictionnaire, ni contexte, ni motif susceptible de révéler un caractère mal lu. Un seul caractère erroné rend le code entier inutilisable — et l'erreur est invisible dans les données elles-mêmes : elle n'apparaît que lorsque l'enregistrement ne correspond plus.

C'est pourquoi l'ensemble du matériel a été saisi deux fois, à l'aide de deux programmes d'OCR indépendants, et les résultats ont été comparés entre eux. Lorsque les deux lectures concordent sur une chaîne aléatoire de 36 caractères, la probabilité qu'elles aient commis exactement la même erreur est très faible. Là où elles divergent, on sait en revanche précisément où se situe le problème — et chacune de ces divergences a été vérifiée visuellement sur l'image numérisée.

À cela s'ajoute un contrôle structurel de chaque page : le nombre de lignes et de colonnes par page a été comparé à la valeur attendue, de sorte que les pages à structure divergente ressortaient automatiquement. Dans un lot ainsi contrôlé, un peu plus d'une ligne sur mille a été isolée pour examen.

En savoir plus sur notre service de conversion OCR de registres et de tableaux — nous saisissons registres d'adresses, données immobilières et matériel tabulaire vers Excel, une base de données ou un PDF interrogeable.

Staplade och batchmärkta kartonger med lantmäterihandlingar efter avslutad skanning
Le matériel une fois la numérisation terminée — prêt pour la destruction