Ta kontakt hvis du har skjemaer, bestillingssedler, rapporter, kontrakter, søknadsskjemaer, svarkort (kampanjer) eller lignende som du raskt vil konvertere til en database.
Vi bruker enten fastform-datafangstteknologi (den samme som brukes for spørreundersøkelser) eller fleksibel datafangstteknologi ved tolkning av skjemaer, ettersom sistnevnte ikke krever registreringsmerkene som normalt brukes med fastform-teknologi, f.eks. spørreundersøkelser.
Tolkning av skjemaer med fleksibel datafangstteknologi
Tolkning med fleksibel datafangstteknologi fungerer ganske annerledes enn tolkning av faste skjemaer, med referansemerker og felter i faste posisjoner. I stedet for å tolke faste posisjoner baserer den seg på å bruke OCR til å lokalisere forhåndsdefinerte ankerord, som "Contract", "contract no.", "Order no.", "Order slip:", "Report no.:" eller lignende, og deretter sette betingelser for å finne en passende tegnstreng nær ankeret, eller i det minste i forhold til det. Du setter betingelser for hvordan den ettersøkte tegnstrengen skal se ut, som antall tegn, hvilke tegn som er tillatt, og så videre. Se nedenfor ankerordet "REPORT" i blått og det fangede rapportnummeret i grønt.
Samme type kontrakt ser ofte identisk ut, men det skal bare til at én av kontraktene er en fotokopi, eller trykt på en annen skriver, for at den ikke lenger skal matche en fastform-mal, der kravene til millimeterpresisjon er høye. Et godt eksempel på når dette garantert skjer, er hvis du legger ut en PDF som inneholder for eksempel et søknadsskjema for en nyemisjon som deretter lastes ned av ulike personer og senere trykkes på ulike skrivere. I så fall er den fleksible datafangstteknologien for halvstrukturerte skjemaer å foretrekke i stedet.
Datafangst med AI – alternativ og supplement til klassisk OCR
De siste årenes AI-modeller for bildetolkning har gitt oss et kraftfullt supplement til klassisk OCR og malbasert datafangst. I stedet for å lete opp ankerord i faste posisjoner leser AI-en siden mer slik et menneske gjør – den forstår ut fra sammenhengen hva et felt betyr, også når skjemaet ser annerledes ut enn forrige gang. Det gjør at vi kan ta oss av materiale som tidligere ville ha krevd manuell registrering.
Der AI-lesing gjør størst nytte
- Skjemaer uten enhetlig mal: når hvert innsendte eksemplar ser litt forskjellig ut og ingen fast mal passer.
- Vanskelig lesbare originaler: fotokopier, kopi av kopi, skjeve skanninger, svake utskrifter og gamle dokumenter.
- Håndskrevne opplysninger: utfylte felt, margnotater og signaturlinjer som tradisjonell OCR ikke klarer.
- Felt som krever forståelse: å skille et fødselsnummer fra et organisasjonsnummer, finne riktig dato blant flere, eller avgjøre hvilket av to numre på siden som er avtalenummeret.
AI som korrekturleser av OCR-tolkede data
Den kanskje viktigste bruken hos oss er AI-en som et ekstra par øyne. Etter at data er fanget med OCR eller datafangstteknikk, lar vi AI-en lese om hver usikker opplysning direkte fra det skannede bildet og sammenligne med det som har havnet i databasen. Da fanger vi nettopp de feilene som er vanskeligst å oppdage maskinelt: tallet 1 lest som bokstaven l eller I, 0 som O, og sammenskrevne eller avkuttede ord.
Vi har bygget denne kontrollen for nettopp den typen korte datafelt som skjemaer inneholder – numre, datoer og beløp, men også navn, e-postadresser og kortere fritekst. Hver usikre opplysning kontrolleres mot originalbildet før levering.
Alltid kontrollert mot originalbildet
En AI-modell kan gjette feil, og en gjetning som ser rimelig ut, er farligere enn en åpenbar OCR-feil. Derfor bruker vi aldri AI-lesing ukontrollert. Hver opplysning valideres dels deterministisk mot regler vi setter opp – antall tegn, tillatte tegn, kontrollsiffer, oppslag mot et register – dels visuelt mot det skannede bildet. Det som ikke kan dokumenteres mot bildet, går videre til manuell gjennomgang.
I tillegg kombineres AI-datafangsten ofte med en siste runde der jeg selv går gjennom svarene mot bildet med egne øyne. Maskinell validering og AI-kontroll fanger det meste, men det er i den siste gjennomgangen de enkelte merkelige feilene pleier å dukke opp. Det er også derfor jeg tør love så høy nøyaktighet på denne typen oppdrag.
Vi velger teknikk etter materialet
Fast skjemateknikk, fleksibel datafangst og AI-lesing utelukker ikke hverandre – vi kombinerer dem ofte i samme oppdrag og lar hver teknikk gjøre det den er best på. Send oss gjerne noen prøvesider, for eksempel bilder tatt med mobilen, så kommer vi tilbake med forslag til opplegg og pris.