OCR
Hvad er OCR?
OCR står for Optical Character Recognition, på dansk optisk tegngenkendelse, og er en teknologi, der omdanner tekst i billeder og scannede dokumenter til digital tekst, som en computer kan læse og behandle.
OCR kan eksempelvis bruges til at aflæse tekst fra fakturaer, kvitteringer og andre bilag. I stedet for at dokumentet alene gemmes som et billede, kan OCR identificere bogstaver, tal og andre tegn og omdanne dem til data, der kan søges i eller behandles af software.
I et regnskabsprogram kan OCR blandt andet bruges til at aflæse oplysninger fra et bilag, såsom leverandør, fakturanummer, dato, beløb og moms. Det kan reducere behovet for manuel indtastning og gøre behandlingen af bilag hurtigere.
Når de aflæste oplysninger bruges til kontering eller oprettelse af posteringer, kan OCR indgå som en del af automatisk bogføring.
Se hvordan Dynaccount bruger OCR ved bilagsaflæsning.
Leder du efter et regnskabsprogram til din virksomhed?
Se, hvordan Dynaccount regnskabsprogram kan hjælpe med automatisk bogføring og håndtering af bilag.
Hvorfor er billedkvaliteten vigtig?
Billedkvaliteten har stor betydning for, hvor præcist et OCR-system kan genkende teksten. Et tydeligt billede med høj kontrast mellem tekst og baggrund gør det lettere for systemet at skelne de enkelte tegn.
Uskarpe, pixelerede, skæve eller dårligt belyste billeder kan derimod medføre fejl. Et OCR-system kan eksempelvis forveksle tallet "0" med bogstavet "O" eller tallet "1" med bogstavet "I".
Billedet kan derfor behandles inden selve tegngenkendelsen. Det kan blandt andet omfatte forbedring af kontrast og skarphed, korrektion af skævheder og reduktion af støj i billedet.
Et godt udgangspunkt er dog altid et tydeligt billede eller en scanning i tilstrækkelig kvalitet.
Hvordan virker OCR?
OCR fungerer ved, at software analyserer et billede eller et scannet dokument og forsøger at identificere de områder, der indeholder tekst. Herefter genkendes de enkelte tegn, ord og tekstlinjer og omdannes til digital tekst.
Processen kan overordnet bestå af flere trin. Først kan billedet behandles for at gøre teksten lettere at genkende. Det kan eksempelvis ske ved at forbedre kontrasten, reducere billedstøj eller korrigere et dokument, der er scannet eller fotograferet skævt.
Derefter analyserer OCR-systemet teksten og forsøger at genkende bogstaver, tal og andre tegn. Moderne OCR-systemer kan anvende maskinlæring og neurale netværk til at forbedre genkendelsen og tage højde for sammenhængen mellem tegn og ord.
Til sidst kan den genkendte tekst efterbehandles. Det kan eksempelvis ske ved at kontrollere ord, tal og tekstmønstre for at identificere sandsynlige fejl i genkendelsen.