Ordlista

Vad är PDF OCR?

PDF OCR (optisk teckenigenkänning) är processen att omvandla text som i en skannad PDF bara finns som bild till markerbar, sökbar och maskinläsbar text.

PDF-filer finns i två varianter: med textlager (digitalt född, t.ex. exporterad från Word eller LaTeX) — texten kan läsas direkt; och skannad (foto av papper eller via en skanner) — sidan består bara av bokstavsbilder. Utan OCR går den andra typen varken att söka i, kopiera eller sammanfatta.

Ladda upp textbaserade PDF:er på högst 50 MB och 1 000 sidor. Skanningar som bara innehåller bilder behöver OCR före uppladdning. Därefter följer en strukturerad sammanfattning och chatt med tillgänglig kontext; se Integritetspolicyn.

OCR-noggrannhet beror på skanningskvalitet, layout, språk och typsnitt; kontrollera viktiga resultat manuellt.

Här kommer Summio in

Ladda upp textbaserade PDF:er på högst 50 MB och 1 000 sidor. Skanningar som bara innehåller bilder behöver OCR före uppladdning. Därefter följer en strukturerad sammanfattning och chatt med tillgänglig kontext; se Integritetspolicyn.

Läs mer om Summio

Vanliga frågor

Är PDF OCR gratis?

Pris och villkor för OCR beror på vilket externt verktyg du väljer. Ladda upp textbaserade PDF:er på högst 50 MB och 1 000 sidor. Skanningar som bara innehåller bilder behöver OCR före uppladdning. Därefter följer en strukturerad sammanfattning och chatt med tillgänglig kontext; se Integritetspolicyn.

Hur noggrant är OCR på skannade böcker?

OCR-noggrannhet beror på skanningskvalitet, layout, språk och typsnitt; kontrollera viktiga resultat manuellt.

Fungerar OCR på handskrivna PDF-filer?

Äldre motorer kämpar med handskrift. Nyare motorer baserade på maskininlärning klarar sig rimligt på prydlig, nästan tryckliknande skrift; vid stökig handskrift är de mindre effektiva.