Slovník

Co je PDF OCR?

PDF OCR (optické rozpoznávání znaků) je proces, kterým se text, který je v naskenovaném PDF pouze obrázkem, převádí na text, jenž lze označit, prohledávat a strojově číst.

PDF soubory existují ve dvou variantách: s textovou vrstvou (digitálně narozené, např. exportované z Wordu nebo LaTeXu) — text lze číst přímo; a naskenované (fotografie papíru nebo prošlé skenerem) — stránka je jen obrázkem písmen. Bez OCR nelze druhý typ prohledat, kopírovat ani shrnout.

Nahraj textové PDF o velikosti nejvýše 50 MB a délce 1 000 stran. Skeny tvořené pouze obrázky vyžadují OCR před nahráním. Poté následuje strukturované shrnutí a chat s dostupným kontextem; podmínky zpracování dat najdeš v Zásadách ochrany osobních údajů.

Přesnost OCR závisí na kvalitě skenu, rozvržení, jazyce a písmu; důležité výsledky ověřte ručně.

Kde se hodí Summio

Nahraj textové PDF o velikosti nejvýše 50 MB a délce 1 000 stran. Skeny tvořené pouze obrázky vyžadují OCR před nahráním. Poté následuje strukturované shrnutí a chat s dostupným kontextem; podmínky zpracování dat najdeš v Zásadách ochrany osobních údajů.

Více o Summiu

Časté dotazy

Je PDF OCR zdarma?

Cena a podmínky OCR závisí na zvoleném externím nástroji. Nahraj textové PDF o velikosti nejvýše 50 MB a délce 1 000 stran. Skeny tvořené pouze obrázky vyžadují OCR před nahráním. Poté následuje strukturované shrnutí a chat s dostupným kontextem; podmínky zpracování dat najdeš v Zásadách ochrany osobních údajů.

Jak přesné je OCR u naskenovaných knih?

Přesnost OCR závisí na kvalitě skenu, rozvržení, jazyce a písmu; důležité výsledky ověřte ručně.

Funguje OCR u ručně psaných PDF?

Starší enginy se s rukopisem těžko vyrovnávají. Novější enginy založené na strojovém učení si rozumně poradí s úhledným, tisku blízkým písmem; u nepořádného rukopisu jsou méně efektivní.