Słownik

Czym jest PDF OCR?

PDF OCR (optyczne rozpoznawanie znaków) to proces zamiany tekstu, który w zeskanowanym PDF jest jedynie obrazem, w tekst, który można zaznaczać, przeszukiwać i odczytywać maszynowo.

Pliki PDF są dwóch rodzajów: z warstwą tekstową (urodzone cyfrowo, eksportowane np. z Worda lub LaTeX) — tekst da się odczytać bezpośrednio; oraz zeskanowane (zdjęcie papieru lub przepuszczone przez skaner) — strona jest jedynie obrazem liter. Bez OCR drugiego typu nie da się przeszukać, skopiować ani streścić.

Wgrywaj pliki PDF z warstwą tekstową, maksymalnie 50 MB i 1 000 stron. Skany zawierające wyłącznie obrazy wymagają OCR przed przesłaniem. Potem otrzymasz strukturalne streszczenie i czat z dostępnym kontekstem; zasady przetwarzania danych opisuje Polityka prywatności.

Dokładność OCR zależy od jakości skanu, układu, języka i kroju pisma; ważne wyniki należy sprawdzić ręcznie.

Gdzie tu jest Summio

Wgrywaj pliki PDF z warstwą tekstową, maksymalnie 50 MB i 1 000 stron. Skany zawierające wyłącznie obrazy wymagają OCR przed przesłaniem. Potem otrzymasz strukturalne streszczenie i czat z dostępnym kontekstem; zasady przetwarzania danych opisuje Polityka prywatności.

Dowiedz się więcej o Summio

Najczęstsze pytania

Czy PDF OCR jest darmowy?

Cena i warunki OCR zależą od wybranego narzędzia zewnętrznego. Wgrywaj pliki PDF z warstwą tekstową, maksymalnie 50 MB i 1 000 stron. Skany zawierające wyłącznie obrazy wymagają OCR przed przesłaniem. Potem otrzymasz strukturalne streszczenie i czat z dostępnym kontekstem; zasady przetwarzania danych opisuje Polityka prywatności.

Jak dokładne jest OCR zeskanowanych książek?

Dokładność OCR zależy od jakości skanu, układu, języka i kroju pisma; ważne wyniki należy sprawdzić ręcznie.

Czy OCR działa na PDF-ach pisanych ręcznie?

Starsze silniki słabo radzą sobie z pismem ręcznym. Nowe silniki oparte na uczeniu maszynowym działają rozsądnie na czytelnym, zbliżonym do druku piśmie; przy nieuporządkowanym piśmie ręcznym są mniej skuteczne.