Czym jest PDF OCR?
PDF OCR (optyczne rozpoznawanie znaków) to proces zamiany tekstu, który w zeskanowanym PDF jest jedynie obrazem, w tekst, który można zaznaczać, przeszukiwać i odczytywać maszynowo.
Pliki PDF są dwóch rodzajów: z warstwą tekstową (urodzone cyfrowo, eksportowane np. z Worda lub LaTeX) — tekst da się odczytać bezpośrednio; oraz zeskanowane (zdjęcie papieru lub przepuszczone przez skaner) — strona jest jedynie obrazem liter. Bez OCR drugiego typu nie da się przeszukać, skopiować ani streścić.
Wgrywaj pliki PDF z warstwą tekstową, maksymalnie 50 MB i 1 000 stron. Skany zawierające wyłącznie obrazy wymagają OCR przed przesłaniem. Potem otrzymasz strukturalne streszczenie i czat z dostępnym kontekstem; zasady przetwarzania danych opisuje Polityka prywatności.
Dokładność OCR zależy od jakości skanu, układu, języka i kroju pisma; ważne wyniki należy sprawdzić ręcznie.
Wgrywaj pliki PDF z warstwą tekstową, maksymalnie 50 MB i 1 000 stron. Skany zawierające wyłącznie obrazy wymagają OCR przed przesłaniem. Potem otrzymasz strukturalne streszczenie i czat z dostępnym kontekstem; zasady przetwarzania danych opisuje Polityka prywatności.
Dowiedz się więcej o SummioNajczęstsze pytania
Czy PDF OCR jest darmowy?
Cena i warunki OCR zależą od wybranego narzędzia zewnętrznego. Wgrywaj pliki PDF z warstwą tekstową, maksymalnie 50 MB i 1 000 stron. Skany zawierające wyłącznie obrazy wymagają OCR przed przesłaniem. Potem otrzymasz strukturalne streszczenie i czat z dostępnym kontekstem; zasady przetwarzania danych opisuje Polityka prywatności.
Jak dokładne jest OCR zeskanowanych książek?
Dokładność OCR zależy od jakości skanu, układu, języka i kroju pisma; ważne wyniki należy sprawdzić ręcznie.
Czy OCR działa na PDF-ach pisanych ręcznie?
Starsze silniki słabo radzą sobie z pismem ręcznym. Nowe silniki oparte na uczeniu maszynowym działają rozsądnie na czytelnym, zbliżonym do druku piśmie; przy nieuporządkowanym piśmie ręcznym są mniej skuteczne.
