Глоссарий

Что такое PDF OCR?

PDF OCR (оптическое распознавание символов) — это превращение текста, который внутри отсканированного PDF существует только как изображение, в выделяемый, ищущийся и машиночитаемый текст.

PDF бывает двух видов: с текстовым слоем (рождённый цифровым — например, экспортирован из Word или LaTeX), где текст напрямую читается, и сканированный (сфотографированная или отсканированная бумага), где страница — это просто картинка с буквами. Без OCR второй вид нельзя ни искать, ни копировать, ни суммировать.

Загружайте PDF с текстовым слоем размером до 50 МБ и длиной до 1 000 страниц. Для сканов без текстового слоя сначала выполните OCR. Затем доступны структурированное саммари и чат с доступным контекстом; условия обработки данных указаны в Политике конфиденциальности.

Точность OCR зависит от качества скана, макета, языка и шрифта; важный результат нужно проверять вручную.

Где здесь Summio

Загружайте PDF с текстовым слоем размером до 50 МБ и длиной до 1 000 страниц. Для сканов без текстового слоя сначала выполните OCR. Затем доступны структурированное саммари и чат с доступным контекстом; условия обработки данных указаны в Политике конфиденциальности.

Узнать больше о Summio

Частые вопросы

PDF OCR — это бесплатно?

Стоимость и условия OCR зависят от выбранного внешнего инструмента. Загружайте PDF с текстовым слоем размером до 50 МБ и длиной до 1 000 страниц. Для сканов без текстового слоя сначала выполните OCR. Затем доступны структурированное саммари и чат с доступным контекстом; условия обработки данных указаны в Политике конфиденциальности.

Насколько точен OCR на сканированных книгах?

Точность OCR зависит от качества скана, макета, языка и шрифта; важный результат нужно проверять вручную.

Распознаёт ли OCR рукописные PDF?

Старые OCR-движки плохо справляются с почерком. Современный ML-OCR уверенно работает с разборчивыми печатными буквами и хуже — со скорописью.