Что такое PDF OCR?
PDF OCR (оптическое распознавание символов) — это превращение текста, который внутри отсканированного PDF существует только как изображение, в выделяемый, ищущийся и машиночитаемый текст.
PDF бывает двух видов: с текстовым слоем (рождённый цифровым — например, экспортирован из Word или LaTeX), где текст напрямую читается, и сканированный (сфотографированная или отсканированная бумага), где страница — это просто картинка с буквами. Без OCR второй вид нельзя ни искать, ни копировать, ни суммировать.
Загружайте PDF с текстовым слоем размером до 50 МБ и длиной до 1 000 страниц. Для сканов без текстового слоя сначала выполните OCR. Затем доступны структурированное саммари и чат с доступным контекстом; условия обработки данных указаны в Политике конфиденциальности.
Точность OCR зависит от качества скана, макета, языка и шрифта; важный результат нужно проверять вручную.
Загружайте PDF с текстовым слоем размером до 50 МБ и длиной до 1 000 страниц. Для сканов без текстового слоя сначала выполните OCR. Затем доступны структурированное саммари и чат с доступным контекстом; условия обработки данных указаны в Политике конфиденциальности.
Узнать больше о SummioЧастые вопросы
PDF OCR — это бесплатно?
Стоимость и условия OCR зависят от выбранного внешнего инструмента. Загружайте PDF с текстовым слоем размером до 50 МБ и длиной до 1 000 страниц. Для сканов без текстового слоя сначала выполните OCR. Затем доступны структурированное саммари и чат с доступным контекстом; условия обработки данных указаны в Политике конфиденциальности.
Насколько точен OCR на сканированных книгах?
Точность OCR зависит от качества скана, макета, языка и шрифта; важный результат нужно проверять вручную.
Распознаёт ли OCR рукописные PDF?
Старые OCR-движки плохо справляются с почерком. Современный ML-OCR уверенно работает с разборчивыми печатными буквами и хуже — со скорописью.
