Що таке PDF OCR?
PDF OCR (оптичне розпізнавання символів) — це процес перетворення тексту, що виглядає у відсканованому PDF як зображення, на текст, який можна виділити, шукати й читати машинно.
PDF-файли бувають двох типів: із текстовим шаром (народжені цифровими, як експорт із Word чи LaTeX) — у них текст читається напряму; і скановані (папір сфотографували чи пропустили через сканер) — у них сторінка є лише зображенням літер. Без OCR другий тип неможливо ані шукати, ані копіювати, ані підсумовувати.
Завантажуйте PDF із текстовим шаром розміром до 50 МБ і довжиною до 1 000 сторінок. Для сканів лише із зображеннями спочатку виконайте OCR. Далі доступні структуроване самарі та чат із наявним контекстом; умови обробки даних наведені в Політиці конфіденційності.
Точність OCR залежить від якості сканування, макета, мови та шрифту; важливий результат слід перевіряти вручну.
Завантажуйте PDF із текстовим шаром розміром до 50 МБ і довжиною до 1 000 сторінок. Для сканів лише із зображеннями спочатку виконайте OCR. Далі доступні структуроване самарі та чат із наявним контекстом; умови обробки даних наведені в Політиці конфіденційності.
Дізнатися більше про SummioПоширені запитання
Чи PDF OCR безкоштовний?
Вартість і умови OCR залежать від обраного зовнішнього інструмента. Завантажуйте PDF із текстовим шаром розміром до 50 МБ і довжиною до 1 000 сторінок. Для сканів лише із зображеннями спочатку виконайте OCR. Далі доступні структуроване самарі та чат із наявним контекстом; умови обробки даних наведені в Політиці конфіденційності.
Наскільки точний OCR на сканованих книгах?
Точність OCR залежить від якості сканування, макета, мови та шрифту; важливий результат слід перевіряти вручну.
Чи працює OCR на рукописних PDF?
Старі движки спотикаються на рукописі. Нові, побудовані на машинному навчанні, розумно справляються з чітким напівдрукованим почерком і гірше — зі зв’язним.
