Глосарій

Що таке PDF OCR?

PDF OCR (оптичне розпізнавання символів) — це процес перетворення тексту, що виглядає у відсканованому PDF як зображення, на текст, який можна виділити, шукати й читати машинно.

PDF-файли бувають двох типів: із текстовим шаром (народжені цифровими, як експорт із Word чи LaTeX) — у них текст читається напряму; і скановані (папір сфотографували чи пропустили через сканер) — у них сторінка є лише зображенням літер. Без OCR другий тип неможливо ані шукати, ані копіювати, ані підсумовувати.

Завантажуйте PDF із текстовим шаром розміром до 50 МБ і довжиною до 1 000 сторінок. Для сканів лише із зображеннями спочатку виконайте OCR. Далі доступні структуроване самарі та чат із наявним контекстом; умови обробки даних наведені в Політиці конфіденційності.

Точність OCR залежить від якості сканування, макета, мови та шрифту; важливий результат слід перевіряти вручну.

Де тут Summio

Завантажуйте PDF із текстовим шаром розміром до 50 МБ і довжиною до 1 000 сторінок. Для сканів лише із зображеннями спочатку виконайте OCR. Далі доступні структуроване самарі та чат із наявним контекстом; умови обробки даних наведені в Політиці конфіденційності.

Дізнатися більше про Summio

Поширені запитання

Чи PDF OCR безкоштовний?

Вартість і умови OCR залежать від обраного зовнішнього інструмента. Завантажуйте PDF із текстовим шаром розміром до 50 МБ і довжиною до 1 000 сторінок. Для сканів лише із зображеннями спочатку виконайте OCR. Далі доступні структуроване самарі та чат із наявним контекстом; умови обробки даних наведені в Політиці конфіденційності.

Наскільки точний OCR на сканованих книгах?

Точність OCR залежить від якості сканування, макета, мови та шрифту; важливий результат слід перевіряти вручну.

Чи працює OCR на рукописних PDF?

Старі движки спотикаються на рукописі. Нові, побудовані на машинному навчанні, розумно справляються з чітким напівдрукованим почерком і гірше — зі зв’язним.