Summio

术语表

什么是PDF OCR?

PDF OCR(光学字符识别)是把扫描 PDF 中以图像形式存在的文字,转换为可选中、可检索、机器可读的文本的过程。

PDF 大致分两类:带文字层的 PDF(数字原生,比如从 Word 或 LaTeX 导出),文字可以直接读取;扫描 PDF(纸质文件经拍照或扫描而来),页面只是一张写着字的图片。没有 OCR,第二种 PDF 既无法搜索、也无法复制和摘要。

可上传带文本层的 PDF,单个文件不超过 50MB 和 1,000 页。纯图像扫描件需先完成 OCR。随后可获得结构化摘要并基于可用上下文对话;数据处理条款请查看隐私政策。

OCR 准确度取决于扫描质量、版式、语言和字体;重要结果应当人工复核。

Summio 的位置

可上传带文本层的 PDF,单个文件不超过 50MB 和 1,000 页。纯图像扫描件需先完成 OCR。随后可获得结构化摘要并基于可用上下文对话;数据处理条款请查看隐私政策。

了解更多关于 Summio

常见问题

PDF OCR 免费吗?

OCR 的价格和使用条款取决于你选择的外部工具。 可上传带文本层的 PDF,单个文件不超过 50MB 和 1,000 页。纯图像扫描件需先完成 OCR。随后可获得结构化摘要并基于可用上下文对话;数据处理条款请查看隐私政策。

扫描书籍的 OCR 有多准?

OCR 准确度取决于扫描质量、版式、语言和字体;重要结果应当人工复核。

OCR 能识别手写 PDF 吗?

老一代 OCR 引擎对手写处理得不好。新一代基于机器学习的 OCR对清晰的硬笔印刷体水平不错,对潦草连笔的草书仍较差。