什么是PDF OCR?
PDF OCR(光学字符识别)是把扫描 PDF 中以图像形式存在的文字,转换为可选中、可检索、机器可读的文本的过程。
PDF 大致分两类:带文字层的 PDF(数字原生,比如从 Word 或 LaTeX 导出),文字可以直接读取;扫描 PDF(纸质文件经拍照或扫描而来),页面只是一张写着字的图片。没有 OCR,第二种 PDF 既无法搜索、也无法复制和摘要。
可上传带文本层的 PDF,单个文件不超过 50MB 和 1,000 页。纯图像扫描件需先完成 OCR。随后可获得结构化摘要并基于可用上下文对话;数据处理条款请查看隐私政策。
OCR 准确度取决于扫描质量、版式、语言和字体;重要结果应当人工复核。
可上传带文本层的 PDF,单个文件不超过 50MB 和 1,000 页。纯图像扫描件需先完成 OCR。随后可获得结构化摘要并基于可用上下文对话;数据处理条款请查看隐私政策。
了解更多关于 Summio常见问题
PDF OCR 免费吗?
OCR 的价格和使用条款取决于你选择的外部工具。 可上传带文本层的 PDF,单个文件不超过 50MB 和 1,000 页。纯图像扫描件需先完成 OCR。随后可获得结构化摘要并基于可用上下文对话;数据处理条款请查看隐私政策。
扫描书籍的 OCR 有多准?
OCR 准确度取决于扫描质量、版式、语言和字体;重要结果应当人工复核。
OCR 能识别手写 PDF 吗?
老一代 OCR 引擎对手写处理得不好。新一代基于机器学习的 OCR对清晰的硬笔印刷体水平不错,对潦草连笔的草书仍较差。
