Summio

術語表

什麼是PDF OCR?

PDF OCR(光學字元辨識)是把掃描 PDF 中以圖像形式存在的文字,轉成可選取、可搜尋、可被機器讀取的文字的過程。

PDF 大致分兩種:帶文字層的 PDF(數位原生,例如從 Word 或 LaTeX 匯出),文字可以直接讀取;以及掃描 PDF(紙本文件經拍攝或掃描而來),頁面只是一張寫著字的圖。沒有 OCR,第二種既無法搜尋,也無法複製、無法摘要。

可上傳帶文字層的 PDF,單一檔案不超過 50MB 和 1,000 頁。純影像掃描檔需先完成 OCR。接著可取得結構化摘要並依可用脈絡對話;資料處理條款請查看隱私權政策。

OCR 準確度取決於掃描品質、版式、語言與字型;重要結果應人工複核。

Summio 的位置

可上傳帶文字層的 PDF,單一檔案不超過 50MB 和 1,000 頁。純影像掃描檔需先完成 OCR。接著可取得結構化摘要並依可用脈絡對話;資料處理條款請查看隱私權政策。

了解更多 Summio

常見問題

PDF OCR 免費嗎?

OCR 的價格與使用條款取決於你選擇的外部工具。 可上傳帶文字層的 PDF,單一檔案不超過 50MB 和 1,000 頁。純影像掃描檔需先完成 OCR。接著可取得結構化摘要並依可用脈絡對話;資料處理條款請查看隱私權政策。

掃描書籍的 OCR 有多準?

OCR 準確度取決於掃描品質、版式、語言與字型;重要結果應人工複核。

OCR 能辨識手寫 PDF 嗎?

舊一代 OCR 引擎對手寫處理不佳。新一代基於機器學習的 OCR對清楚的硬筆印刷體表現不錯,對行雲流水的草書仍較弱。