什麼是PDF OCR?
PDF OCR(光學字元辨識)是把掃描 PDF 中以圖像形式存在的文字,轉成可選取、可搜尋、可被機器讀取的文字的過程。
PDF 大致分兩種:帶文字層的 PDF(數位原生,例如從 Word 或 LaTeX 匯出),文字可以直接讀取;以及掃描 PDF(紙本文件經拍攝或掃描而來),頁面只是一張寫著字的圖。沒有 OCR,第二種既無法搜尋,也無法複製、無法摘要。
可上傳帶文字層的 PDF,單一檔案不超過 50MB 和 1,000 頁。純影像掃描檔需先完成 OCR。接著可取得結構化摘要並依可用脈絡對話;資料處理條款請查看隱私權政策。
OCR 準確度取決於掃描品質、版式、語言與字型;重要結果應人工複核。
可上傳帶文字層的 PDF,單一檔案不超過 50MB 和 1,000 頁。純影像掃描檔需先完成 OCR。接著可取得結構化摘要並依可用脈絡對話;資料處理條款請查看隱私權政策。
了解更多 Summio常見問題
PDF OCR 免費嗎?
OCR 的價格與使用條款取決於你選擇的外部工具。 可上傳帶文字層的 PDF,單一檔案不超過 50MB 和 1,000 頁。純影像掃描檔需先完成 OCR。接著可取得結構化摘要並依可用脈絡對話;資料處理條款請查看隱私權政策。
掃描書籍的 OCR 有多準?
OCR 準確度取決於掃描品質、版式、語言與字型;重要結果應人工複核。
OCR 能辨識手寫 PDF 嗎?
舊一代 OCR 引擎對手寫處理不佳。新一代基於機器學習的 OCR對清楚的硬筆印刷體表現不錯,對行雲流水的草書仍較弱。
