用語集

PDFのOCRとは?

PDFのOCR(光学文字認識)とは、スキャンされたPDFの中に画像としてしか存在しない文字を、選択・検索・機械処理が可能なテキストへ変換することです。

PDFには二種類あります。テキストレイヤーを持つPDF(WordやLaTeXから書き出されたデジタルネイティブのもの)は文字をそのまま読めます。一方、スキャンPDF(紙を撮影またはスキャナで取り込んだもの)は、ページが文字の写った絵にすぎません。OCRなしには、後者を検索することも、コピーすることも、要約することもできません。

テキストレイヤー付きPDFを、50MB以下かつ1,000ページ以下でアップロードできます。画像のみのスキャンは事前にOCRが必要です。構造化された要約と利用可能なコンテキストでのチャットが続きます。データ処理条件はプライバシーポリシーをご確認ください。

OCRの精度はスキャン品質、レイアウト、言語、書体によって変わるため、重要な結果は手作業で確認してください。

Summioの位置づけ

テキストレイヤー付きPDFを、50MB以下かつ1,000ページ以下でアップロードできます。画像のみのスキャンは事前にOCRが必要です。構造化された要約と利用可能なコンテキストでのチャットが続きます。データ処理条件はプライバシーポリシーをご確認ください。

Summioについてもっと読む

よくある質問

PDFのOCRは無料ですか?

OCRの料金と条件は、利用する外部ツールによって異なります。 テキストレイヤー付きPDFを、50MB以下かつ1,000ページ以下でアップロードできます。画像のみのスキャンは事前にOCRが必要です。構造化された要約と利用可能なコンテキストでのチャットが続きます。データ処理条件はプライバシーポリシーをご確認ください。

スキャンした書籍のOCRはどれくらい正確ですか?

OCRの精度はスキャン品質、レイアウト、言語、書体によって変わるため、重要な結果は手作業で確認してください。

OCRは手書きPDFにも効きますか?

旧来のOCRエンジンは手書きが苦手です。新しい機械学習ベースのOCRは読みやすい筆記体に近い活字なら十分実用的で、続け書きの筆記体には弱いという傾向があります。