Che cos’è OCR di PDF?
L’OCR di PDF (Optical Character Recognition, riconoscimento ottico dei caratteri) è il processo che trasforma il testo che, dentro un PDF scansionato, esiste solo come immagine in testo selezionabile, ricercabile e leggibile dalle macchine.
Esistono due tipi di PDF: con strato di testo (nati digitali — esportati da Word o LaTeX, per esempio), in cui il testo è direttamente leggibile, e scansionati (carta fotografata o passata allo scanner), in cui la pagina è solo l’immagine di un testo. Senza OCR il secondo tipo non si può cercare, copiare né riassumere.
Carica PDF con livello di testo fino a 50 MB e 1.000 pagine. Le scansioni composte solo da immagini richiedono OCR prima del caricamento. Seguono una sintesi strutturata e la chat con il contesto disponibile; consulta l’Informativa sulla privacy.
La precisione dell’OCR dipende dalla qualità della scansione, dal layout, dalla lingua e dal carattere; verifica manualmente ogni risultato importante.
Carica PDF con livello di testo fino a 50 MB e 1.000 pagine. Le scansioni composte solo da immagini richiedono OCR prima del caricamento. Seguono una sintesi strutturata e la chat con il contesto disponibile; consulta l’Informativa sulla privacy.
Scopri di più su SummioDomande frequenti
L’OCR di PDF è gratuito?
Prezzo e condizioni dell’OCR dipendono dallo strumento esterno scelto. Carica PDF con livello di testo fino a 50 MB e 1.000 pagine. Le scansioni composte solo da immagini richiedono OCR prima del caricamento. Seguono una sintesi strutturata e la chat con il contesto disponibile; consulta l’Informativa sulla privacy.
Quanto è preciso l’OCR sui libri scansionati?
La precisione dell’OCR dipende dalla qualità della scansione, dal layout, dalla lingua e dal carattere; verifica manualmente ogni risultato importante.
L’OCR funziona sui PDF manoscritti?
I motori OCR di vecchia generazione gestiscono male la scrittura a mano. Quelli moderni basati su machine learning reggono dignitosamente lo stampatello chiaro e parecchio peggio il corsivo.
