Was ist PDF-OCR?
PDF-OCR (Optical Character Recognition, optische Zeichenerkennung) ist der Vorgang, der den Text, der in einem gescannten PDF nur als Bild vorliegt, in auswählbaren, durchsuchbaren und maschinenlesbaren Text verwandelt.
Es gibt zwei Sorten PDF: solche mit Textebene (digital geboren — etwa aus Word oder LaTeX exportiert), in denen Text direkt lesbar ist, und gescannte PDFs (abfotografiertes oder eingescanntes Papier), in denen die Seite nur ein Bild von Text ist. Ohne OCR lässt sich Letzteres weder durchsuchen, noch kopieren, noch zusammenfassen.
Lade textbasierte PDFs mit höchstens 50 MB und 1.000 Seiten hoch. Reine Bildscans benötigen vor dem Upload OCR. Danach folgen eine strukturierte Zusammenfassung und Chat mit verfügbarem Kontext; beachte die Datenschutzerklärung.
Die OCR-Genauigkeit hängt von Scanqualität, Layout, Sprache und Schrift ab; wichtige Ergebnisse sollten manuell geprüft werden.
Lade textbasierte PDFs mit höchstens 50 MB und 1.000 Seiten hoch. Reine Bildscans benötigen vor dem Upload OCR. Danach folgen eine strukturierte Zusammenfassung und Chat mit verfügbarem Kontext; beachte die Datenschutzerklärung.
Mehr über Summio erfahrenHäufige Fragen
Ist PDF-OCR kostenlos?
Preis und Bedingungen für OCR hängen vom gewählten externen Werkzeug ab. Lade textbasierte PDFs mit höchstens 50 MB und 1.000 Seiten hoch. Reine Bildscans benötigen vor dem Upload OCR. Danach folgen eine strukturierte Zusammenfassung und Chat mit verfügbarem Kontext; beachte die Datenschutzerklärung.
Wie genau ist OCR bei eingescannten Büchern?
Die OCR-Genauigkeit hängt von Scanqualität, Layout, Sprache und Schrift ab; wichtige Ergebnisse sollten manuell geprüft werden.
Funktioniert OCR bei handgeschriebenen PDFs?
Ältere OCR-Engines kommen mit Handschrift schlecht zurecht. Neuere ML-basierte OCR bewältigen klares Druckschrift-Handschriftliches recht ordentlich, Kursive jedoch schlecht.
