Woordenlijst

Wat is PDF OCR?

PDF OCR (optische tekenherkenning) is het proces waarbij tekst die in een gescande PDF alleen als afbeelding voorkomt, wordt omgezet in selecteerbare, doorzoekbare, machineleesbare tekst.

PDF-bestanden zijn er in twee soorten: met een tekstlaag (digitaal geboren, bijvoorbeeld geëxporteerd uit Word of LaTeX) — tekst is direct leesbaar; en gescand (foto van papier of via een scanner) — de pagina is alleen een afbeelding van letters. Zonder OCR is het tweede type niet te doorzoeken, kopiëren of samen te vatten.

Upload tekstgebaseerde PDF’s van maximaal 50 MB en 1.000 pagina’s. Scans die alleen uit afbeeldingen bestaan, hebben vóór het uploaden OCR nodig. Daarna volgen een gestructureerde samenvatting en chat met beschikbare context; raadpleeg het Privacybeleid.

OCR-nauwkeurigheid hangt af van scankwaliteit, opmaak, taal en lettertype; controleer belangrijke resultaten handmatig.

Waar Summio inpast

Upload tekstgebaseerde PDF’s van maximaal 50 MB en 1.000 pagina’s. Scans die alleen uit afbeeldingen bestaan, hebben vóór het uploaden OCR nodig. Daarna volgen een gestructureerde samenvatting en chat met beschikbare context; raadpleeg het Privacybeleid.

Meer weten over Summio

Veelgestelde vragen

Is PDF OCR gratis?

Prijs en voorwaarden voor OCR hangen af van de gekozen externe tool. Upload tekstgebaseerde PDF’s van maximaal 50 MB en 1.000 pagina’s. Scans die alleen uit afbeeldingen bestaan, hebben vóór het uploaden OCR nodig. Daarna volgen een gestructureerde samenvatting en chat met beschikbare context; raadpleeg het Privacybeleid.

Hoe nauwkeurig is OCR op gescande boeken?

OCR-nauwkeurigheid hangt af van scankwaliteit, opmaak, taal en lettertype; controleer belangrijke resultaten handmatig.

Werkt OCR op handgeschreven PDF’s?

Oudere engines hebben moeite met handschrift. Nieuwere op basis van machine learning presteren redelijk op net en bijna-drukschrift; bij rommelig handschrift zijn ze minder effectief.