Mitä on PDF OCR?
PDF OCR (optinen merkkien tunnistus) on prosessi, jossa skannatussa PDF:ssä vain kuvana esiintyvä teksti muutetaan valittavissa olevaksi, haettavaksi ja koneluettavaksi tekstiksi.
PDF-tiedostoja on kahta tyyppiä: tekstikerroksellisia (digitaalisesti syntyneitä, esim. Wordista tai LaTeXista vietyjä) — teksti voidaan lukea suoraan; ja skannattuja (paperin valokuvaus tai skanneri) — sivu koostuu pelkistä kirjainkuvista. Ilman OCR:ää jälkimmäistä tyyppiä ei voi hakea, kopioida eikä tiivistää.
Lataa tekstipohjaisia PDF-tiedostoja, joiden koko on enintään 50 Mt ja pituus 1 000 sivua. Pelkkiä kuvia sisältävät skannaukset tarvitsevat OCR:n ennen latausta. Sen jälkeen saat rakenteisen tiivistelmän ja keskustelun saatavilla olevalla kontekstilla; katso Tietosuojakäytäntö.
OCR-tarkkuus riippuu skannauksen laadusta, asettelusta, kielestä ja kirjasimesta; tarkista tärkeät tulokset käsin.
Lataa tekstipohjaisia PDF-tiedostoja, joiden koko on enintään 50 Mt ja pituus 1 000 sivua. Pelkkiä kuvia sisältävät skannaukset tarvitsevat OCR:n ennen latausta. Sen jälkeen saat rakenteisen tiivistelmän ja keskustelun saatavilla olevalla kontekstilla; katso Tietosuojakäytäntö.
Lue lisää SummiostaUsein kysytyt kysymykset
Onko PDF OCR ilmainen?
OCR:n hinta ja ehdot riippuvat valitsemastasi ulkoisesta työkalusta. Lataa tekstipohjaisia PDF-tiedostoja, joiden koko on enintään 50 Mt ja pituus 1 000 sivua. Pelkkiä kuvia sisältävät skannaukset tarvitsevat OCR:n ennen latausta. Sen jälkeen saat rakenteisen tiivistelmän ja keskustelun saatavilla olevalla kontekstilla; katso Tietosuojakäytäntö.
Kuinka tarkka OCR on skannatuissa kirjoissa?
OCR-tarkkuus riippuu skannauksen laadusta, asettelusta, kielestä ja kirjasimesta; tarkista tärkeät tulokset käsin.
Toimiiko OCR käsin kirjoitetuissa PDF:issä?
Vanhat moottorit kamppailevat käsialan kanssa. Uudet koneoppimispohjaiset suoriutuvat kohtuullisesti siististä, lähes painokirjoitusta muistuttavasta käsialasta; sotkuisessa käsialassa ne ovat vähemmän tehokkaita.
