Glossário

O que é OCR de PDF?

OCR de PDF (Reconhecimento Óptico de Carateres) é o processo que converte o texto que, dentro de um PDF digitalizado, existe apenas como imagem em texto selecionável, pesquisável e legível por máquina.

Há dois tipos de PDF: com camada de texto (nascidos digitais — por exemplo, exportados a partir do Word ou de LaTeX), onde o texto é lido directamente, e digitalizados (papel fotografado ou passado pelo scanner), em que a página é só uma imagem de texto. Sem OCR, este segundo tipo não se pode pesquisar, copiar nem resumir.

Envie PDFs com camada de texto de até 50 MB e 1.000 páginas. Digitalizações apenas em imagem precisam de OCR antes do envio. Depois vêm um resumo estruturado e chat com o contexto disponível; consulte a Política de Privacidade.

A precisão do OCR depende da qualidade da digitalização, do layout, do idioma e do tipo de letra; reveja manualmente qualquer resultado importante.

Onde entra o Summio

Envie PDFs com camada de texto de até 50 MB e 1.000 páginas. Digitalizações apenas em imagem precisam de OCR antes do envio. Depois vêm um resumo estruturado e chat com o contexto disponível; consulte a Política de Privacidade.

Saber mais sobre o Summio

Perguntas frequentes

O OCR de PDF é grátis?

O preço e as condições do OCR dependem da ferramenta externa escolhida. Envie PDFs com camada de texto de até 50 MB e 1.000 páginas. Digitalizações apenas em imagem precisam de OCR antes do envio. Depois vêm um resumo estruturado e chat com o contexto disponível; consulte a Política de Privacidade.

Quão preciso é o OCR em livros digitalizados?

A precisão do OCR depende da qualidade da digitalização, do layout, do idioma e do tipo de letra; reveja manualmente qualquer resultado importante.

O OCR funciona em PDF manuscritos?

Os motores de OCR antigos lidam mal com a escrita manual. Os mais recentes baseados em aprendizagem automática lidam razoavelmente com letra de imprensa nítida e bastante pior com cursiva.