O que é OCR de PDF?
OCR de PDF (Reconhecimento Óptico de Carateres) é o processo que converte o texto que, dentro de um PDF digitalizado, existe apenas como imagem em texto selecionável, pesquisável e legível por máquina.
Há dois tipos de PDF: com camada de texto (nascidos digitais — por exemplo, exportados a partir do Word ou de LaTeX), onde o texto é lido directamente, e digitalizados (papel fotografado ou passado pelo scanner), em que a página é só uma imagem de texto. Sem OCR, este segundo tipo não se pode pesquisar, copiar nem resumir.
Envie PDFs com camada de texto de até 50 MB e 1.000 páginas. Digitalizações apenas em imagem precisam de OCR antes do envio. Depois vêm um resumo estruturado e chat com o contexto disponível; consulte a Política de Privacidade.
A precisão do OCR depende da qualidade da digitalização, do layout, do idioma e do tipo de letra; reveja manualmente qualquer resultado importante.
Envie PDFs com camada de texto de até 50 MB e 1.000 páginas. Digitalizações apenas em imagem precisam de OCR antes do envio. Depois vêm um resumo estruturado e chat com o contexto disponível; consulte a Política de Privacidade.
Saber mais sobre o SummioPerguntas frequentes
O OCR de PDF é grátis?
O preço e as condições do OCR dependem da ferramenta externa escolhida. Envie PDFs com camada de texto de até 50 MB e 1.000 páginas. Digitalizações apenas em imagem precisam de OCR antes do envio. Depois vêm um resumo estruturado e chat com o contexto disponível; consulte a Política de Privacidade.
Quão preciso é o OCR em livros digitalizados?
A precisão do OCR depende da qualidade da digitalização, do layout, do idioma e do tipo de letra; reveja manualmente qualquer resultado importante.
O OCR funciona em PDF manuscritos?
Os motores de OCR antigos lidam mal com a escrita manual. Os mais recentes baseados em aprendizagem automática lidam razoavelmente com letra de imprensa nítida e bastante pior com cursiva.
