용어집

PDF OCR란 무엇인가요?

PDF OCR(광학 문자 인식)이란 스캔된 PDF 안에 이미지로만 존재하는 글자를 선택·검색이 가능하고 기계가 읽을 수 있는 텍스트로 바꾸는 과정을 말합니다.

PDF에는 두 종류가 있습니다. 텍스트 레이어가 있는 PDF(예: Word나 LaTeX에서 내보낸 디지털 네이티브 파일)는 글자를 바로 읽을 수 있습니다. 반면 스캔 PDF(종이를 사진으로 찍거나 스캐너로 들여온 파일)는 페이지 자체가 그저 글자가 찍힌 그림일 뿐입니다. OCR이 없으면 두 번째 종류는 검색할 수도, 복사할 수도, 요약할 수도 없습니다.

텍스트 레이어가 있는 PDF를 최대 50MB, 1,000쪽까지 업로드할 수 있습니다. 이미지로만 된 스캔은 업로드 전에 OCR이 필요합니다. 구조화된 요약과 사용 가능한 맥락의 챗이 이어지며, 데이터 처리 조건은 개인정보 처리방침을 확인하세요.

OCR 정확도는 스캔 품질, 레이아웃, 언어, 글꼴에 따라 달라지므로 중요한 결과는 직접 확인해야 합니다.

Summio의 자리

텍스트 레이어가 있는 PDF를 최대 50MB, 1,000쪽까지 업로드할 수 있습니다. 이미지로만 된 스캔은 업로드 전에 OCR이 필요합니다. 구조화된 요약과 사용 가능한 맥락의 챗이 이어지며, 데이터 처리 조건은 개인정보 처리방침을 확인하세요.

Summio에 대해 더 알아보기

자주 묻는 질문

PDF OCR은 무료인가요?

OCR 요금과 조건은 선택한 외부 도구에 따라 다릅니다. 텍스트 레이어가 있는 PDF를 최대 50MB, 1,000쪽까지 업로드할 수 있습니다. 이미지로만 된 스캔은 업로드 전에 OCR이 필요합니다. 구조화된 요약과 사용 가능한 맥락의 챗이 이어지며, 데이터 처리 조건은 개인정보 처리방침을 확인하세요.

스캔한 책에 대해 OCR은 얼마나 정확한가요?

OCR 정확도는 스캔 품질, 레이아웃, 언어, 글꼴에 따라 달라지므로 중요한 결과는 직접 확인해야 합니다.

OCR이 손글씨 PDF에도 잘 되나요?

구식 OCR 엔진은 손글씨에 약합니다. 머신러닝 기반의 최신 OCR은 또박또박한 활자체에 가까운 글씨는 꽤 잘 처리하지만, 흘려 쓴 필기체는 여전히 약합니다.