📄 PDF OCR 텍스트 추출기
스캔된 PDF에서 OCR로 텍스트를 인식합니다
PDF 파일을 드래그하거나 클릭해 선택
📖 PDF OCR가 페이지마다 다르게 동작하는 원리 가이드 보기
PDF OCR 텍스트 추출기란?
스캔된 문서나 이미지로 된 PDF에서 텍스트를 자동으로 인식하는 도구입니다. 페이지마다 독립적으로 PDF.js의 getTextContent()가 반환하는 텍스트 항목 수(5개 초과)를 기준으로 임베디드 텍스트 레이어 여부를 판단해, 텍스트 레이어가 있는 페이지는 즉시 직접 추출하고 없는 페이지만 캔버스에 2배 스케일로 렌더링한 뒤 Tesseract.js OCR을 수행합니다. 디지털로 만든 표지 + 스캔된 본문처럼 페이지마다 성격이 다른 혼합 PDF도 각 페이지에 맞는 방식으로 정확히 처리됩니다. 한국어, 영어, 중국어, 일본어를 지원하며 페이지 범위를 지정해 필요한 부분만 처리할 수 있습니다.
자주 묻는 질문
Q. OCR 정확도는 얼마나 되나요?
A. 인쇄체 문서는 95% 이상, 손글씨나 저화질 스캔은 낮을 수 있습니다. 이 도구는 원본 대비 2배 스케일로 페이지를 렌더링해 Tesseract에 더 선명한 이미지를 전달하므로, 저해상도 원본 PDF도 어느 정도 인식률이 개선됩니다.
Q. 어떤 언어를 지원하나요?
A. 한국어, 영어, 중국어 간체, 일본어를 지원합니다. 다국어 혼합 문서는 복합 언어 옵션(예: 한국어+English)을 선택하세요.
Q. 파일이 서버에 업로드되나요?
A. 아닙니다. 모든 처리는 브라우저에서 로컬로 이루어집니다. 파일은 외부로 전송되지 않습니다.
Q. 페이지 수 제한이 있나요?
A. 기술적 제한은 없지만 페이지가 많을수록 처리 시간이 길어집니다. 대용량은 범위를 나눠 처리하세요.
Q. 일반 PDF와 스캔 PDF가 섞여 있는 문서도 정확히 처리되나요?
A. 네. 페이지 전체가 아니라 페이지마다 개별적으로 텍스트 레이어 유무를 확인합니다. 예를 들어 디지털로 작성한 표지 뒤에 스캔된 본문이 이어지는 문서라면, 표지는 즉시 텍스트 추출하고 본문 페이지만 Tesseract OCR을 수행합니다. 첫 페이지 하나만 보고 문서 전체의 처리 방식을 결정하지 않습니다.
Q. 처리가 너무 느려요.
A. OCR은 CPU 집약적 작업입니다. 페이지 범위를 좁히거나, 이미 텍스트 레이어가 있는 페이지는 자동으로 OCR을 건너뛰므로 스캔 페이지가 많을수록만 시간이 늘어납니다.
Q. 결과 텍스트를 어떻게 저장하나요?
A. 복사 버튼으로 클립보드에 복사하거나 TXT 다운로드 버튼으로 파일로 저장할 수 있습니다.
Q. 암호화된 PDF도 처리되나요?
A. 암호화된 PDF는 먼저 PDF 잠금 해제 도구로 암호를 제거한 후 사용하세요.