PDF · Instrument
📄 PDF OCR 텍스트 추출기
스캔된 PDF에서 OCR로 텍스트를 인식합니다
PDF 파일을 드래그하거나 클릭해 선택
💡 안내: 이 도구는 PDF.js로 각 페이지를 캔버스에 렌더링한 후 Tesseract.js로 OCR을 수행합니다. 텍스트 레이어가 있는 일반 PDF는 즉시 텍스트 추출, 스캔본(이미지 PDF)은 OCR 인식을 사용합니다.
PDF OCR 텍스트 추출기란?
스캔된 문서나 이미지로 된 PDF에서 텍스트를 자동으로 인식하는 도구입니다. PDF.js로 각 페이지를 고해상도 캔버스에 렌더링한 후 Tesseract.js OCR 엔진으로 문자를 인식합니다. 한국어, 영어, 중국어, 일본어 등 다양한 언어를 지원하며, 페이지 범위를 지정해 필요한 부분만 처리할 수 있습니다. 텍스트 레이어가 있는 일반 PDF는 즉시 텍스트를 추출하고, 스캔본(이미지 PDF)만 OCR 처리합니다.
자주 묻는 질문
Q. OCR 정확도는 얼마나 되나요?
A. 인쇄체 문서는 95% 이상, 손글씨나 저화질 스캔은 낮을 수 있습니다. 고해상도 스캔 사용을 권장합니다.
Q. 어떤 언어를 지원하나요?
A. 한국어, 영어, 중국어 간체, 일본어를 지원합니다. 다국어 혼합 문서는 복합 언어 옵션을 선택하세요.
Q. 파일이 서버에 업로드되나요?
A. 아닙니다. 모든 처리는 브라우저에서 로컬로 이루어집니다. 파일은 외부로 전송되지 않습니다.
Q. 페이지 수 제한이 있나요?
A. 기술적 제한은 없지만 페이지가 많을수록 처리 시간이 길어집니다. 대용량은 범위를 나눠 처리하세요.
Q. 일반 PDF와 스캔 PDF 차이는?
A. 일반 PDF는 텍스트 레이어가 있어 즉시 추출, 스캔 PDF는 이미지이므로 OCR 인식이 필요합니다.
Q. 처리가 너무 느려요.
A. OCR은 CPU 집약적 작업입니다. 페이지 범위를 좁히거나 낮은 해상도 스케일을 사용하면 빨라집니다.
Q. 결과 텍스트를 어떻게 저장하나요?
A. 복사 버튼으로 클립보드에 복사하거나 TXT 다운로드 버튼으로 파일로 저장할 수 있습니다.
Q. 암호화된 PDF도 처리되나요?
A. 암호화된 PDF는 먼저 PDF 잠금 해제 도구로 암호를 제거한 후 사용하세요.