PDF → TXT
PDF 파일을 텍스트 파일로 변환합니다
📖 PDF에서 복사한 표가 다 깨지는 이유 가이드 보기
PDF → TXT 변환
PDF 안에는 실제로 연속된 문자열이 저장되어 있지 않고, 각 글자의 폰트·좌표·크기 정보가 페이지 곳곳에 흩어져 있습니다. 이 도구는 PDF.js로 각 페이지의 텍스트 객체를 순서대로 읽어 이어 붙여 일반 TXT 파일로 추출합니다. 텍스트 레이어가 있는 디지털 PDF(워드·한글에서 내보낸 문서, 웹페이지 인쇄본 등)는 원문 그대로 추출되지만, 종이를 스캔해 이미지로만 저장한 PDF는 문자 정보 자체가 없어 OCR(광학 문자 인식) 없이는 추출이 불가능합니다. 계약서 내용 검색, 논문 인용 정리, 이력서 텍스트 재사용, 대량 PDF 문서의 키워드 색인화 등에 활용됩니다.
자주 묻는 질문
스캔 PDF도 변환할 수 있나요?
아니요, 이 도구는 OCR을 수행하지 않습니다. 이미 텍스트 객체가 저장된 '디지털 PDF'만 추출할 수 있으며, 스캔한 사진을 그대로 PDF로 감싼 문서는 글자가 보여도 실제로는 이미지 픽셀일 뿐이라 텍스트가 하나도 추출되지 않습니다. Adobe Acrobat, Google 드라이브 OCR, 전용 OCR 툴로 먼저 텍스트 레이어를 입혀야 합니다.
파일이 서버로 전송되나요?
아니요. PDF.js 라이브러리가 브라우저 안에서 직접 파일을 파싱하며 네트워크 요청 없이 처리가 끝납니다. 계약서·이력서 등 민감한 문서도 안전하게 사용할 수 있습니다.
TXT 파일 인코딩은?
UTF-8로 저장됩니다. 한글·중국어·일본어·이모지를 포함한 대부분의 문자를 깨짐 없이 표현할 수 있습니다. 결과 파일이 메모장에서 깨져 보인다면 인코딩을 UTF-8로 지정해 다시 열어보세요.
페이지 구분이 표시되나요?
네, "--- 페이지 N ---" 형태의 구분선이 각 페이지 앞에 자동으로 삽입됩니다. 원하는 페이지의 내용만 찾거나 특정 페이지만 잘라내어 쓸 때 유용합니다.
표·서식이 유지되나요?
유지되지 않습니다. PDF는 표를 별도 구조가 아니라 개별 텍스트 조각의 좌표값으로 저장하기 때문에, 추출 시 셀 구분이 사라지거나 한 줄로 이어지고 줄바꿈 위치가 어긋날 수 있습니다. 표 데이터가 중요하다면 전용 PDF 표 추출 도구나 수동 정리가 필요합니다.
한글 PDF도 변환되나요?
가능합니다. 다만 일부 PDF는 폰트를 서브셋으로 임베드하면서 실제 유니코드 매핑이 아닌 커스텀 글리프 인덱스를 사용하는 경우가 있어, 이런 파일은 추출 시 문자가 깨지거나 □로 표시될 수 있습니다. 이는 도구의 한계가 아니라 PDF 생성 프로그램의 폰트 임베드 방식 문제입니다.
암호화된 PDF도 처리되나요?
열람 암호(User Password)나 편집 제한(Owner Password)이 걸린 PDF는 처리할 수 없습니다. 먼저 PDF 암호 해제 도구로 잠금을 풀고 사용하세요.
여러 파일을 한 번에 처리할 수 있나요?
현재는 한 번에 한 파일만 지원합니다. 여러 PDF를 처리하려면 파일을 하나씩 순서대로 업로드해 각각 다운로드하면 됩니다.