MODOO HUB ← 모두의 툴
PDF · Instrument

PDF 단어 수 카운터

PDF에서 텍스트를 추출하고 단어 수, 문자 수를 분석합니다

📄
PDF 파일을 드래그하거나 클릭하세요
텍스트 레이어가 있는 PDF만 가능 · 스캔된 PDF는 지원 안 됨

📖 PDF 단어 수 세기, 중국어·일본어는 왜 부정확할까 가이드 보기

PDF 단어 수 카운터

PDF.js의 getTextContent()로 페이지마다 텍스트 조각(item)들을 가져와 공백으로 이어붙인 뒤, 그 문자열을 공백 기준으로 잘라 단어 수를 셉니다. 영어·한국어처럼 단어(또는 어절) 사이에 실제 공백이 있는 언어는 이 방식이 잘 맞지만, 중국어·일본어처럼 글자 사이에 공백이 없는 언어는 PDF.js가 내부적으로 나눈 텍스트 조각 경계에 따라 "단어" 수가 정해지므로 실제 단어 개수와는 다르게(대개 훨씬 적게) 집계됩니다 — 이런 언어는 문자 수 통계가 더 신뢰할 수 있는 지표입니다. 페이지별 통계도 함께 제공되며, PDF.js를 사용해 브라우저에서 직접 처리하므로 파일이 서버에 업로드되지 않습니다. 스캔된 이미지 PDF나 암호로 보호된 PDF를 업로드하면 텍스트 레이어가 없거나 파일을 열 수 없다는 안내 메시지가 명확하게 표시됩니다.

자주 묻는 질문

단어 수는 정확히 어떻게 계산되나요?

PDF.js가 페이지에서 추출한 텍스트 조각들을 공백으로 이어붙인 뒤, 그 결과 문자열을 연속된 공백 기준으로 나눠 빈 조각을 제외하고 개수를 셉니다. 문자 수는 이어붙인 문자열의 전체 길이, 공백 제외 문자 수는 여기서 공백 문자를 모두 뺀 길이입니다.

중국어·일본어 PDF의 "단어 수"도 정확한가요?

아니요, 주의가 필요합니다. 중국어와 일본어는 단어 사이에 공백을 쓰지 않으므로, 공백 기준으로 세는 이 방식으로는 실제 단어 개수 대신 PDF.js가 내부적으로 나눈 텍스트 조각(스타일이나 위치가 바뀌는 지점 등) 개수에 가까운 값이 나옵니다. 실제 텍스트 분량을 비교하려면 단어 수보다 문자 수(공백 제외) 통계를 기준으로 삼는 것이 훨씬 정확합니다. 한국어는 어절 사이에 공백이 있어 상대적으로 신뢰도가 높지만, 영어의 "word" 개념과는 다르다는 점은 마찬가지입니다.

암호로 보호된 PDF를 업로드하면 어떻게 되나요?

파일을 열 수 없다는 안내 메시지가 표시됩니다. PDF.js는 암호가 걸린 문서를 별도 처리 없이 열려고 하면 로딩 자체를 거부하므로, 이 경우 PDF 잠금 해제 도구로 먼저 암호를 해제한 뒤 다시 업로드해야 분석이 가능합니다.

스캔된 PDF도 처리할 수 있나요?

아니요. 이 도구는 PDF 안에 저장된 텍스트 레이어를 추출합니다. 스캔된 이미지로만 이루어진 PDF는 추출할 텍스트가 없으므로 PDF OCR 도구로 먼저 텍스트를 인식시켜야 합니다.

파일이 서버에 업로드되나요?

아니요. PDF.js를 사용해 브라우저 안에서만 파싱하며, 파일 데이터는 네트워크로 전송되지 않습니다.

페이지별 단어 수를 확인할 수 있나요?

예, 결과 하단 표에서 페이지별 단어 수·문자 수·공백 제외 문자 수를 확인할 수 있습니다.

추출된 텍스트를 저장할 수 있나요?

텍스트 복사 버튼으로 전체 추출 텍스트를 클립보드에 복사할 수 있습니다. 미리보기 영역에는 앞부분 2,000자까지만 표시됩니다.

대용량 PDF도 처리 가능한가요?

브라우저 메모리 한도 내에서 가능하며, 일반적으로 100MB 이하 파일은 문제없이 처리됩니다. 페이지 수가 매우 많으면 페이지를 순차적으로 처리하므로 시간이 다소 걸릴 수 있습니다.