단어 빈도 분석기
텍스트의 단어 빈도를 분석합니다
📖 빈도 막대그래프의 %가 어떤 값을 기준으로 하는지 가이드 보기
단어 빈도 분석기
이 도구는 입력한 텍스트를 공백 기준으로만 나누어 각 조각을 하나의 '단어'로 취급합니다. 구두점 제거 옵션은 한글·일본어 가나·한자 유니코드 범위까지 포함한 정규식으로 문장부호만 골라 지우지만, 정작 단어를 나누는 기준 자체는 여전히 공백입니다. 그래서 영어처럼 단어 사이에 항상 공백이 있는 언어에는 잘 맞지만, 공백을 거의 쓰지 않는 중국어나 조사가 단어에 그대로 붙는 한국어에서는 실제 의미 단위와 이 도구가 나누는 '단어' 경계가 다를 수 있습니다. 불용어 제거 옵션 역시 영어 단어(a, the, is 등) 목록 하나만 내장돼 있어, 한국어·중국어·일본어 텍스트에 이 옵션을 켜도 실질적으로 걸러지는 단어는 거의 없습니다.
자주 묻는 질문
중국어나 일본어 텍스트에서는 단어가 어떻게 나뉘나요?
이 도구는 공백을 기준으로만 텍스트를 나눕니다. 중국어는 단어 사이에 공백을 쓰지 않는 경우가 많아 문장 전체가 하나의 '단어'로 묶일 수 있고, 일본어도 공백 없이 이어 쓰는 경우가 많아 비슷한 문제가 생깁니다. 정확한 분석이 필요하다면 형태소 분석기를 사용하는 전용 도구가 더 적합합니다.
불용어 제거를 켜면 한국어·중국어·일본어 텍스트에도 적용되나요?
거의 적용되지 않습니다. 이 옵션은 a, the, is, are 같은 고정된 영어 단어 목록 하나만 참조하므로, 한국어의 '이', '그', '저' 같은 조사·지시어나 중국어·일본어의 기능어는 이 목록에 없어 걸러지지 않습니다.
결과를 JSON으로도 내보낼 수 있나요?
아니요, CSV 내보내기만 지원합니다. CSV 버튼을 누르면 단어와 빈도가 담긴 .csv 파일이 다운로드되며, JSON 형식 내보내기 기능은 없습니다.
결과를 워드 클라우드로 볼 수 있나요?
아니요, 별도의 워드 클라우드 시각화는 없습니다. 각 단어 옆에 표시되는 막대는 표 안의 단순한 상대 길이 막대이며, 이미지 형태의 워드 클라우드를 생성하는 기능은 제공하지 않습니다.
막대(bar)의 길이는 무엇을 기준으로 정해지나요?
현재 결과에서 가장 빈도가 높은 단어를 100%로 놓고, 나머지 단어의 빈도를 그 값에 대한 비율로 환산해 막대 길이를 정합니다. 즉 절대적인 척도가 아니라 최소 빈도·상위 N 필터를 적용한 뒤 남은 단어들 사이의 상대적 비교입니다.
비율(%) 열은 무엇을 기준으로 한 비율인가요?
고유 단어 수가 아니라, 필터링 전 전체 토큰(단어 발생 횟수) 수를 분모로 한 비율입니다. 예를 들어 전체 1,000개 토큰 중 특정 단어가 20번 나오면 2.0%로 표시됩니다.
최소 빈도와 상위 N 옵션은 어떤 순서로 적용되나요?
먼저 최소 빈도 조건을 만족하는 단어만 남긴 뒤, 빈도가 높은 순으로 정렬하고, 그중 상위 N개만 잘라서 보여줍니다. 최소 빈도를 낮게 설정해도 상위 N이 작으면 그 이후 단어는 결과에 나타나지 않습니다.
URL이나 이메일 주소가 포함된 텍스트는 어떻게 처리되나요?
구두점 제거 옵션이 켜져 있으면 콜론(:)이나 슬래시(/), 골뱅이(@) 같은 문자가 전부 제거되므로, "https://example.com" 같은 URL은 하나의 토큰이 아니라 https, example.com처럼 여러 조각으로 쪼개지거나 변형될 수 있습니다. URL을 있는 그대로 분석하고 싶다면 구두점 제거를 꺼야 합니다.