N-그램 분석기
텍스트에서 Unigram, Bigram, Trigram을 추출하고 빈도를 분석합니다
📖 다국어 UI인데 정작 중국어·일본어는 분석 못 하는 N-그램 분석기 가이드 보기
N-그램 분석기
텍스트에서 Unigram(단어), Bigram(2단어 구), Trigram(3단어 구)을 추출하고 빈도를 분석합니다. 다만 기본적으로 켜져 있는 "구두점 제거" 옵션의 정규식([^\w\s가-힣])이 영문·숫자·한글 음절만 남기도록 되어 있어, 중국어 한자와 일본어 히라가나·가타카나, 악센트가 있는 유럽어 문자는 전부 공백으로 지워집니다. 이 도구는 UI 자체가 중국어·일본어로도 번역되어 있지만, 정작 중국어·일본어 텍스트를 분석하려고 하면 구두점 제거 옵션이 켜진 기본 상태에서 한자와 가나 문자가 모두 사라져버립니다.
자주 묻는 질문
중국어나 일본어 텍스트를 넣으면 어떻게 되나요?
기본으로 켜져 있는 "구두점 제거" 옵션의 정규식이 [^\w\s가-힣]이라서 영문자·숫자·공백·한글 음절만 보존하고 나머지는 전부 공백으로 바꿉니다. 그 결과 "这是一个测试。日本語のテストです。한국어 테스트입니다."를 넣으면 한자와 가나는 모두 사라지고 "한국어 테스트입니다"만 남습니다.
이 문제를 피하려면 어떻게 해야 하나요?
중국어나 일본어 텍스트를 분석할 때는 "구두점 제거" 체크박스를 해제하세요. 다만 이 경우 진짜 문장부호(마침표, 쉼표 등)도 토큰에 그대로 남아 N-그램 결과에 섞여 들어갈 수 있습니다.
이 도구는 UI가 중국어·일본어로도 제공되는데, 실제로 그 언어들을 분석할 수 있나요?
인터페이스 번역과 실제 텍스트 처리 로직은 별개입니다. 화면은 한국어/영어/중국어/일본어로 번역되어 있지만, 핵심 정규식이 한글 음절과 영문만 보존하도록 만들어져 있어 기본 설정으로는 중국어·일본어 원문 분석에 적합하지 않습니다.
CSV로 내보낸 결과에 큰따옴표가 포함된 n-그램이 있으면 문제가 되나요?
네. CSV 내보내기 코드가 각 필드를 큰따옴표로 감싸기만 하고 필드 내부의 큰따옴표는 이스케이프(두 번 반복)하지 않습니다. 구두점 제거를 켜두면 따옴표 자체가 미리 제거되어 문제되지 않지만, 구두점 제거를 끈 상태에서 원문에 큰따옴표가 있으면 내보낸 CSV 파일의 열 구조가 깨질 수 있습니다.
N-그램이란 무엇인가요?
N개의 연속된 단어 또는 문자의 묶음입니다. 1-gram(단어), 2-gram(두 단어 조합), 3-gram(세 단어 조합)으로 구분됩니다.
N-그램 분석을 어디에 사용하나요?
SEO 키워드 연구, 텍스트 분류, 언어 모델 훈련, 표절 탐지 등에 활용됩니다.
불용어를 제거하면 더 유용한가요?
콘텐츠 분석 목적이라면 불용어(the, a, is 등 영어 기본 단어 목록 기준) 제거 시 더 의미 있는 결과를 얻을 수 있습니다. 단, 내장된 불용어 목록은 영어 단어로만 구성되어 있어 한국어·중국어·일본어 텍스트에는 이 옵션이 사실상 효과가 없습니다.
4-gram, 5-gram도 분석할 수 있나요?
현재 도구는 1~3-gram을 지원합니다. 더 높은 N을 위해서는 별도 NLP 도구를 활용하세요.