불용어 제거기
텍스트에서 Stopword 자동 제거 · 커스텀 불용어 · 강조 미리보기
📖 TF-IDF 돌리기 전에 불용어부터 지우는 이유 가이드 보기
불용어 제거기
이 도구는 텍스트를 공백 기준으로 토큰화한 뒤, 각 토큰에서 알파벳이 아닌 문자(마침표, 쉼표 등 구두점)를 제거한 나머지가 불용어 목록에 있는지 하나씩 대조하는 방식으로 동작합니다. 기본으로 the, a, is, are 등 약 70개의 영어 불용어를 내장하고 있으며, 쉼표로 구분한 커스텀 단어를 추가하면 이 목록에 합쳐집니다. 처리 결과를 텍스트로만 보여주는 대신, 원문에서 제거 대상 단어를 빨간색 취소선으로 표시하는 미리보기를 함께 제공해 어떤 단어가 왜 걸러졌는지 바로 확인할 수 있습니다. 워드 클라우드나 키워드 빈도 분석 전에 노이즈를 제거하거나, 텍스트 마이닝·머신러닝 모델의 학습 데이터를 전처리할 때 활용됩니다.
자주 묻는 질문
불용어란?
the, a, is, are처럼 문장에서 문법적 역할만 하고 그 자체로는 주제나 의미를 담지 않아, 텍스트 분석을 할 때 통계를 왜곡시키는 고빈도 단어입니다. 이 도구는 이런 단어 약 70개를 기본 목록으로 내장하고 있습니다.
커스텀 불용어 추가 방법은?
'커스텀 불용어' 입력란에 쉼표로 구분해 단어를 입력하면 기본 목록에 합쳐집니다. 특정 브랜드명이나 반복적으로 등장하는 인사말처럼, 일반적인 불용어 목록에는 없지만 이번 분석에서는 제외하고 싶은 단어를 추가할 때 사용합니다.
강조 미리보기는 어떻게 사용하나요?
입력한 텍스트를 그대로 보여주되, 불용어로 판정되어 제거될 단어에만 빨간색 취소선을 씌워 보여줍니다. 실제로 제거를 실행하기 전에 어떤 단어가 걸러질지 미리 검토하고, 의도치 않게 걸러지는 단어가 있으면 옵션을 조정할 수 있습니다.
한국어 불용어도 제거할 수 있나요?
기본 내장 목록은 영어 단어로만 구성되어 있어 한국어 조사나 접속사는 자동으로 걸러지지 않습니다. 다만 커스텀 불용어 입력란에 '그리고', '하지만'처럼 원하는 한국어 단어를 직접 쉼표로 나열하면 동일하게 제거 대상에 포함시킬 수 있습니다.
대소문자 무시 옵션이란?
이 옵션을 켜면 비교 전에 단어를 소문자로 변환하기 때문에 The, THE, the가 모두 같은 불용어로 인식되어 제거됩니다. 끄면 대소문자가 정확히 일치하는 경우만 불용어로 처리되어, 문장 맨 앞의 대문자 The는 걸러지지 않을 수 있습니다.
NLP/머신러닝에 어떻게 활용하나요?
TF-IDF나 워드 임베딩 같은 자연어 처리 기법을 적용하기 전에, 통계적으로 의미 없는 고빈도 단어를 미리 걸러내면 모델이 실제로 의미 있는 단어에 더 집중할 수 있습니다. 이 도구로 소규모 텍스트를 빠르게 전처리해 결과를 확인해볼 수 있습니다.
결과에서 빈 칸이 여러 개 생기면?
불용어를 제거하면 그 자리가 빈 문자열이 되므로 단어 사이에 공백이 겹칠 수 있는데, 이 도구는 연속된 공백을 자동으로 하나로 줄이는 후처리를 적용합니다. 다만 문장 구조에 따라 부자연스러운 공백이 남을 수 있으니 결과 텍스트를 확인 후 필요시 직접 다듬으세요.
구두점도 제거되나요?
아니요. 이 도구는 단어를 불용어 목록과 대조할 때만 구두점을 임시로 무시할 뿐, 실제 출력 결과에서는 마침표·쉼표 등 구두점을 원래 위치에 그대로 남겨둡니다.