Text · Instrument
텍스트 유사도 검사기
두 텍스트의 유사도를 코사인·자카드·편집 거리로 분석합니다
텍스트 A지우기
텍스트 B교체
—
종합 유사도
—
코사인 유사도
단어 벡터 기반
—
자카드 유사도
집합 교집합 / 합집합
—
편집 거리 유사도
Levenshtein 기반
세부 정보
텍스트 A 길이—
텍스트 B 길이—
A 단어 수—
B 단어 수—
A 고유 단어—
B 고유 단어—
텍스트 유사도 검사기
두 텍스트 사이의 유사도를 코사인 유사도, 자카드 유사도, 편집 거리(Levenshtein) 세 가지 방법으로 측정합니다. 표절 검사, 문서 비교, 중복 콘텐츠 탐지, 문장 변형 확인 등 다양한 목적에 활용할 수 있습니다. 공통 단어 목록과 세부 통계도 제공합니다.
자주 묻는 질문
코사인 유사도란 무엇인가요?
두 텍스트를 단어 빈도 벡터로 표현하고 두 벡터 사이의 각도를 측정하는 방법입니다. 단어 집합이 유사할수록 높은 점수를 받습니다.
자카드 유사도란 무엇인가요?
두 집합의 교집합을 합집합으로 나눈 값입니다. 두 텍스트가 공유하는 고유 단어 비율을 측정합니다.
편집 거리란 무엇인가요?
한 텍스트를 다른 텍스트로 바꾸기 위한 최소 편집(삽입/삭제/대체) 횟수입니다. 이를 정규화하여 유사도로 표현합니다.
어떤 유사도 지표가 가장 정확한가요?
목적에 따라 다릅니다. 표절 검사에는 자카드, 의미적 유사성에는 코사인, 문자 수준 비교에는 편집 거리가 적합합니다.
100% 유사도는 어떤 의미인가요?
두 텍스트가 완전히 동일하다는 의미입니다.
한국어 텍스트도 비교할 수 있나요?
예, 공백 기준 단어 분리로 비교합니다. 형태소 분석 없이도 기본 유사도 측정이 가능합니다.
이 도구로 표절을 확인할 수 있나요?
유사도가 높은 경우 표절 가능성이 있지만, 완전한 표절 검사 도구는 아닙니다. 참고용으로 활용하세요.
긴 텍스트도 처리할 수 있나요?
예, 브라우저에서 처리되지만 매우 긴 텍스트(수만 단어 이상)는 편집 거리 계산이 느려질 수 있습니다.