유니코드 인스펙터
문자별 코드포인트·UTF-8 바이트·HTML 엔티티 분석
유니코드 인스펙터란?
텍스트의 각 문자에 대해 유니코드 코드포인트(U+XXXX), UTF-8 바이트 시퀀스, HTML 엔티티를 한눈에 분석합니다. 특수문자, 이모지, 한글, CJK 문자 디버깅에 필수 도구입니다.
자주 묻는 질문
유니코드 코드포인트란?
각 문자에 할당된 고유 번호입니다. 'A'는 U+0041, '가'는 U+AC00입니다.
UTF-8 바이트란?
유니코드 문자를 인코딩한 실제 바이트 값입니다. 영문은 1바이트, 한글은 3바이트입니다.
HTML 엔티티란?
HTML에서 특수문자를 표현하는 방법입니다. '<'는 <, '>'는 >입니다.
이모지는 몇 바이트인가요?
대부분의 이모지는 UTF-8에서 4바이트, 일부 복합 이모지는 더 많은 바이트를 차지합니다.
BOM(Byte Order Mark)이란?
UTF-8 파일 시작에 붙는 특수 바이트 시퀀스(EF BB BF)로, 파일 인코딩을 나타냅니다.
제어 문자가 포함된 경우 어떻게 되나요?
탭(U+0009), 줄바꿈(U+000A) 등 제어 문자도 코드포인트와 함께 표시됩니다.
특수문자를 복사할 수 있나요?
네, 각 문자 카드를 클릭하면 해당 문자를 클립보드에 복사합니다.
최대 몇 자까지 분석 가능한가요?
브라우저 성능을 고려해 500자 이내를 권장합니다.
호모글리프(동형이의 문자) 피싱이란?
육안으로는 완전히 동일해 보이지만 실제로는 다른 유니코드 문자인 경우를 호모글리프라고 합니다. 예를 들어 라틴 알파벳 'a'(U+0061)와 키릴 문자 'а'(U+0430)는 화면에서 거의 구분이 안 되지만 서로 다른 코드포인트입니다. 이를 악용해 apple.com처럼 보이지만 실제로는 키릴 문자가 섞인 가짜 도메인으로 사용자를 속이는 피싱 공격(IDN 호모그래프 공격)이 실제로 발생합니다. 의심스러운 링크의 문자를 이 도구로 분석하면 코드포인트 차이를 즉시 확인할 수 있습니다.
NFC/NFD 정규화 차이로 파일명이 깨지는 문제는?
한글은 자모를 결합해 표현하는 방식이 두 가지입니다: NFC(완성형, 결합된 하나의 코드포인트로 저장, 예: '가'=U+AC00 하나)와 NFD(조합형, 자모를 분리해 저장, 예: 'ㄱ'+'ㅏ' 두 코드포인트). macOS(HFS+/APFS)는 파일명을 NFD로 저장하는 반면 Windows·대부분의 웹 환경은 NFC를 사용합니다. 그 결과 맥에서 만든 한글 파일명이 담긴 폴더를 Windows나 리눅스 서버에 압축 해제하면 파일명이 깨지거나 검색이 안 되는 문제가 실제로 자주 발생합니다.
화면에 안 보이는 특수문자는 어떻게 찾나요?
ZWSP(Zero-Width Space, U+200B)처럼 폭이 0이라 화면에 전혀 보이지 않는 문자가 텍스트에 섞여 있으면 복사-붙여넣기 시 예상치 못한 검색 실패나 문자열 비교 오류가 발생합니다. 이 도구에 텍스트를 붙여넣으면 각 문자의 코드포인트가 모두 표시되므로, 화면상 빈칸처럼 보이는 위치에 U+200B, U+FEFF(BOM), U+00A0(줄바꿈 없는 공백) 등이 숨어있는지 즉시 확인할 수 있습니다.