Robots.txt Generator
robots.txt 파일 시각적 생성·미리보기
robots.txt란?
robots.txt는 웹사이트 루트 디렉토리에 위치하는 텍스트 파일로, 검색 엔진 크롤러에게 사이트의 어떤 부분을 크롤링해도 되는지 지시합니다. Robots Exclusion Protocol(REP)을 따르며, User-agent별로 Allow와 Disallow 규칙을 설정할 수 있습니다. 올바른 robots.txt 설정은 크롤 예산을 효율적으로 사용하고, 중복 콘텐츠 크롤링을 방지하며, 민감한 경로를 검색 엔진에서 숨기는 데 도움이 됩니다. 최근에는 GPTBot, CCBot 등 AI 학습 크롤러를 차단하는 용도로도 활발히 활용됩니다.
자주 묻는 질문
robots.txt란 무엇인가요?
robots.txt는 웹사이트의 루트(예: https://example.com/robots.txt)에 위치하는 텍스트 파일로, 검색 엔진 크롤러가 사이트를 방문할 때 가장 먼저 읽습니다. 어떤 페이지를 크롤링하고 어떤 페이지를 건너뛰어야 하는지 지시합니다. 단, 법적 구속력은 없으며 악의적인 봇은 무시할 수 있습니다.
Google은 robots.txt를 반드시 따르나요?
Googlebot은 일반적으로 robots.txt를 존중합니다. 하지만 robots.txt로 차단된 URL도 다른 사이트에서 링크가 있으면 검색 결과에 URL만 표시될 수 있습니다(스니펫 없이). 완전히 검색 결과에서 제외하려면 noindex 메타 태그와 함께 사용하세요.
Allow와 Disallow 중 어느 쪽이 우선인가요?
Google은 더 구체적인(경로가 긴) 규칙을 우선합니다. 예를 들어 Disallow: /wp-admin/ 과 Allow: /wp-admin/admin-ajax.php 가 함께 있으면 admin-ajax.php는 크롤링이 허용됩니다. 길이가 같을 경우 Allow가 Disallow보다 우선합니다.
Sitemap을 robots.txt에 선언하면 어떤 효과가 있나요?
Sitemap: 지시어로 사이트맵 URL을 명시하면 Googlebot, Bingbot 등이 robots.txt를 파싱할 때 사이트맵을 자동으로 발견합니다. Google Search Console 외에도 Bing Webmaster Tools 등 다른 검색 엔진에도 별도 제출 없이 사이트맵이 전달됩니다.
Crawl-delay는 모든 크롤러가 지원하나요?
Crawl-delay는 Bingbot, Yandex, Baidu 등은 지원하지만 Googlebot은 공식적으로 무시합니다. Google의 크롤링 속도를 제한하려면 Google Search Console → 이전 도구 및 보고서 → 크롤링 속도에서 설정하세요.
GPTBot, CCBot 등 AI 봇을 차단할 수 있나요?
User-agent: GPTBot 에 Disallow: / 를 설정하면 OpenAI 크롤러를 차단합니다. 마찬가지로 CCBot(Common Crawl), anthropic-ai, Google-Extended(Bard 학습용) 등도 차단 가능합니다. 단, 모든 AI 기업이 robots.txt를 준수하지는 않을 수 있습니다.
robots.txt와 meta robots 태그의 차이는?
robots.txt는 크롤러가 페이지에 접근하는 것 자체를 막고, meta robots 태그(<meta name="robots" content="noindex">)는 페이지에 접근은 허용하되 인덱싱을 막습니다. 민감한 페이지를 완전히 숨기려면 두 가지를 병행하거나, 서버 인증을 추가하는 것이 안전합니다.
Google Search Console에서 robots.txt를 테스트할 수 있나요?
네. Google Search Console → 설정 → robots.txt 보고서에서 현재 사이트의 robots.txt 내용을 확인하고, 특정 URL이 Googlebot에 의해 차단되는지 테스트할 수 있습니다. URL 검사 도구에서도 개별 URL의 크롤링 가능 여부를 확인할 수 있습니다.