MODOO HUB ← 모두의 툴
🌐 EN
SEO · Instrument

Robots.txt Generator

robots.txt 파일 시각적 생성·미리보기

자주 쓰는 경로

robots.txt란?

robots.txt는 웹사이트 루트 디렉토리에 위치하는 텍스트 파일로, 검색 엔진 크롤러에게 사이트의 어떤 부분을 크롤링해도 되는지 지시합니다. Robots Exclusion Protocol(REP)을 따르며, User-agent별로 Allow와 Disallow 규칙을 설정할 수 있습니다. 올바른 robots.txt 설정은 크롤 예산을 효율적으로 사용하고, 중복 콘텐츠 크롤링을 방지하며, 민감한 경로를 검색 엔진에서 숨기는 데 도움이 됩니다. 최근에는 GPTBot, CCBot 등 AI 학습 크롤러를 차단하는 용도로도 활발히 활용됩니다.

자주 묻는 질문

robots.txt란 무엇인가요?

robots.txt는 웹사이트의 루트(예: https://example.com/robots.txt)에 위치하는 텍스트 파일로, 검색 엔진 크롤러가 사이트를 방문할 때 가장 먼저 읽습니다. 어떤 페이지를 크롤링하고 어떤 페이지를 건너뛰어야 하는지 지시합니다. 단, 법적 구속력은 없으며 악의적인 봇은 무시할 수 있습니다.

Google은 robots.txt를 반드시 따르나요?

Googlebot은 일반적으로 robots.txt를 존중합니다. 하지만 robots.txt로 차단된 URL도 다른 사이트에서 링크가 있으면 검색 결과에 URL만 표시될 수 있습니다(스니펫 없이). 완전히 검색 결과에서 제외하려면 noindex 메타 태그와 함께 사용하세요.

Allow와 Disallow 중 어느 쪽이 우선인가요?

Google은 더 구체적인(경로가 긴) 규칙을 우선합니다. 예를 들어 Disallow: /wp-admin/ 과 Allow: /wp-admin/admin-ajax.php 가 함께 있으면 admin-ajax.php는 크롤링이 허용됩니다. 길이가 같을 경우 Allow가 Disallow보다 우선합니다.

Sitemap을 robots.txt에 선언하면 어떤 효과가 있나요?

Sitemap: 지시어로 사이트맵 URL을 명시하면 Googlebot, Bingbot 등이 robots.txt를 파싱할 때 사이트맵을 자동으로 발견합니다. Google Search Console 외에도 Bing Webmaster Tools 등 다른 검색 엔진에도 별도 제출 없이 사이트맵이 전달됩니다.

Crawl-delay는 모든 크롤러가 지원하나요?

Crawl-delay는 Bingbot, Yandex, Baidu 등은 지원하지만 Googlebot은 공식적으로 무시합니다. Google의 크롤링 속도를 제한하려면 Google Search Console → 이전 도구 및 보고서 → 크롤링 속도에서 설정하세요.

GPTBot, CCBot 등 AI 봇을 차단할 수 있나요?

User-agent: GPTBot 에 Disallow: / 를 설정하면 OpenAI 크롤러를 차단합니다. 마찬가지로 CCBot(Common Crawl), anthropic-ai, Google-Extended(Bard 학습용) 등도 차단 가능합니다. 단, 모든 AI 기업이 robots.txt를 준수하지는 않을 수 있습니다.

robots.txt와 meta robots 태그의 차이는?

robots.txt는 크롤러가 페이지에 접근하는 것 자체를 막고, meta robots 태그(<meta name="robots" content="noindex">)는 페이지에 접근은 허용하되 인덱싱을 막습니다. 민감한 페이지를 완전히 숨기려면 두 가지를 병행하거나, 서버 인증을 추가하는 것이 안전합니다.

Google Search Console에서 robots.txt를 테스트할 수 있나요?

네. Google Search Console → 설정 → robots.txt 보고서에서 현재 사이트의 robots.txt 내용을 확인하고, 특정 URL이 Googlebot에 의해 차단되는지 테스트할 수 있습니다. URL 검사 도구에서도 개별 URL의 크롤링 가능 여부를 확인할 수 있습니다.