AI 봇용 robots.txt 생성기
AI 봇 유형별 정책을 선택하고, 특정 크롤러의 설정을 변경한 다음 RFC 9309를 준수하는 파일을 복사하세요. 학습, 검색, 사용자 요청에 따른 가져오기는 서로 다른 토큰을 사용하므로 하나는 차단하고 다른 하나는 허용할 수 있습니다.
# 사이트 전체에서 차단된 AI 크롤러
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /
# 허용된 AI 크롤러. 비공개 경로는 제외
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/
# 그 밖의 모든 크롤러
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/
Sitemap: https://example.com/sitemap.xml
robots.txt는 자발적으로 따르는 규칙입니다. ChatGPT-User, Perplexity-User 등 사용자의 요청으로 페이지를 가져오는 크롤러는 규칙이 적용되지 않을 수 있다고 밝혔고, 일부 에이전트는 토큰조차 없습니다. 차단을 적용하려면 공개된 IP 목록이나 시그니처와 요청을 대조한 뒤 방화벽이나 WAF에서 차단하세요.
생성된 파일의 작동 방식
크롤러는 자체 그룹의 규칙을 따릅니다
User-agent 줄에서 자신의 토큰을 찾은 크롤러는 해당 그룹을 따르고 User-agent: * 아래의 규칙은 건너뜁니다. 따라서 생성기는 이름으로 허용한 봇마다 비공개 경로 규칙을 반복하고, 차단된 봇에는 Disallow: / 하나를 지정합니다.
일부 토큰은 직접 크롤링하지 않습니다
Google-Extended와 Applebot-Extended에는 자체 사용자 에이전트가 없습니다. 실제 페이지는 Googlebot과 Applebot이 가져오며, 확장 토큰은 Google과 Apple에 해당 콘텐츠를 모델 학습에 사용해도 되는지 알립니다. Google은 Gemini의 근거 자료 검색에도 Google-Extended를 적용합니다.
대부분의 운영자는 학습과 검색을 분리합니다
OpenAI, Anthropic, Amazon, Mistral은 각각 학습용 토큰과 검색용 토큰을 별도로 운영하므로, 학습 안 함 프리셋을 선택해도 각 회사의 검색 제품에는 계속 노출됩니다. 예외는 Meta입니다. meta-externalagent는 학습과 색인 생성을 모두 담당합니다.
Applebot은 Googlebot 규칙을 따를 수 있습니다
파일에 Applebot 그룹이 없으면 Apple은 Applebot이 대신 Googlebot 규칙을 따른다고 안내합니다. Applebot과 Amazonbot은 Crawl-delay도 무시하지만, Anthropic은 ClaudeBot이 이를 따른다고 밝혔습니다.
robots.txt와 AI 봇 관련 질문
GPTBot은 차단하면서 ChatGPT 검색은 허용하려면 어떻게 하나요?
GPTBot은 차단하고 OAI-SearchBot은 허용하세요. GPTBot은 학습 데이터를 수집하고, OAI-SearchBot은 ChatGPT 검색을 위해 페이지를 색인하며, ChatGPT-User는 사람이 요청한 페이지를 가져옵니다. OpenAI는 한 페이지에서 세 봇을 각각 별도의 IP 목록과 함께 안내합니다.
Google-Extended를 차단하면 Google 검색에서 사이트가 제외되나요?
Google-Extended는 자체 사용자 에이전트가 없는 제어용 토큰이며, 실제 크롤링은 Googlebot이 수행합니다. Google-Extended를 차단하면 Google이 콘텐츠를 Gemini 학습과 근거 자료 검색에 사용하지 않지만, 검색을 위해 무엇을 크롤링할지는 Googlebot 규칙으로 결정됩니다.
AI 크롤러는 Crawl-delay를 따르나요?
일부는 따릅니다. Anthropic은 ClaudeBot이 이를 따른다고 밝혔지만, Apple과 Amazon은 Applebot과 Amazonbot이 따르지 않는다고 안내합니다. 확실한 방법은 서버에서 요청 속도를 제한하는 것입니다.
차단했는데도 ChatGPT-User가 방문하는 이유는 무엇인가요?
OpenAI는 사람이 페이지를 요청한 경우 robots.txt 규칙이 ChatGPT-User에 적용되지 않을 수 있다고 밝혔습니다. Perplexity-User, Amzn-User, meta-externalfetcher에도 비슷한 예외가 있습니다. 운영자가 IP 목록을 공개한 경우 요청과 목록을 대조해 방화벽에서 차단하세요.
robots.txt의 Content-Signal은 어떤 역할을 하나요?
콘텐츠를 가져온 뒤 어떻게 사용할 수 있는지 search, ai-input, ai-train 세 가지 신호로 나타냅니다. 각 신호의 값은 yes 또는 no입니다. 이는 선호 사항을 표현할 뿐, 어떤 접근도 차단하지 않습니다. Cloudflare의 Markdown for Agents는 기본적으로 ai-train=yes, search=yes, ai-input=yes를 추가하므로, 이 기능을 사용한다면 출력 내용을 확인하세요.