dotsagent.io
언어:한국어
사이트 공개 · 생성기

AI 봇용 robots.txt 생성기

AI 봇 유형별 정책을 선택하고, 특정 크롤러의 설정을 변경한 다음 RFC 9309를 준수하는 파일을 복사하세요. 학습, 검색, 사용자 요청에 따른 가져오기는 서로 다른 토큰을 사용하므로 하나는 차단하고 다른 하나는 허용할 수 있습니다.

다음 설정으로 시작
학습

이 봇들을 차단하면 해당 운영자가 페이지를 모델 학습에 사용하는 것을 거부하면서 검색 결과에는 계속 표시되도록 할 수 있습니다.

검색

이 크롤러도 차단하면 Googlebot과 Applebot까지 차단되어 Google 검색과 Apple의 Siri, Spotlight, Safari 검색 결과에서 사이트가 제외됩니다.

사용자 요청

사람의 요청에 따라 페이지를 가져오는 크롤러입니다. 여러 운영자는 robots.txt 규칙이 적용되지 않을 수 있다고 밝혔으므로, 여기서 차단하는 것은 보장이 아니라 요청입니다.

에이전트

Google-Agent는 일반적으로 robots.txt를 무시하며, 대부분의 브라우징 에이전트는 사용할 토큰조차 없습니다. 따라서 이 그룹은 실제로 거의 영향을 주지 않습니다.

봇을 클릭하면 해당 그룹의 설정과 반대로 전환됩니다.

Content-Signal
search
ai-input
ai-train

Content-Signal은 가져온 페이지의 사용 방식을 지정합니다. search는 검색 결과 표시, ai-input은 AI 답변 생성에 사용, ai-train은 모델 학습에 사용한다는 뜻입니다. Cloudflare의 CC0 정책을 기반으로 하며, 차단 없이 선호 사항만 표시합니다.

/robots.txt
# 사이트 전체에서 차단된 AI 크롤러
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# 허용된 AI 크롤러. 비공개 경로는 제외
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# 그 밖의 모든 크롤러
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

robots.txt는 자발적으로 따르는 규칙입니다. ChatGPT-User, Perplexity-User 등 사용자의 요청으로 페이지를 가져오는 크롤러는 규칙이 적용되지 않을 수 있다고 밝혔고, 일부 에이전트는 토큰조차 없습니다. 차단을 적용하려면 공개된 IP 목록이나 시그니처와 요청을 대조한 뒤 방화벽이나 WAF에서 차단하세요.

디렉터리에서 모든 봇 보기 →

생성된 파일의 작동 방식

크롤러는 자체 그룹의 규칙을 따릅니다

User-agent 줄에서 자신의 토큰을 찾은 크롤러는 해당 그룹을 따르고 User-agent: * 아래의 규칙은 건너뜁니다. 따라서 생성기는 이름으로 허용한 봇마다 비공개 경로 규칙을 반복하고, 차단된 봇에는 Disallow: / 하나를 지정합니다.

일부 토큰은 직접 크롤링하지 않습니다

Google-Extended와 Applebot-Extended에는 자체 사용자 에이전트가 없습니다. 실제 페이지는 Googlebot과 Applebot이 가져오며, 확장 토큰은 Google과 Apple에 해당 콘텐츠를 모델 학습에 사용해도 되는지 알립니다. Google은 Gemini의 근거 자료 검색에도 Google-Extended를 적용합니다.

대부분의 운영자는 학습과 검색을 분리합니다

OpenAI, Anthropic, Amazon, Mistral은 각각 학습용 토큰과 검색용 토큰을 별도로 운영하므로, 학습 안 함 프리셋을 선택해도 각 회사의 검색 제품에는 계속 노출됩니다. 예외는 Meta입니다. meta-externalagent는 학습과 색인 생성을 모두 담당합니다.

Applebot은 Googlebot 규칙을 따를 수 있습니다

파일에 Applebot 그룹이 없으면 Apple은 Applebot이 대신 Googlebot 규칙을 따른다고 안내합니다. Applebot과 Amazonbot은 Crawl-delay도 무시하지만, Anthropic은 ClaudeBot이 이를 따른다고 밝혔습니다.

robots.txt와 AI 봇 관련 질문

GPTBot은 차단하면서 ChatGPT 검색은 허용하려면 어떻게 하나요?

GPTBot은 차단하고 OAI-SearchBot은 허용하세요. GPTBot은 학습 데이터를 수집하고, OAI-SearchBot은 ChatGPT 검색을 위해 페이지를 색인하며, ChatGPT-User는 사람이 요청한 페이지를 가져옵니다. OpenAI는 한 페이지에서 세 봇을 각각 별도의 IP 목록과 함께 안내합니다.

Google-Extended를 차단하면 Google 검색에서 사이트가 제외되나요?

Google-Extended는 자체 사용자 에이전트가 없는 제어용 토큰이며, 실제 크롤링은 Googlebot이 수행합니다. Google-Extended를 차단하면 Google이 콘텐츠를 Gemini 학습과 근거 자료 검색에 사용하지 않지만, 검색을 위해 무엇을 크롤링할지는 Googlebot 규칙으로 결정됩니다.

AI 크롤러는 Crawl-delay를 따르나요?

일부는 따릅니다. Anthropic은 ClaudeBot이 이를 따른다고 밝혔지만, Apple과 Amazon은 Applebot과 Amazonbot이 따르지 않는다고 안내합니다. 확실한 방법은 서버에서 요청 속도를 제한하는 것입니다.

차단했는데도 ChatGPT-User가 방문하는 이유는 무엇인가요?

OpenAI는 사람이 페이지를 요청한 경우 robots.txt 규칙이 ChatGPT-User에 적용되지 않을 수 있다고 밝혔습니다. Perplexity-User, Amzn-User, meta-externalfetcher에도 비슷한 예외가 있습니다. 운영자가 IP 목록을 공개한 경우 요청과 목록을 대조해 방화벽에서 차단하세요.

robots.txt의 Content-Signal은 어떤 역할을 하나요?

콘텐츠를 가져온 뒤 어떻게 사용할 수 있는지 search, ai-input, ai-train 세 가지 신호로 나타냅니다. 각 신호의 값은 yes 또는 no입니다. 이는 선호 사항을 표현할 뿐, 어떤 접근도 차단하지 않습니다. Cloudflare의 Markdown for Agents는 기본적으로 ai-train=yes, search=yes, ai-input=yes를 추가하므로, 이 기능을 사용한다면 출력 내용을 확인하세요.

출처

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers