dotsagent.io
Idioma:Português
Prepare seu site · referência

Deixe seu site legível para agentes de IA

Crawlers e agentes de IA leem seu site de forma diferente das pessoas. As ferramentas abaixo geram os arquivos que eles procuram; a referência a seguir explica quais convenções são padrões, quais são rascunhos e quantos clientes realmente as usam.

As convenções e o quanto cada uma está consolidada

Status em outubro de 2026. Cada item tem um link para a especificação ou para as evidências correspondentes, para você avaliar o que vale a pena implementar no seu site.

robots.txt Padrão

O arquivo na raiz do seu site identifica crawlers pelo token e lista os caminhos que cada um deve ignorar. Ele é padronizado pela RFC 9309. Operadores de IA agora publicam tokens separados para treinamento, busca e acesso iniciado pelo usuário, permitindo que um único arquivo bloqueie o treinamento e ainda permita a busca. O cumprimento é voluntário, e vários fetchers iniciados pelo usuário afirmam que as regras talvez não se apliquem a eles.

/robots.txt
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

platform.openai.comdevelopers.google.com

Content-Signal Amplamente usado

Uma linha extra em robots.txt que informa como o conteúdo rastreado pode ser usado: search, ai-input e ai-train, cada um definido como yes ou no. A Cloudflare lançou essa política como CC0 em setembro de 2025 e a disponibiliza em cerca de 3,8 milhões de domínios por meio do robots.txt gerenciado. O rascunho correspondente do IETF expirou em 4 de abril de 2026, enquanto o grupo de trabalho AIPREF do IETF continua desenvolvendo um rascunho de vocabulário.

/robots.txt
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /

blog.cloudflare.comdatatracker.ietf.org

llms.txt Proposta

Um arquivo Markdown em /llms.txt com um título H1, um resumo em bloco de citação e seções H2 com links, para que um agente encontre suas páginas principais sem precisar analisar a navegação. A especificação em llmstxt.org foi revisada em 10 de agosto de 2026, e llms-full.txt não faz parte dela. Não temos nenhuma declaração de operadores que confirme que algum crawler importante lê esse arquivo.

/llms.txt
# Acme API

> Card payments for small online shops.

## Docs

- [Quickstart](https://example.com/docs/quickstart.md): first request

llmstxt.orgllmstxt.org

Versões Markdown das páginas Adoção parcial

Publique uma cópia em Markdown de cada página em page.md ou page.html.md, ou sirva Markdown para qualquer solicitação cujo cabeçalho Accept peça text/markdown. No teste da Checkly de fevereiro de 2026, Claude Code, Cursor e OpenCode enviaram esse cabeçalho, enquanto Codex, Gemini CLI, GitHub Copilot e Windsurf não enviaram. A AnswerShare contabilizou 1.277.965 solicitações de crawlers de ponta, e nenhuma delas pediu Markdown.

Request
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdown

developers.cloudflare.comchecklyhq.comanswershare.com

Catálogo de APIs Padrão

A RFC 9727, publicada em junho de 2025, reserva /.well-known/api-catalog para uma lista das suas APIs públicas, cada uma vinculada à descrição legível por máquina, à documentação e à página de status. A resposta deve ser application/linkset+json, e outras páginas podem apontar para ela usando a relação de link api-catalog.

/.well-known/api-catalog
{
  "linkset": [
    {
      "anchor": "https://api.example.com/v1",
      "service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
    }
  ]
}

rfc-editor.org

Solicitações de agentes assinadas (Web Bot Auth) Rascunho

Os agentes assinam cada solicitação com HTTP Message Signatures (RFC 9421) e identificam seu operador em um cabeçalho Signature-Agent. Você verifica a assinatura usando as chaves que o operador publica em /.well-known/http-message-signatures-directory. O rascunho do grupo de trabalho do IETF é de 1º de setembro de 2026; o agente do ChatGPT já assina como https://chatgpt.com, e o Google está testando https://agent.bot.goog.

Request header
Signature-Agent: "https://chatgpt.com"

datatracker.ietf.orgblog.cloudflare.com

NLWeb Paralisado

O NLWeb da Microsoft oferece a um site os endpoints /ask e /mcp, que agentes podem consultar em linguagem natural, e sua especificação está na versão 0.55. A Lumar informa que o certificado de nlweb.ai expirou em 4 August 2026 e que o repositório não recebe atualizações desde junho. Por isso, espere antes de criar algo com base nele.

github.comagentic-readiness.lumar.io

Agentes que não se identificam

Alguns agentes não publicam um token em robots.txt e navegam como um usuário, então nenhuma regra User-agent consegue alcançá-los. O agente do ChatGPT assina as requisições com Web Bot Auth e envia Signature-Agent: "https://chatgpt.com". Você pode conferir essa assinatura no diretório de chaves da OpenAI; a Cloudflare identifica esse tráfego como chatgpt-agent. O Gemini Spark no modo local do Chrome e o Muse da Meta não têm nenhum sinal documentado.

Dúvidas sobre sites preparados para agentes

O que torna um site preparado para agentes?

Não existe um padrão único que defina isso. Na prática, significa ter um robots.txt que identifica bots de IA por finalidade, arquivos opcionais como llms.txt e um catálogo de API, versões em Markdown das páginas principais e uma forma de verificar os agentes que você permite acessar o site. Entre esses recursos, somente robots.txt e o catálogo de API foram publicados como RFCs.

Crawlers de IA leem llms.txt?

Não encontramos documentação de operadores que confirme que algum crawler do nosso diretório busca esse arquivo. O Lighthouse verifica se ele existe, e um agente direcionado a ele pode lê-lo como qualquer outra página. Considere-o uma conveniência para agentes, não um recurso de busca.

Devo bloquear crawlers de IA no meu site?

Decida por finalidade, em vez de bloquear tudo de uma vez. Você pode recusar tokens de treinamento como GPTBot, ClaudeBot e Google-Extended sem afetar a busca. Bloquear tokens de busca como OAI-SearchBot ou PerplexityBot impede que seu site apareça nesses produtos.

Posso bloquear o agente do ChatGPT com robots.txt?

Não, porque ele não publica um token. Você pode identificá-lo pela assinatura Web Bot Auth de https://chatgpt.com e permiti-lo ou bloqueá-lo no servidor ou na CDN. Uma assinatura válida confirma qual operador enviou a requisição, não quem é o usuário nem o que ele pode fazer.

Content-Signal é um padrão oficial?

Não. É uma política CC0 da Cloudflare, lançada em September 2025 e disponibilizada em cerca de 3.8 million domínios por meio do robots.txt gerenciado pela Cloudflare. O rascunho do IETF expirou em 4 April 2026, e o grupo de trabalho AIPREF ainda está elaborando um vocabulário compartilhado.

Referência independente para quem cria agentes de IA. Não temos vínculo com nenhum dos fornecedores mencionados aqui.

© 2026 DotsAgent · Fatos verificados em 1 de outubro de 2026