Presença Digital20/08/2026Equipe Editorial da Biomi14 min de leitura

Robots.txt para IA: o que bloquear em GPTBot, OAI-SearchBot e Google-Extended sem perder busca

Entenda o papel de GPTBot, OAI-SearchBot, ChatGPT-User, Googlebot e Google-Extended e escolha regras de robots.txt, noindex e WAF sem bloquear a visibilidade que você quer manter.

Laptop com painel sobre robots.txt para IA, ícones de GPTBot, OAI-SearchBot, Googlebot, Google-Extended e ChatGPT-User, escudo digital e opções de bloqueio.

Tratar todos os robôs de inteligência artificial como se fossem a mesma coisa é o erro que mais facilmente derruba uma estratégia de visibilidade. Hoje, o mesmo site pode querer aparecer na Pesquisa Google e nas respostas de busca do ChatGPT, recusar o uso do conteúdo para treinamento de modelos e, ao mesmo tempo, continuar acessível quando uma pessoa pede a um agente que visite uma página pública. Essas finalidades são diferentes e os controles também precisam ser.

A documentação atual da OpenAI separa OAI-SearchBot, usado para as funções de busca do ChatGPT, de GPTBot, que rastreia conteúdo que pode ser usado no treinamento de modelos generativos. A própria OpenAI diz que as duas preferências são independentes: é possível permitir OAI-SearchBot para aparecer na busca e bloquear GPTBot para sinalizar que o conteúdo não deve ser usado no treinamento. No ecossistema do Google, Googlebot continua ligado à Pesquisa Google, enquanto Google-Extended é um token separado no robots.txt para controlar determinados usos do conteúdo em produtos Gemini. O Google afirma que Google-Extended não altera a inclusão nem a classificação do site na Pesquisa Google.

A consequência prática é simples: antes de editar o robots.txt, defina o objetivo. A pergunta correta não é apenas 'bloqueio bots de IA?'. A pergunta é 'quero busca, treinamento, acesso por agentes, todos eles ou apenas alguns caminhos?'.

A resposta curta: separe busca de treinamento

Para um site editorial que quer preservar descoberta em mecanismos de busca e em respostas com fontes, mas não quer liberar o rastreamento destinado a treinamento, a configuração mais conservadora é permitir Googlebot e OAI-SearchBot e bloquear GPTBot e Google-Extended. Isso mantém a Pesquisa Google e ajuda o conteúdo a ser elegível para a busca do ChatGPT, ao mesmo tempo em que registra a preferência de não participar dos usos de treinamento controlados por GPTBot e Google-Extended.

Essa combinação não resolve todos os tipos de acesso. ChatGPT-User, por exemplo, não é o crawler automático de Search. A OpenAI o descreve como um agente usado em determinadas ações iniciadas por usuários do ChatGPT e por GPTs personalizados. Por ser um acesso acionado por uma pessoa, a própria documentação alerta que regras de robots.txt podem não se aplicar. Se a intenção é impedir tecnicamente esse tipo de visita, a decisão precisa chegar à camada de autenticação, servidor, CDN ou WAF.

O que cada agente controla de verdade

OAI-SearchBot: descoberta para a busca do ChatGPT

OAI-SearchBot é o token que deve receber atenção quando o objetivo é aparecer nas funções de busca do ChatGPT. A OpenAI informa que sites que optam por bloquear esse crawler deixam de ser mostrados nas respostas de Search como conteúdo rastreado, embora URLs ainda possam aparecer como links de navegação em algumas situações. Para favorecer a inclusão, a recomendação oficial é permitir OAI-SearchBot no robots.txt e garantir que a hospedagem, CDN ou firewall também aceite o tráfego legítimo dos intervalos de IP publicados pela OpenAI.

Isso cria uma diferença importante entre robots.txt e infraestrutura. Um arquivo pode dizer Allow: / para OAI-SearchBot e, ainda assim, o crawler receber 403, desafio JavaScript, CAPTCHA ou 429 na borda. Nesse caso, o problema não está no robots.txt: a camada de proteção está impedindo o acesso.

GPTBot: sinal para possível uso em treinamento

GPTBot é apresentado pela OpenAI como o crawler usado para coletar conteúdo que pode ser usado no treinamento de seus modelos generativos. Bloquear GPTBot é o mecanismo indicado pela empresa para sinalizar que o conteúdo do site ou de determinados caminhos não deve ser usado nesse treinamento. A redação 'pode ser usado' é relevante: permitir o crawler não significa que cada página necessariamente será usada em treinamento, mas bloquear o token registra a preferência de exclusão para esse fim.

A OpenAI também explica que, quando OAI-SearchBot e GPTBot estão permitidos, pode reutilizar o resultado de um único rastreamento para mais de uma finalidade, evitando visitas duplicadas. Isso não elimina a separação de preferências: a documentação diz que os controles continuam independentes.

ChatGPT-User: acesso iniciado por uma pessoa

ChatGPT-User não é o token para controlar participação no ChatGPT Search. Ele aparece quando uma ação de usuário leva o ChatGPT ou um GPT personalizado a visitar uma página. A OpenAI afirma que esse agente não é usado para rastreamento automático da web e não determina se uma página pode aparecer em Search.

Por isso, bloquear ChatGPT-User no robots.txt e deixar OAI-SearchBot aberto não é uma forma confiável de dizer 'quero busca, mas não quero agentes'. Se essa distinção for importante, a regra de acesso deve ser implementada onde a requisição realmente pode ser aceita ou negada, como no WAF, na CDN, no servidor ou por autenticação. Em conteúdo público, a decisão pode ser diferente; em área privada, nunca se deve depender de robots.txt como barreira de segurança.

Googlebot: o crawler que você não deve derrubar se quer Pesquisa

Google Googlebot continua sendo o crawler central para rastreamento da Pesquisa Google. O próprio Google lembra que robots.txt controla acesso de rastreamento, não é um mecanismo geral para retirar páginas dos resultados. Se o objetivo é manter presença orgânica, um bloqueio amplo de Googlebot pode impedir o Google de ler conteúdo novo, atualizações e diretivas de indexação.

Google-Extended: controle de usos em Gemini sem mexer no ranking da Pesquisa

Google-Extended é diferente de Googlebot e tem uma peculiaridade operacional: o Google informa que ele não possui uma string de User-Agent HTTP separada. O rastreamento é realizado com agentes existentes do Google; Google-Extended funciona como token de controle no robots.txt.

Segundo a documentação do Google, esse token permite ao editor gerenciar se conteúdo rastreado pelo Google pode ser usado para treinar futuras gerações de modelos Gemini e para determinados usos de grounding em produtos Gemini e Vertex AI. A mesma documentação afirma que Google-Extended não afeta a inclusão de um site na Pesquisa Google nem funciona como sinal de classificação. Portanto, bloquear Google-Extended pode ser compatível com manter Googlebot aberto para SEO tradicional.

Esse detalhe também evita um erro de infraestrutura: criar uma regra de WAF procurando literalmente um User-Agent HTTP chamado Google-Extended não corresponde ao funcionamento descrito pelo Google. A decisão de Google-Extended pertence ao robots.txt; já a proteção de borda deve trabalhar com os identificadores reais ou mecanismos de bot verificado oferecidos pelo provedor.

Matriz por objetivo: regras que refletem a decisão

Quero busca, mas não treinamento

Este é o cenário mais comum para quem quer visibilidade sem abrir os controles específicos de treinamento. Para a OpenAI, permita OAI-SearchBot e bloqueie GPTBot. Para o Google, mantenha Googlebot permitido e bloqueie Google-Extended se você também não quiser os usos de Gemini controlados por esse token.

User-agent: OAI-SearchBot Allow: / User-agent: GPTBot Disallow: / User-agent: Googlebot Allow: / User-agent: Google-Extended Disallow: / Com essa combinação, a Pesquisa Google continua separada de Google-Extended, e a busca do ChatGPT continua separada de GPTBot. É a configuração que melhor traduz a intenção 'quero ser encontrado, mas não quero liberar treinamento' usando os controles publicados por cada empresa.

Quero permitir busca e também treinamento

Se o site aceita ambos os usos, as regras podem permitir os quatro tokens. Ainda assim, é recomendável revisar a CDN e o WAF, porque um Allow no robots.txt não supera um bloqueio de rede.

User-agent: OAI-SearchBot Allow: / User-agent: GPTBot Allow: / User-agent: Googlebot Allow: / User-agent: Google-Extended Allow: / ChatGPT-User continua fora dessa lógica de crawler automático. Se o site deseja que agentes acionados por usuários consigam visitar páginas públicas, a infraestrutura também precisa não bloquear esse tráfego legítimo.

Quero manter a Pesquisa Google, mas sair do ChatGPT Search e do treinamento

Nesse caso, preserve Googlebot e bloqueie OAI-SearchBot e GPTBot. Se também não quiser os usos de Gemini controlados pelo token do Google, bloqueie Google-Extended.

User-agent: Googlebot Allow: / User-agent: OAI-SearchBot Disallow: / User-agent: GPTBot Disallow: / User-agent: Google-Extended Disallow: / A OpenAI ressalva que uma URL bloqueada para OAI-SearchBot ainda pode aparecer como link de navegação se for conhecida por outros meios. Se a meta é não aparecer nem como resultado indexado ou link exibível por um mecanismo compatível, entra em cena o noindex, desde que o crawler consiga acessar a página para ler a diretiva.

Quero bloquear todo rastreamento compatível com robots.txt

A regra genérica é curta.

User-agent: * Disallow: / Mas essa regra não transforma um site público em conteúdo privado. O Google descreve robots.txt como um controle de rastreamento e a Cloudflare lembra que o cumprimento é voluntário: o arquivo expressa uma preferência, não cria uma barreira técnica contra qualquer cliente HTTP. Para conteúdo confidencial, área paga ou painel administrativo, use autenticação e controle de acesso real.

Também não use esse bloqueio como substituto de noindex. Uma página bloqueada no robots.txt pode continuar conhecida por um mecanismo de busca por causa de links externos, e o crawler bloqueado não conseguirá ler a diretiva noindex inserida na própria página.

Quero restringir apenas caminhos específicos

Não é necessário aplicar a mesma regra ao domínio inteiro. Se o site aceita busca em artigos públicos, mas quer excluir um diretório de materiais internos do crawler de treinamento, a regra pode ser segmentada por caminho.

User-agent: GPTBot Disallow: /materiais-internos/ Disallow: /rascunhos/ User-agent: OAI-SearchBot Allow: / A mesma lógica vale para Google-Extended. Porém, caminhos realmente sensíveis não devem ficar protegidos apenas porque foram escritos em Disallow. O robots.txt fica publicamente acessível e não impede um cliente que ignore a convenção. Se o conteúdo não deve ser visto, a origem precisa exigir autorização.

Robots.txt, noindex e WAF resolvem problemas diferentes

Robots.txt controla o rastreamento de agentes que respeitam a regra

Robots.txt é a camada em que você declara quais crawlers podem acessar quais caminhos. Ele é excelente para separar OAI-SearchBot de GPTBot e Googlebot de Google-Extended porque esses operadores publicam tokens específicos e documentam o comportamento esperado.

O limite é que robots.txt não é controle de segurança. A própria Cloudflare resume a diferença dizendo que o arquivo expressa preferências, enquanto o bloqueio na borda é necessário quando você quer impor a restrição. Isso importa principalmente diante de crawlers não identificados, agentes que não seguem a convenção ou tráfego malicioso fingindo ser um bot conhecido.

Noindex controla presença em resultados, não acesso de rede

Noindex serve para impedir a indexação por mecanismos que respeitam essa diretiva. No Google, a regra precisa ser lida durante o rastreamento; por isso, a página não pode estar bloqueada no robots.txt se você espera que Googlebot veja o noindex. A OpenAI faz observação equivalente ao explicar que seu crawler precisa ter acesso para ler a metatag noindex.

A combinação errada é bloquear o crawler no robots.txt e, ao mesmo tempo, esperar que ele descubra um noindex escondido na página. A combinação correta depende da meta. Se a página é pública, mas não deve aparecer em resultados, permita o acesso necessário para a leitura do noindex. Se a página é privada, não dependa de indexação: proteja-a com autenticação.

CDN e WAF decidem se a requisição entra

A camada de CDN ou WAF pode bloquear, desafiar ou limitar uma requisição mesmo quando robots.txt diz Allow. A documentação da OpenAI cita erros 403 e 429 como sinais comuns de que proteção web, mitigação de bots ou rate limiting estão barrando crawlers legítimos. A Cloudflare também alerta que regras personalizadas podem bloquear bots conhecidos e prejudicar SEO ou monitoramento.

Para reduzir falsos positivos, prefira mecanismos de bot verificado, assinaturas ou intervalos de IP publicados pelo operador quando seu provedor oferecer suporte. Uma regra que confia somente no texto do User-Agent é mais fácil de falsificar e pode abrir exceções amplas demais. No caso da OpenAI, há listas públicas de IP para OAI-SearchBot, GPTBot e ChatGPT-User; no caso de provedores como a Cloudflare, há classificação de bots verificados por comportamento, incluindo Search, Agent e Training.

O caso especial de Cloudflare e políticas por finalidade

A evolução das ferramentas de borda acompanha exatamente a separação proposta neste artigo. A Cloudflare passou a classificar bots de IA por comportamento, diferenciando Search, Agent e Training, em vez de agrupar tudo sob o rótulo genérico de 'AI bot'. Isso permite criar uma política que aceita crawlers de busca e bloqueia crawlers de treinamento, por exemplo.

Essa camada não substitui o robots.txt. Ela serve como execução técnica. Um desenho robusto é manter o robots.txt expressando sua política editorial e configurar o WAF para não contradizê-la. Se OAI-SearchBot está permitido no arquivo, mas a regra de segurança bloqueia todo tráfego automatizado, a intenção publicada e o comportamento real do site ficam desalinhados.

llms.txt não é um arquivo de bloqueio llms.txt surgiu como uma proposta aberta para publicar, em um caminho previsível, uma visão mais amigável a modelos de linguagem: resumo do site, orientação e links para conteúdo relevante em formato mais fácil de consumir. O objetivo declarado é ajudar modelos e agentes a usar um site em tempo de inferência, especialmente em documentação e bases extensas.

Isso é diferente de robots.txt. llms.txt não é um mecanismo de autorização, não é uma diretiva noindex e não bloqueia rede. A especificação continua apresentada pelos mantenedores como uma proposta aberta à comunidade, não como substituta do protocolo de robots. Em termos práticos, pense em llms.txt como um mapa ou índice para máquinas; robots.txt é uma preferência de rastreamento; noindex é uma diretiva de indexação; autenticação e WAF são mecanismos de imposição de acesso.

Publicar llms.txt também não revoga um bloqueio já feito em robots.txt. Da mesma forma, permitir um caminho no robots.txt não obriga nenhum sistema a ler llms.txt. Os dois arquivos podem coexistir, mas cumprem funções diferentes.

Erros que parecem pequenos e mudam o resultado

Bloquear User-agent: * e depois esperar que noindex resolva

Se o crawler não pode acessar a página, ele não consegue ler a diretiva noindex. Esse é um dos motivos pelos quais robots.txt não deve ser tratado como ferramenta de desindexação de páginas HTML.

Bloquear todos os bots de IA na CDN e deixar OAI-SearchBot permitido no robots.txt

O arquivo diz uma coisa e a borda faz outra. Para o crawler, o resultado final é o HTTP recebido. Se a CDN responde com 403, CAPTCHA ou desafio que o robô não consegue cumprir, a permissão do robots.txt não torna a página acessível.

Criar regra de WAF procurando o texto Google-Extended no User-Agent

O Google documenta que Google-Extended não tem um User-Agent HTTP separado. Ele é um token de robots.txt. A regra precisa ser aplicada onde o token é entendido, não assumindo que haverá uma string própria em cada requisição.

Usar ChatGPT-User para tentar controlar Search

ChatGPT-User é associado a ações iniciadas por usuários e não determina presença no ChatGPT Search. O token de Search é OAI-SearchBot. Misturar os dois pode levar a um bloqueio que não atinge o objetivo desejado.

Confiar em Disallow para esconder conteúdo confidencial

Robots.txt não é autenticação. Se o material exige sigilo, o servidor precisa negar acesso a quem não estiver autorizado. Um caminho listado em Disallow continua sendo um caminho de um site público.

Uma configuração conservadora para sites editoriais

Para blogs, portais e sites institucionais que dependem de descoberta orgânica, uma política inicial razoável é preservar Googlebot e OAI-SearchBot, bloquear GPTBot se a organização não quiser liberar treinamento da OpenAI e bloquear Google-Extended se também não quiser os usos de Gemini controlados por esse token. Depois, alinhe o WAF para que os crawlers permitidos não sejam barrados por engano.

User-agent: OAI-SearchBot Allow: / User-agent: GPTBot Disallow: / User-agent: Googlebot Allow: / User-agent: Google-Extended Disallow: / Para páginas que não devem aparecer em mecanismos de busca, use noindex de forma que o crawler possa lê-lo. Para áreas que não devem ser acessadas por terceiros, use autenticação ou autorização no servidor. Para conteúdo público que você quer tornar mais fácil de interpretar por agentes, llms.txt pode ser um complemento, não um substituto desses controles.

Como validar depois de publicar

Confira o arquivo entregue na raiz do domínio

Abra o robots.txt como um visitante externo e verifique se não existe uma regra genérica antiga anulando a intenção atual. Em sites com CMS, proxy ou CDN, confirme que a versão publicada é realmente a mesma que foi editada.

Leia os logs e os códigos HTTP

Procure requisições dos agentes que você pretende permitir. Se OAI-SearchBot ou Googlebot recebe 403, 429 ou desafios, revise WAF, mitigação de bots e rate limiting. Se a política é bloquear um crawler de treinamento, confirme que as respostas e os logs refletem o comportamento esperado.

Use verificação de bot quando disponível

Em regras de firewall, combine identidade do agente com mecanismos verificáveis oferecidos pelo provedor. A OpenAI publica intervalos de IP para seus crawlers; a Cloudflare mantém categorias de bots verificados. Isso reduz o risco de abrir uma exceção apenas porque uma requisição escreveu o nome de um bot conhecido no User-Agent.

Espere a propagação antes de concluir que falhou

A OpenAI informa que mudanças de robots.txt relacionadas a Search podem levar cerca de 24 horas para serem refletidas em seus sistemas. Noindex também depende de novo rastreamento para ser percebido por mecanismos de busca. Uma alteração correta pode não produzir efeito instantâneo.

Meça busca e visita como coisas diferentes

Permitir OAI-SearchBot aumenta a possibilidade de o conteúdo ser descoberto e citado na busca do ChatGPT, mas não garante posição ou tráfego. A OpenAI informa que referências de ChatGPT Search incluem utm_source=chatgpt.com, o que ajuda a separar visitas após o clique da simples presença em respostas. No Google, Search Console continua sendo a referência para rastreamento e indexação da Pesquisa Google.

A decisão final em uma frase

Se você quer busca sem treinamento, mantenha OAI-SearchBot e Googlebot acessíveis, bloqueie GPTBot e Google-Extended conforme sua política de uso de conteúdo, trate ChatGPT-User como acesso iniciado por usuário e não como crawler de Search, use noindex para controlar indexação e use autenticação ou WAF quando a restrição precisa ser realmente imposta. llms.txt pode ajudar máquinas a entender conteúdo público, mas não substitui nenhum desses controles.

Topicos deste artigoChatGPT-UsercrawlersGoogle-ExtendedGooglebotGPTBotIAOAI-SearchBotrobots.txtSEO técnicorobots.txt para IAbloquear GPTBotpermitir OAI-SearchBotcrawlers de IAChatGPT SearchSEO técnico para IAWAF para bots