Presencia Digital20/08/2026Equipe Editorial da Biomi15 min de leitura

Robots.txt para IA: qué bloquear en GPTBot, OAI-SearchBot y Google-Extended sin perder la búsqueda

Comprenda el papel de GPTBot, OAI-SearchBot, ChatGPT-User, Googlebot y Google-Extended y elija reglas robots.txt, noindex y WAF sin bloquear la visibilidad que desea mantener.

Laptop com painel sobre robots.txt para IA, ícones de GPTBot, OAI-SearchBot, Googlebot, Google-Extended e ChatGPT-User, escudo digital e opções de bloqueio.

Tratar a todos los robots de inteligencia artificial como si fueran la misma cosa es el error que más fácilmente socava una estrategia de visibilidad. Hoy en día, es posible que el mismo sitio desee aparecer en las respuestas de búsqueda de Google Search y ChatGPT, optar por no usar el contenido para la capacitación de modelos y, al mismo tiempo, permanecer accesible cuando una persona le pide a un agente que visite una página pública. Estos propósitos son diferentes y los controles también deben serlo.

La documentación actual de OpenAI separa OAI-SearchBot, utilizado para las funciones de búsqueda de ChatGPT, de GPTBot, que rastrea contenido que se puede utilizar en el entrenamiento de modelos generativos. El propio OpenAI dice que las dos preferencias son independientes: es posible permitir que OAI-SearchBot aparezca en la búsqueda y bloquear GPTBot para indicar que el contenido no debe usarse en el entrenamiento. En el ecosistema de Google, Googlebot permanece vinculado a la Búsqueda de Google, mientras que Google-Extended es un token separado en robots.txt para controlar ciertos usos del contenido en los productos Gemini. Google afirma que Google Extendido no cambia la inclusión ni la clasificación de su sitio en la Búsqueda de Google.

La consecuencia práctica es simple: antes de editar robots.txt, define el objetivo. La pregunta correcta no es simplemente "¿bloqueo los robots de IA?". La pregunta es: "¿Quiero búsqueda, capacitación, acceso de agentes, todos ellos o solo algunos?".

La respuesta corta: separar el ejercicio del entrenamiento

Para un sitio editorial que desea preservar la visibilidad en los motores de búsqueda y las respuestas obtenidas, pero no desea publicar el seguimiento destinado a la capacitación, la configuración más conservadora es permitir Googlebot y OAI-SearchBot y bloquear GPTBot y Google-Extended. Esto mantiene la Búsqueda de Google y ayuda a que el contenido sea elegible para la búsqueda de ChatGPT, al mismo tiempo que registra la exclusión voluntaria de GPTBot y los usos de capacitación controlados extendidos de Google.

Esta combinación no resuelve todos los tipos de acceso. ChatGPT-User, por ejemplo, no es el rastreador de búsqueda automático. OpenAI lo describe como un agente utilizado en determinadas acciones iniciadas por usuarios de ChatGPT y GPT personalizados. Como se trata de un acceso activado por una persona, la propia documentación advierte que es posible que no se apliquen las reglas de robots.txt. Si la intención es impedir técnicamente este tipo de visitas, la decisión debe llegar a la capa de autenticación, servidor, CDN o WAF.

Lo que realmente controla cada agente

OAI-SearchBot: descubrimiento para búsqueda ChatGPT

OAI-SearchBot es el token que debe recibir atención cuando el objetivo es aparecer en las funciones de búsqueda de ChatGPT. OpenAI informa que los sitios que opten por bloquear este rastreador ya no se mostrarán en las respuestas de búsqueda como contenido rastreado, aunque las URL aún pueden aparecer como enlaces de navegación en algunas situaciones. Para fomentar la inclusión, la recomendación oficial es habilitar OAI-SearchBot en robots.txt y garantizar que el hosting, CDN o firewall también acepte tráfico legítimo de los rangos de IP publicados de OpenAI.

Esto crea una diferencia importante entre robots.txt y la infraestructura. Un archivo puede decir Permitir: / para OAI-SearchBot y aún así el rastreador recibe 403, desafío de JavaScript, CAPTCHA o 429 en el borde. En este caso, el problema no está en el archivo robots.txt: la capa de protección impide el acceso.

GPTBot: señal para posible uso en entrenamiento

OpenAI presenta GPTBot como el rastreador utilizado para recopilar contenido que puede usarse para entrenar sus modelos generativos. El bloqueo de GPTBot es el mecanismo indicado por la empresa para señalar que el contenido del sitio web o determinadas rutas no deben utilizarse en esta formación. La expresión "puede usarse" es relevante: habilitar el rastreador no significa que todas las páginas se usarán necesariamente en el entrenamiento, pero bloquear el token registra la preferencia de exclusión para este propósito.

OpenAI también explica que cuando OAI-SearchBot y GPTBot están habilitados, puede reutilizar el resultado de un único rastreo para más de un propósito, evitando visitas duplicadas. Esto no elimina la separación de preferencias: la documentación dice que los controles siguen siendo independientes.

ChatGPT-Usuario: acceso iniciado por una persona

ChatGPT-User no es el token para controlar la participación en ChatGPT Search. Aparece cuando una acción del usuario hace que ChatGPT o un GPT personalizado visite una página. OpenAI afirma que este agente no se utiliza para el rastreo web automático y no determina si una página puede aparecer en la Búsqueda.

Por lo tanto, bloquear ChatGPT-User en robots.txt y dejar OAI-SearchBot abierto no es una forma confiable de decir "Quiero búsqueda, pero no quiero agentes". Si esta distinción es importante, la regla de acceso debe implementarse donde la solicitud realmente pueda aceptarse o rechazarse, como en el WAF, en la CDN, en el servidor o mediante autenticación. En contenido público, la decisión puede ser diferente; En un área privada, nunca debes confiar en el archivo robots.txt como barrera de seguridad.

Googlebot: el rastreador que no debes eliminar si quieres realizar búsquedas

Google Googlebot sigue siendo el rastreador central para el seguimiento de la Búsqueda de Google. El propio Google nos recuerda que robots.txt controla el acceso de rastreo, no es un mecanismo general para eliminar páginas de los resultados. Si el objetivo es mantener una presencia orgánica, un bloqueo amplio del robot de Google puede impedir que Google lea contenido nuevo, actualizaciones y políticas de indexación.

Google-Extended: control de uso en Gemini sin cambiar el ranking de búsqueda

Google-Extended es diferente del robot de Google y tiene una peculiaridad operativa: Google informa que no tiene una cadena de agente de usuario HTTP separada. El seguimiento se realiza con agentes de Google existentes; Google Extended funciona como token de control en robots.txt.

Según la documentación de Google, este token permite al editor gestionar si el contenido rastreado por Google se puede utilizar para entrenar generaciones futuras de modelos Gemini y para ciertos usos básicos en productos Gemini y Vertex AI. La misma documentación establece que Google Extendido no afecta la inclusión de un sitio en la Búsqueda de Google ni actúa como una señal de clasificación. Por lo tanto, bloquear Google Extendido puede ser compatible con mantener el robot de Google abierto para el SEO tradicional.

Este detalle también evita un error de infraestructura: crear una regla WAF buscando literalmente un User-Agent HTTP llamado Google-Extended no corresponde a la operación descrita por Google. La resolución extendida de Google pertenece a robots.txt; La protección perimetral debe funcionar con los identificadores reales o los mecanismos de bot verificados que ofrece el proveedor.

Matriz por objetivo: reglas que reflejan la decisión

Quiero buscar, pero no entrenar

Este es el escenario más común para aquellos que desean visibilidad sin abrir controles de capacitación específicos. Para OpenAI, permita OAI-SearchBot y bloquee GPTBot. Para Google, mantenga permitido el robot de Google y bloquee Google extendido si tampoco desea que este token controle los usos de Gemini.

Agente de usuario: OAI-SearchBot Permitir: / Agente de usuario: GPTBot Disallow: / Agente de usuario: Googlebot Permitir: / Agente de usuario: Google-Extended Disallow: / Con esta combinación, la Búsqueda de Google permanece separada de Google-Extended, y la búsqueda de ChatGPT permanece separada de GPTBot. Es la configuración que mejor refleja la intención 'Quiero que me encuentren, pero no quiero liberar formación' utilizando los controles publicados por cada empresa.

Quiero permitir la búsqueda y también la formación

Si el sitio acepta ambos usos, las reglas pueden permitir los cuatro tokens. Aún así, se recomienda revisar el CDN y el WAF, porque un Permitir en robots.txt no supera un bloqueo de red.

Agente de usuario: OAI-SearchBot Permitir: / Agente de usuario: GPTBot Permitir: / Agente de usuario: Googlebot Permitir: / Agente de usuario: Google-Extended Permitir: / ChatGPT-Usuario permanece fuera de esta lógica de rastreo automático. Si el sitio quiere que los agentes dirigidos por el usuario puedan visitar páginas públicas, la infraestructura tampoco debe bloquear este tráfico legítimo.

Quiero conservar la Búsqueda de Google pero dejar la Búsqueda y la formación de ChatGPT

En este caso, conserve el robot de Google y bloquee OAI-SearchBot y GPTBot. Si tampoco quieres que los usos de Gemini sean controlados por el token de Google, bloquea Google-Extended.

Agente de usuario: Googlebot Permitir: / Agente de usuario: OAI-SearchBot Disallow: / Agente de usuario: GPTBot Disallow: / Agente de usuario: Google-Extended Disallow: / OpenAI advierte que una URL bloqueada para OAI-SearchBot aún puede aparecer como un enlace de navegación si se conoce por otros medios. Si el objetivo no es aparecer como un resultado indexado o como un enlace que se puede mostrar mediante un mecanismo compatible, entra en juego noindex, siempre que el rastreador pueda acceder a la página para leer la directiva.

Quiero bloquear todos los seguimientos compatibles con robots.txt

La regla genérica es breve.

Agente de usuario: * No permitir: / Pero esta regla no convierte un sitio público en contenido privado. Google describe robots.txt como un control de seguimiento y Cloudflare nos recuerda que el cumplimiento es voluntario: el archivo expresa una preferencia, no crea una barrera técnica contra ningún cliente HTTP. Para contenido confidencial, área paga o panel de administración, utilice autenticación real y control de acceso.

Además, no utilice este bloqueo como reemplazo de noindex. Es posible que un motor de búsqueda aún reconozca una página bloqueada en robots.txt debido a enlaces externos, y el rastreador bloqueado no podrá leer la directiva noindex insertada en la página misma.

Quiero restringir solo rutas específicas

No es necesario aplicar la misma regla a todo el dominio. Si el sitio admite la búsqueda de artículos públicos, pero desea excluir un directorio de materiales internos del rastreador de capacitación, la regla se puede segmentar por ruta.

Agente de usuario: GPTBot Disallow: /internal-materials/ Disallow: /drafts/ Agente de usuario: OAI-SearchBot Permitir: / La misma lógica se aplica a Google-Extended. Sin embargo, las rutas realmente sensibles no deben protegerse sólo porque fueron escritas en Disallow. Robots.txt es de acceso público y no impide que un cliente ignore la convención. Si el contenido no debe ser visto, la fuente debe requerir autorización.

Robots.txt, noindex y WAF resuelven diferentes problemas

Robots.txt controla el seguimiento de los agentes que respetan la regla

Robots.txt es la capa donde declaras qué rastreadores pueden acceder a qué rutas. Es excelente para separar OAI-SearchBot de GPTBot y Googlebot de Google-Extended porque estos operadores publican tokens específicos y documentan el comportamiento esperado.

El límite es que robots.txt no es un control de seguridad. El propio Cloudflare resume la diferencia diciendo que el archivo expresa preferencias, mientras que el bloqueo de borde es necesario cuando se desea hacer cumplir la restricción. Esto es especialmente importante frente a rastreadores no identificados, agentes que no siguen las convenciones o tráfico malicioso que se hace pasar por un bot conocido.

Noindex controla la presencia en los resultados, no el acceso a la red

Noindex sirve para impedir la indexación mediante mecanismos que respeten esta directiva. En Google, la regla debe leerse durante el rastreo; Por lo tanto, la página no se puede bloquear en robots.txt si espera que el robot de Google no vea ningún índice. OpenAI hace el mismo comentario cuando explica que su rastreador necesita acceso para leer la metaetiqueta noindex.

La combinación incorrecta es bloquear el rastreador en robots.txt y, al mismo tiempo, esperar que descubra un noindex oculto en la página. La combinación correcta depende del objetivo. Si la página es pública, pero no debería aparecer en los resultados, permita el acceso necesario para leer el noindex. Si la página es privada, no dependas de la indexación: protégela con autenticación.

CDN y WAF deciden si la solicitud entra

La capa CDN o WAF puede bloquear, desafiar o limitar una solicitud incluso cuando el archivo robots.txt dice Permitir. La documentación de OpenAI cita los errores 403 y 429 como signos comunes de que la protección web, la mitigación de bots o la limitación de velocidad están bloqueando a los rastreadores legítimos. Cloudflare también advierte que las reglas personalizadas pueden bloquear bots conocidos y dañar el SEO o el monitoreo.

Para reducir los falsos positivos, prefiera mecanismos de bot verificados, firmas o rangos de IP publicados por el operador cuando su proveedor los admita. Una regla que se basa únicamente en el texto Usuario-Agente es más fácil de falsificar y puede hacer excepciones demasiado amplias. En el caso de OpenAI, existen listas de IP públicas para OAI-SearchBot, GPTBot y ChatGPT-User; En el caso de proveedores como Cloudflare, existe una clasificación de los bots verificados por comportamiento, incluyendo Búsqueda, Agente y Capacitación.

El caso especial de Cloudflare y las políticas por finalidad

La evolución de las herramientas de borde sigue exactamente la separación propuesta en este artículo. Cloudflare ahora clasifica los robots de IA por comportamiento, diferenciando Búsqueda, Agente y Capacitación, en lugar de agrupar todo bajo la etiqueta genérica de "bot de IA". Esto le permite crear una política que acepte rastreadores de búsqueda y bloquee los rastreadores de capacitación, por ejemplo.

Esta capa no reemplaza a robots.txt. Sirve como ejecución técnica. Un diseño robusto consiste en mantener el archivo robots.txt expresando su política editorial y configurar WAF para que no la contradiga. Si se permite OAI-SearchBot en el archivo, pero la regla de seguridad bloquea todo el tráfico automatizado, la intención publicada y el comportamiento real del sitio se desalinean.

llms.txt no es un archivo de bloqueo llms.txt surgió como una propuesta abierta para publicar, en un camino predecible, una visión más amigable con los modelos de lenguaje: resumen del sitio, orientación y enlaces a contenido relevante en un formato más fácil de consumir. El objetivo declarado es ayudar a los modelos y agentes a utilizar un sitio en el momento de la inferencia, especialmente en documentación y bases de datos extensas.

Esto es diferente de robots.txt. llms.txt no es un mecanismo de autorización, no es una directiva noindex y no bloquea la red. Los mantenedores siguen presentando la especificación como una propuesta abierta a la comunidad, no como un reemplazo del protocolo de robots. En términos prácticos, piense en llms.txt como un mapa o índice para máquinas; robots.txt es una preferencia de rastreo; noindex es una directiva de indexación; la autenticación y WAF son mecanismos de cumplimiento de acceso.

La publicación de llms.txt tampoco revoca un bloqueo ya colocado en robots.txt. Del mismo modo, permitir una ruta en robots.txt no obliga a ningún sistema a leer llms.txt. Los dos archivos pueden coexistir, pero cumplen funciones diferentes.

Errores que parecen pequeños y cambian el resultado

Bloquear agente de usuario: * y luego esperar a que se resuelva noindex

Si el rastreador no puede acceder a la página, no puede leer la directiva noindex. Ésta es una de las razones por las que robots.txt no debe tratarse como una herramienta para desindexar páginas HTML.

Bloquear todos los bots de IA en CDN y dejar OAI-SearchBot permitido en robots.txt

El archivo dice una cosa y el borde otra. Para el rastreador, el resultado final es el HTTP recibido. Si la CDN responde con un 403, CAPTCHA o desafío que el robot no puede cumplir, el permiso robots.txt no hace que la página sea accesible.

Cree una regla WAF buscando texto extendido de Google en User-Agent

Google documenta que Google-Extended no tiene un agente de usuario HTTP independiente. Es un token de robots.txt. La regla debe aplicarse donde se entienda el token, sin asumir que habrá su propia cadena en cada solicitud.

Utilice ChatGPT-User para intentar controlar la búsqueda

ChatGPT-User está asociado con acciones iniciadas por los usuarios y no determina la presencia en ChatGPT Search. El token de búsqueda es OAI-SearchBot. Mezclar ambos puede provocar un bloqueo que no consiga el objetivo deseado.

Confiar en No permitir para ocultar contenido sensible

Robots.txt no es autenticación. Si el material requiere confidencialidad, el servidor deberá negar el acceso a cualquier persona que no esté autorizada. Una ruta incluida en No permitir sigue siendo una ruta de sitio público.

Una configuración conservadora para los sitios editoriales

Para blogs, portales y sitios institucionales que dependen del descubrimiento orgánico, una política inicial razonable es preservar Googlebot y OAI-SearchBot, bloquear GPTBot si la organización no desea publicar capacitación sobre OpenAI y bloquear Google-Extended si tampoco desea que los usos de Gemini sean controlados por ese token. Luego, alinee el WAF para que los rastreadores permitidos no se bloqueen por error.

Agente de usuario: OAI-SearchBot Permitir: / Agente de usuario: GPTBot Disallow: / Agente de usuario: Googlebot Permitir: / Agente de usuario: Google-Extended Disallow: / Para páginas que no deberían aparecer en los motores de búsqueda, utilice noindex para que el rastreador pueda leerlas. Para áreas a las que no deben acceder terceros, utilice autenticación o autorización del lado del servidor. Para el contenido público que desea que los agentes interpreten más fácilmente, llms.txt puede ser un complemento, no un reemplazo, de estos controles.

Cómo validar después de publicar

Compruebe el archivo entregado a la raíz del dominio

Abra robots.txt como visitante externo y verifique que no haya ninguna regla genérica antigua que anule la intención actual. En sitios con CMS, proxy o CDN, confirme que la versión publicada sea realmente la misma que se editó.

Leer registros y códigos HTTP

Busque solicitudes de los agentes que desea permitir. Si OAI-SearchBot o Googlebot reciben 403, 429 o desafíos, revise WAF, mitigación de bots y limitación de velocidad. Si la política es bloquear un rastreador de capacitación, confirme que las respuestas y los registros reflejen el comportamiento esperado.

Utilizar la verificación de bot cuando esté disponible

En las reglas de firewall, combine la identidad del agente con mecanismos verificables ofrecidos por el proveedor. OpenAI publica rangos de IP para sus rastreadores; Cloudflare mantiene categorías de bots verificadas. Esto reduce el riesgo de generar una excepción solo porque una solicitud escribió el nombre de un bot conocido en el User-Agent.

Esperar a que se propague antes de concluir que ha fallado

OpenAI informa que los cambios en el archivo robots.txt relacionados con la búsqueda pueden tardar alrededor de 24 horas en reflejarse en sus sistemas. Noindex también se basa en el rastreo para que los motores de búsqueda lo detecten. Es posible que un cambio correcto no produzca un efecto instantáneo.

Mida la búsqueda y la visita como cosas diferentes

Permitir OAI-SearchBot aumenta la posibilidad de que el contenido sea descubierto y citado en la búsqueda de ChatGPT, pero no garantiza la posición ni el tráfico. OpenAI informa que las referencias de ChatGPT Search incluyen utm_source=chatgpt.com, lo que ayuda a separar las visitas posteriores al clic de la simple presencia en las respuestas. En Google, Search Console sigue siendo la opción ideal para rastrear e indexar la Búsqueda de Google.

La decisión final en una frase

Si desea una búsqueda no entrenada, mantenga accesibles OAI-SearchBot y Googlebot, bloquee GPTBot y Google-Extended de acuerdo con su política de uso de contenido, trate a ChatGPT-User como un acceso iniciado por el usuario y no como un rastreador de búsqueda, use noindex para controlar la indexación y use autenticación o WAF cuando la restricción realmente deba aplicarse. llms.txt puede ayudar a las máquinas a comprender el contenido público, pero no reemplaza ninguno de estos controles.

Temas de este articuloChatGPT-UsercrawlersGoogle-ExtendedGooglebotGPTBotIAOAI-SearchBotrobots.txtSEO técnico