Crawlers de IA y robots.txt: guía práctica
Configura robots.txt para ChatGPT, Claude, Perplexity y Google separando la visibilidad en búsqueda, la recuperación a pedido del usuario y el entrenamiento.

La forma más rápida de dañar tu visibilidad en la búsqueda con IA es copiar una lista de bloqueo vieja en robots.txt sin comprobar qué hace cada agente. OpenAI, Anthropic y Perplexity publican user agents distintos para la búsqueda, las consultas a pedido del usuario y el desarrollo de modelos. Una sola regla genérica puede dejar a tu sitio fuera justo de las superficies de respuesta a las que intenta entrar.
Esta guía explica la separación actual y propone una política inicial conservadora. Los nombres de los bots y el comportamiento de cada proveedor pueden cambiar, así que trata las páginas oficiales enlazadas como la fuente de verdad.
Primero, separa los tres casos de uso
Descubrimiento en búsqueda
Los crawlers de búsqueda indexan o recuperan contenido público para que un producto de respuestas pueda mostrarlo y citarlo. OpenAI dice que OAI-SearchBot sirve para incluir contenido en los resúmenes y fragmentos de la búsqueda de ChatGPT. Anthropic describe a Claude-SearchBot como el agente que mejora la calidad de los resultados de búsqueda. Perplexity afirma que PerplexityBot está diseñado para mostrar y enlazar sitios web en sus resultados de búsqueda.
Recuperación solicitada por el usuario
Algunos agentes visitan una URL porque un usuario le pidió a un asistente que la abriera o la analizara. Anthropic nombra a Claude-User para ese propósito. Perplexity nombra a Perplexity-User y señala que, como la consulta la inicia el usuario, por lo general ignora robots.txt. Estos agentes no son lo mismo que los crawlers de búsqueda que trabajan en segundo plano.
Desarrollo de modelos
Los controles de entrenamiento son independientes en los proveedores que los ofrecen. OpenAI documenta GPTBot para el contenido que los dueños de sitios quieran excluir de un posible entrenamiento. Anthropic describe a ClaudeBot como su crawler de desarrollo de modelos.
Key takeaways
- OAI-SearchBot: descubrimiento en la búsqueda de ChatGPT
- GPTBot: control del entrenamiento de modelos de OpenAI
- Claude-SearchBot: indexación para la búsqueda de Claude
- Claude-User: recuperación de Claude solicitada por el usuario
- ClaudeBot: control del desarrollo de modelos de Anthropic
- PerplexityBot: descubrimiento en la búsqueda de Perplexity
- Perplexity-User: recuperación solicitada por el usuario
Fuentes: guía de OpenAI para editores, documentación de crawlers de Anthropic y documentación de crawlers de Perplexity.
Un ejemplo conservador de robots.txt
La siguiente política permite el descubrimiento en búsqueda y la recuperación de Claude a pedido del usuario, y a la vez excluye a los dos crawlers de entrenamiento documentados. Es un ejemplo, no una recomendación universal.
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Allow: /
User-agent: *
Allow: /
Disallow: /dashboard
Disallow: /api
Sitemap: https://example.com/sitemap.xml
Si no te molesta que rastreen tu contenido para desarrollar modelos, elimina los grupos Disallow específicos en lugar de añadir reglas Allow innecesarias. Si tu regla comodín ya permite el sitio público, los crawlers de búsqueda normalmente quedan cubiertos, salvo que una regla del CDN, del WAF o de la aplicación los bloquee en otro punto.
robots.txt no es un sistema de control de acceso
Nunca uses directivas para crawlers a fin de proteger datos de clientes, entornos de staging o documentos privados. El archivo es público, y los bots que cumplen las normas pueden optar por no pedir una URL bloqueada, pero el servidor igualmente necesita autenticación y autorización.
Google también explica que robots.txt gestiona el rastreo, no garantiza la eliminación de los resultados de búsqueda. Una URL bloqueada puede seguir descubriéndose a través de enlaces externos. Si el objetivo es desindexar, usa noindex o autenticación, y asegúrate de que el crawler pueda llegar a la página para leer la directiva. Consulta la guía de robots.txt de Google y la documentación de la etiqueta meta robots.
Disallow con un noindex a nivel de página pensando que se leerán las dos cosas. Si el rastreo está bloqueado, es posible que el bot nunca vea la etiqueta meta.Revisa también el WAF y el CDN
Un archivo correcto no sirve de nada si la solicitud se rechaza antes de llegar. Prueba cada ruta pública importante con el user agent correspondiente e inspecciona el estado final, el contenido renderizado y las cabeceras.
curl -I -A "OAI-SearchBot" https://example.com/important-page
curl -I -A "Claude-SearchBot" https://example.com/important-page
curl -I -A "PerplexityBot" https://example.com/important-page
Las cadenas de user agent se pueden falsificar, así que no uses la cabecera por sí sola para saltarte controles de seguridad relevantes. Perplexity publica sus endpoints de IP vigentes y recomienda combinar comprobaciones de user agent e IP al configurar un WAF. Actualiza las listas de IP de los proveedores desde sus endpoints oficiales en lugar de dejar fijo para siempre un rango copiado.
Verifica la ruta completa del crawler
Sigue esta secuencia después de cada cambio:
- Pide
/robots.txtsin redirecciones ni autenticación. - Confirma que la URL del sitemap está al día y devuelve un XML válido.
- Prueba páginas públicas representativas con cada user agent de búsqueda.
- Confirma que la página devuelve 200, una URL canónica y contenido sustancial renderizado en el servidor.
- Revisa los logs del CDN y de la aplicación en busca de respuestas 401, 403, 429 y desafíos (challenges).
- Verifica que las rutas protegidas sigan exigiendo autorización real.
- Vuelve a revisar la documentación de los proveedores cada trimestre, porque los user agents evolucionan.
Cómo afecta esto a tu visibilidad en IA
El acceso de los crawlers es una condición de elegibilidad, no una garantía de posicionamiento. Google dice que el contenido público y rastreable y el SEO estándar siguen siendo la base de sus funciones generativas. OpenAI y Perplexity describen igualmente el acceso de los crawlers como una forma de favorecer el descubrimiento, no como una promesa de cita.
Cuando el acceso técnico esté limpio, mide si los motores realmente mencionan la marca y qué fuentes eligen. Sigue el marco de auditoría de visibilidad en IA y luego usa la checklist GEO para mejorar las páginas asociadas a los prompts más débiles.
Preguntas frecuentes
- ¿Qué crawler debo permitir para la búsqueda de ChatGPT?
- La guía actual de OpenAI para editores indica que no bloquees OAI-SearchBot si quieres que tu contenido aparezca en los resúmenes y fragmentos de la búsqueda de ChatGPT. GPTBot es un control aparte, relacionado con el posible entrenamiento de modelos.
- ¿Puedo permitir la búsqueda con IA pero bloquear el entrenamiento de modelos?
- Algunos proveedores exponen user agents separados para cada propósito. Por ejemplo, OpenAI distingue OAI-SearchBot de GPTBot, y Anthropic distingue Claude-SearchBot y Claude-User de ClaudeBot. Verifica siempre la documentación oficial vigente.
- ¿Un Disallow en robots.txt saca una página de los resultados de búsqueda?
- No de forma fiable. robots.txt controla el rastreo, no garantiza la desindexación. Una URL bloqueada aún puede descubrirse a través de enlaces. Si el objetivo es eliminarla, usa un método de control de indexación como noindex y deja que el crawler pueda leer esa directiva.
- ¿Necesito reglas Allow específicas para cada crawler de IA?
- No, si tu regla comodín ya permite las páginas públicas y tu firewall deja pasar las solicitudes. Las reglas explícitas sirven cuando quieres políticas distintas para búsqueda, recuperación a pedido del usuario y entrenamiento.
Fuentes
- Documentación de OpenAI: descripción general de los rastreadores de OpenAI (OAI-SearchBot, GPTBot, ChatGPT-User) (developers.openai.com)
- Centro de ayuda de Claude: ¿Anthropic rastrea datos de la web y cómo pueden los propietarios de sitios bloquear el rastreador? (support.claude.com)
- Documentación de Perplexity: rastreadores de Perplexity (docs.perplexity.ai)
- Google Search Central: introducción y guía de robots.txt (developers.google.com)
Sigue leyendo
- SEO para Google AI Overviews: lo que de verdad funcionaMejora tu elegibilidad para Google AI Overviews con páginas rastreables, contenido diferenciado, evidencia clara, buen material multimedia y medición fiable.
- SEO de entidades para búsqueda con IA: marco prácticoAclara la entidad de tu marca para la búsqueda con IA: datos coherentes, páginas canónicas, schema exacto, corroboración externa y prompts de compra medibles.