¿Está bloqueada una URL, para qué rastreador y por qué regla? Prueba Googlebot, Bingbot y los rastreadores de IA —GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y más— con un archivo en vivo o pegado. Aplica las reglas de coincidencia de Google, también las que pillan desprevenido a casi todo el mundo.
Para la URL que has escrito. «Lo decide» indica la regla y el grupo del que viene.
✓ permitido, ✗ bloqueado. Pasa el ratón por una celda para ver la regla.
Primero los problemas. Las reglas son las de Google salvo que se indique otra cosa.
Sigue la documentación de Google sobre robots.txt y el analizador de código abierto que esa documentación describe. Cuatro reglas hacen casi todo el trabajo:
El grupo cuyo user-agent coincide con él de forma más específica. Si un grupo nombra al rastreador, el grupo * deja de aplicársele por completo, incluidas las reglas que habías pensado para todos. Si hay varios grupos para el mismo rastreador, se combinan.
Varias líneas user-agent seguidas comparten las reglas que vienen detrás, aunque haya una línea en blanco o un comentario entre ellas. Solo una regla cierra un grupo.
Se mide por la longitud de la ruta de la regla. En caso de empate, gana allow. * coincide con cualquier secuencia de caracteres y $ marca el final de la URL. Las rutas distinguen mayúsculas de minúsculas e incluyen la cadena de consulta.
user-agent, allow, disallow y sitemap. crawl-delay y noindex se ignoran, igual que todo lo que venga después de los primeros 500 KiB del archivo.
Algunos rastreadores añaden su propio matiz, y el probador modela cada uno a partir de la documentación de su propietario. Googlebot-Image y Googlebot-News siguen el grupo de Googlebot si no tienen uno propio. Applebot sigue las reglas de Googlebot cuando ningún grupo nombra a Applebot. Y AdsBot, de Google, ignora el grupo *, así que solo se bloquea si se le nombra.
Casi toda la confusión con los rastreadores de IA viene de tratar a cada empresa como un único bot. No lo son, y bloquear el que no toca te cuesta visibilidad sin proteger nada:
| Si quieres… | Lo decide | No este |
|---|---|---|
| Quedarte fuera de las vistas creadas con IA y del Modo IA de Google | Ningún rastreador: el control de IA generativa de la Búsqueda en Search Console, disponible para todos los sitios desde el 31 de agosto de 2026. Bloquear Googlebot te sacaría de la Búsqueda por completo | Google-Extended, que cubre el entrenamiento de Gemini y la fundamentación de respuestas, y no afecta a la Búsqueda |
| Que OpenAI no entrene con tu contenido | GPTBot | OAI-SearchBot, que te mete en la búsqueda de ChatGPT |
| Aparecer en las respuestas de búsqueda de ChatGPT | Hay que permitir OAI-SearchBot | GPTBot |
| Que Anthropic no entrene con tu contenido | ClaudeBot | Claude-SearchBot y Claude-User, que afectan a tu visibilidad en Claude |
| Que Apple no entrene su IA con tu contenido | Applebot-Extended | Applebot, que alimenta la búsqueda de Spotlight, Siri y Safari |
Una advertencia más. Los rastreadores que actúan a petición de un usuario pueden no seguir robots.txt. OpenAI dice que sus reglas pueden no aplicarse a ChatGPT-User, Perplexity dice que Perplexity-User en general lo ignora, y Meta y Amazon dicen algo parecido de los suyos. Anthropic dice que Claude-User sí lo respeta. Para los que pueden no hacerlo, el probador muestra igualmente lo que dice el archivo y señala el riesgo.
Con un sitio en vivo, el probador informa de lo que respondió el servidor y lo explica como lo hace Google:
El contenido de un archivo pegado nunca sale de tu navegador. Con un sitio en vivo, la dirección que escribes se envía a una función de este sitio, que pide /robots.txt a ese dominio —y nada más— y sigue las redirecciones con los mismos controles que el validador de hreflang. Devuelve el estado y las líneas de reglas, nunca el resto de la respuesta, y no guarda nada. Un sitio puede servir a este probador un archivo distinto del que sirve a Googlebot; si lo sospechas, compáralo con el informe de robots.txt de Search Console.
Para escribir un archivo nuevo en lugar de probar uno, el generador de robots.txt lo crea con las mismas reglas y comprueba su propio resultado con el motor de este probador.
OAI-SearchBot, y OpenAI dice que los sitios que lo bloquean no aparecen en sus respuestas de búsqueda. Se controlan por separado.