Probador de robots.txt

¿Está bloqueada una URL, para qué rastreador y por qué regla? Prueba Googlebot, Bingbot y los rastreadores de IA —GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y más— con un archivo en vivo o pegado. Aplica las reglas de coincidencia de Google, también las que pillan desprevenido a casi todo el mundo.

Gratis, sin email28 rastreadoresSe registra la dirección

Página que quieres probar

Cualquier URL del sitio. El probador consulta el /robots.txt de ese sitio y comprueba la URL con él.

Rastreadores

Pasa el ratón por un nombre para ver qué hace. El grupo habitual cubre Google, Bing, Apple, OpenAI, Anthropic y Perplexity.

Cómo decide el probador

Sigue la documentación de Google sobre robots.txt y el analizador de código abierto que esa documentación describe. Cuatro reglas hacen casi todo el trabajo:

  1. Cada rastreador obedece a un solo grupo

    El grupo cuyo user-agent coincide con él de forma más específica. Si un grupo nombra al rastreador, el grupo * deja de aplicársele por completo, incluidas las reglas que habías pensado para todos. Si hay varios grupos para el mismo rastreador, se combinan.

  2. Las líneas en blanco no cierran un grupo

    Varias líneas user-agent seguidas comparten las reglas que vienen detrás, aunque haya una línea en blanco o un comentario entre ellas. Solo una regla cierra un grupo.

  3. Gana la regla más larga que coincide

    Se mide por la longitud de la ruta de la regla. En caso de empate, gana allow. * coincide con cualquier secuencia de caracteres y $ marca el final de la URL. Las rutas distinguen mayúsculas de minúsculas e incluyen la cadena de consulta.

  4. Para Google solo cuentan cuatro campos

    user-agent, allow, disallow y sitemap. crawl-delay y noindex se ignoran, igual que todo lo que venga después de los primeros 500 KiB del archivo.

Algunos rastreadores añaden su propio matiz, y el probador modela cada uno a partir de la documentación de su propietario. Googlebot-Image y Googlebot-News siguen el grupo de Googlebot si no tienen uno propio. Applebot sigue las reglas de Googlebot cuando ningún grupo nombra a Applebot. Y AdsBot, de Google, ignora el grupo *, así que solo se bloquea si se le nombra.

Búsqueda, búsqueda con IA y entrenamiento son bots distintos

Casi toda la confusión con los rastreadores de IA viene de tratar a cada empresa como un único bot. No lo son, y bloquear el que no toca te cuesta visibilidad sin proteger nada:

Si quieres…Lo decideNo este
Quedarte fuera de las vistas creadas con IA y del Modo IA de GoogleNingún rastreador: el control de IA generativa de la Búsqueda en Search Console, disponible para todos los sitios desde el 31 de agosto de 2026. Bloquear Googlebot te sacaría de la Búsqueda por completoGoogle-Extended, que cubre el entrenamiento de Gemini y la fundamentación de respuestas, y no afecta a la Búsqueda
Que OpenAI no entrene con tu contenidoGPTBotOAI-SearchBot, que te mete en la búsqueda de ChatGPT
Aparecer en las respuestas de búsqueda de ChatGPTHay que permitir OAI-SearchBotGPTBot
Que Anthropic no entrene con tu contenidoClaudeBotClaude-SearchBot y Claude-User, que afectan a tu visibilidad en Claude
Que Apple no entrene su IA con tu contenidoApplebot-ExtendedApplebot, que alimenta la búsqueda de Spotlight, Siri y Safari

Una advertencia más. Los rastreadores que actúan a petición de un usuario pueden no seguir robots.txt. OpenAI dice que sus reglas pueden no aplicarse a ChatGPT-User, Perplexity dice que Perplexity-User en general lo ignora, y Meta y Amazon dicen algo parecido de los suyos. Anthropic dice que Claude-User sí lo respeta. Para los que pueden no hacerlo, el probador muestra igualmente lo que dice el archivo y señala el riesgo.

Qué significa el código de estado

Con un sitio en vivo, el probador informa de lo que respondió el servidor y lo explica como lo hace Google:

  • 200. El archivo se lee y se aplica.
  • Redirecciones. Google sigue al menos cinco saltos. Más allá, trata robots.txt como no encontrado.
  • 4xx, salvo 429. Se trata como si no hubiera robots.txt: no se bloquea nada. Un 403 en robots.txt no deja fuera a Google.
  • 429, 5xx o un error de red. Google deja de rastrear el sitio durante 12 horas mientras reintenta, y después usa la última copia que pudo leer durante un máximo de 30 días.
  • Una página HTML servida como robots.txt. Google la analiza igualmente, no encuentra reglas válidas y no bloquea nada; casi nunca es lo que el sitio pretendía.

Qué envía este probador

El contenido de un archivo pegado nunca sale de tu navegador. Con un sitio en vivo, la dirección que escribes se envía a una función de este sitio, que pide /robots.txt a ese dominio —y nada más— y sigue las redirecciones con los mismos controles que el validador de hreflang. Devuelve el estado y las líneas de reglas, nunca el resto de la respuesta, y no guarda nada. Un sitio puede servir a este probador un archivo distinto del que sirve a Googlebot; si lo sospechas, compáralo con el informe de robots.txt de Search Console.

Para escribir un archivo nuevo en lugar de probar uno, el generador de robots.txt lo crea con las mismas reglas y comprueba su propio resultado con el motor de este probador.

Fuentes

Preguntas

No. En noviembre de 2023 Google añadió un informe de robots.txt a Search Console y retiró el antiguo probador. El informe muestra los archivos que encontró y sus errores, y la inspección de URLs indica si una página está bloqueada para Googlebot, pero ninguno prueba una regla contra una URL para otros rastreadores.
No. GPTBot es el rastreador de entrenamiento de OpenAI. La búsqueda de ChatGPT depende de OAI-SearchBot, y OpenAI dice que los sitios que lo bloquean no aparecen en sus respuestas de búsqueda. Se controlan por separado.
No. Google dice que no afecta a la inclusión en la Búsqueda ni es una señal de posicionamiento. Controla el entrenamiento de Gemini y la fundamentación de respuestas. Las vistas creadas con IA y el Modo IA forman parte de la Búsqueda, que rastrea Googlebot.
Un archivo pegado se prueba en tu navegador y su contenido no se envía nunca. Con un sitio en vivo, la dirección va a una función de este sitio que consulta el robots.txt de ese dominio. Se registra el dominio, con el estado y cuántos rastreadores y rutas probaste. Con Do Not Track o Global Privacy Control no se envía.