Saltar al contenido
AZ Tools

Probador de robots.txt

Implementa las reglas de coincidencia usadas por Googlebot / Bingbot: los grupos se indexan por user-agent, el UA más específico gana (exacto > substring > *), y dentro de un grupo gana el patrón coincidente más largo (empates favorecen Allow sobre Disallow). Soporta el wildcard * y el ancla de fin-de-ruta $. También muestra cada declaración Sitemap:, así puedes verificar que tus URLs de sitemap son alcanzables.

Grupos parseados: 3Sitemaps: 1
Casos de prueba
  • Permitidoregla: Allow: /admin/
  • Permitidoregla: Allow: /admin/public/
  • Bloqueadoregla: Disallow: /
  • Bloqueadoregla: Disallow: /private/
Sitemaps
  • https://example.com/sitemap.xml

Las coincidencias UA por substring son insensibles a mayúsculas. El patrón más largo gana; empates van a Allow.

Cómo usar

  1. Pega tu robots.txt en la caja superior.
  2. Agrega casos de prueba (user-agent, ruta) — establece UA en '*' para probar el grupo catch-all.
  3. Lee el veredicto y la regla que lo produjo a la derecha.

Preguntas frecuentes

¿Cómo funciona la coincidencia más larga?
Dentro del grupo UA coincidente, la regla con el patrón más largo que aún coincide con la ruta gana. Allow y Disallow se ponderan solo por longitud de patrón — un Allow con un patrón más largo vence a un Disallow con uno más corto.
¿Qué significa $ al final de un patrón?
Ancla el patrón al final de la ruta URL. /foo$ coincide con /foo exactamente, no con /foo/bar. Útil para bloquear extensiones de archivo específicas como /*.pdf$.
¿Una regla Disallow mantiene la página fuera de los resultados?
No de forma fiable. Impide que los rastreadores respetuosos descarguen la página, pero una URL enlazada desde otros sitios puede aparecer igualmente, porque el rastreador nunca lee la página y por tanto nunca ve una etiqueta noindex en ella. Para sacar algo del índice, permite que se rastree y devuelve noindex, o ponlo detrás de autenticación.
¿Un solo robots.txt cubre mis subdominios?
No. El archivo se aplica a un único esquema, host y puerto, así que example.com y www.example.com necesitan cada uno el suyo, y un puerto distinto también. Además debe estar en la raíz de ese host: un robots.txt dentro de un subdirectorio sencillamente no se lee.

Herramientas relacionadas