Probar el robots.txt
Una línea de más en un fichero de cuatro líneas retira un sitio entero de los resultados, sin error y sin aviso. Esta página dice si tu dirección está afectada.
Cómo leer este resultado
El robots.txt es un fichero de unas pocas líneas puesto en la raíz de un sitio. Es público, cualquiera puede leerlo, y no protege nada: es una petición, no una cerradura.
La regla que decide no es la primera
Entre un Disallow y un Allow que coinciden ambos con una dirección, gana el más largo. Es la regla que aplica Google, y la que usa este probador. Permite escribir:
Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php
y ser entendido: todo el espacio de administración está cerrado, salvo ese fichero concreto. Muchos probadores aplican «gana el primero» y dan el veredicto contrario.
Rastreo e indexación no son lo mismo
Es la confusión más extendida sobre el tema, y cuesta en ambos sentidos.
Bloquear una dirección en el robots.txt impide a un buscador leerla. No le impide incluirla en sus resultados si otros sitios apuntan a ella: aparece entonces sin descripción, que es lo peor de los dos mundos. Para retirar de verdad una página hace falta una etiqueta noindex, y por tanto dejar que el buscador venga a leerla.
A la inversa, una dirección permitida aquí puede perfectamente llevar un noindex y no aparecer en ninguna parte. Este fichero no lo ve.
El bloqueo total, y cómo ocurre
Dos líneas bastan para retirar un sitio entero de los buscadores:
User-agent: * Disallow: /
Es el ajuste normal de un sitio en preproducción, y es también lo que se queda el día de la puesta en marcha cuando nadie piensa en ello. El sitio funciona perfectamente, simplemente ya no existe para los buscadores, y nada lo señala.
Crawl-delay y sitemap
El Crawl-delay pide espaciar las peticiones. Google lo ignora, la mayoría de los demás robots lo respetan. Las líneas Sitemap declaran dónde encontrar la lista de páginas: es el único sitio donde un buscador puede descubrirla sin que se la entreguen.
Lo que esta herramienta no hace
- No dice si la página está indexada. El robots.txt gobierna el rastreo; la indexación depende también de la etiqueta meta robots y de la cabecera X-Robots-Tag, que esta herramienta no lee.
- Prueba una dirección a la vez, y para un solo robot. Un fichero puede perfectamente permitir Googlebot y bloquear GPTBot.
- No modifica nada ni propone correcciones: lee el fichero tal cual y dice lo que implica.
Preguntas frecuentes
¿Puede una página bloqueada aparecer en Google?
Sí, y ahí está la trampa. Si otros sitios apuntan a ella, Google puede mostrarla sin descripción, indicando que no hay información disponible. Para retirar una página definitivamente hace falta una etiqueta noindex, y por tanto dejar que el buscador la lea.
¿Hay que bloquear las páginas de búsqueda interna y los filtros?
Por lo general sí. Puede haber un número potencialmente infinito de ellas, sin contenido propio, y dejarlas abiertas gasta el presupuesto de rastreo en algo que no son tus páginas reales.
¿Por qué probar GPTBot por separado?
Porque las reglas pueden diferir de un robot a otro, y muchos sitios han añadido reglas dirigidas a los robots de inteligencia artificial sin tocar las demás. Comprobar con el asterisco no dice, por tanto, lo que verá un robot nombrado explícitamente.
Para profundizar
Presupuesto de rastreo: por qué no es tu problema El presupuesto de rastreo existe y casi con seguridad no afecta a tu sitio. A quién afecta de verdad, y qué se confunde con él.Las otras herramientas
Comprobar un nombre de dominio
Fecha de caducidad, registrador y estado de un nombre de dominio.
Comprobar un certificado SSL
Fecha de caducidad del certificado, emisor y nombres que cubre de verdad.
Comprobar las redirecciones
Toda la cadena de redirecciones, salto a salto, con el tipo de cada uno.
Detectar un bloqueo accidental el día en que ocurre
El rastreo de Expansel señala las páginas excluidas por el robots.txt de tu sitio, y ves enseguida si una puesta en producción ha cerrado más de lo previsto.