Tester le robots.txt
Une ligne de trop dans un fichier de quatre lignes retire un site entier des résultats, sans erreur et sans alerte. Cette page dit si votre adresse est concernée.
Comment lire ce résultat
Le robots.txt est un fichier de quelques lignes posé à la racine d'un site. Il est public, tout le monde peut le lire, et il ne protège rien : c'est une demande, pas une serrure.
La règle qui décide n'est pas la première
Entre un Disallow et un Allow qui correspondent tous les deux à une adresse, le plus long l'emporte. C'est la règle appliquée par Google, et c'est elle que ce testeur utilise. Elle permet d'écrire :
Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php
et d'être compris : tout l'espace d'administration est fermé, sauf ce fichier précis. Beaucoup de testeurs appliquent « le premier motif gagne » et donnent le verdict inverse.
Exploration et indexation ne sont pas la même chose
C'est la confusion la plus répandue sur le sujet, et elle coûte cher dans les deux sens.
Bloquer une adresse dans le robots.txt empêche un moteur de la lire. Cela ne l'empêche pas de la faire figurer dans ses résultats si d'autres sites pointent vers elle : elle apparaît alors sans description, ce qui est le pire des deux mondes. Pour retirer réellement une page, il faut une balise noindex, donc laisser le moteur venir la lire.
Inversement, une adresse autorisée ici peut très bien porter un noindex et n'apparaître nulle part. Ce fichier ne le voit pas.
Le blocage total, et comment il arrive
Deux lignes suffisent à retirer un site entier des moteurs :
User-agent: * Disallow: /
C'est le réglage normal d'un site en préproduction, et c'est aussi ce qui reste en place le jour de la mise en ligne quand personne n'y pense. Le site fonctionne parfaitement, il n'existe simplement plus pour les moteurs, et rien ne le signale.
Crawl-delay et sitemap
Le Crawl-delay demande d'espacer les requêtes. Google l'ignore, la plupart des autres robots le respectent. Les lignes Sitemap déclarent où trouver la liste des pages : c'est le seul endroit où un moteur peut la découvrir sans qu'on la lui soumette.
Ce que cet outil ne fait pas
- Il ne dit pas si la page est indexée. Le robots.txt gouverne l'exploration ; l'indexation dépend aussi de la balise meta robots et de l'en-tête X-Robots-Tag, que cet outil ne lit pas.
- Il ne teste qu'une adresse à la fois, et pour un seul robot. Un fichier peut très bien autoriser Googlebot et bloquer GPTBot.
- Il ne modifie rien et ne propose pas de correction : il lit le fichier tel qu'il est et dit ce qu'il implique.
Questions fréquentes
Une page bloquée peut-elle apparaître dans Google ?
Oui, et c'est le piège. Si d'autres sites pointent vers elle, Google peut l'afficher sans description, avec la mention qu'aucune information n'est disponible. Pour retirer une page pour de bon, il faut une balise noindex et donc laisser le moteur venir la lire.
Faut-il bloquer les pages de recherche interne et les filtres ?
En général oui. Ce sont des adresses en nombre potentiellement infini, sans contenu propre, et les laisser ouvertes fait dépenser le budget d'exploration ailleurs que sur vos vraies pages.
Pourquoi tester GPTBot séparément ?
Parce que les règles peuvent différer d'un robot à l'autre, et que beaucoup de sites ont ajouté des règles visant les robots d'intelligence artificielle sans toucher aux autres. Vérifier avec l'étoile ne dit donc pas ce que verra un robot nommé explicitement.
Pour aller plus loin
Budget de crawl : pourquoi ce n'est pas votre problème Le budget de crawl existe, et il ne concerne presque sûrement pas votre site. Voici qui il concerne vraiment, et ce qu'on prend à tort pour lui.Les autres outils
Vérifier un nom de domaine
Date d'expiration, bureau d'enregistrement et état d'un nom de domaine.
Vérifier un certificat SSL
Date d'expiration du certificat, émetteur, et noms réellement couverts.
Vérifier les redirections
Toute la chaîne de redirections, saut par saut, avec le type de chacun.
Détecter un blocage accidentel le jour où il arrive
L'exploration Expansel signale les pages exclues par le robots.txt de votre site, et vous voyez tout de suite si une mise en production a fermé plus que prévu.