Budget de crawl : pourquoi ce n'est pas votre problème
Le budget de crawl est un concept réel, et pour l'immense majorité des sites c'est une distraction. Si vous avez quelques centaines ou quelques milliers de pages, les moteurs ne rationnent pas leurs visites chez vous, et aucune optimisation ne fera indexer votre contenu plus vite.
Le terme mérite surtout d'être compris pour reconnaître les situations où il s'applique vraiment, et cesser de s'inquiéter pour toutes les autres.
Ce que cela veut dire
Un robot ne peut pas visiter toutes les URL du web aussi souvent qu'il le voudrait : il décide donc de l'attention qu'il accorde à chaque site. Deux choses la déterminent : ce qu'il pense de l'intérêt de revenir chez vous, et ce que votre serveur encaisse sans peiner.
Notez qu'aucune des deux n'est un quota que l'on recharge. Un site qui publie régulièrement des choses utiles est exploré davantage parce que cela en vaut la peine, pas parce qu'il a gagné des points. C'est une conséquence, pas un levier, et c'est ce contresens qui produit la plupart des optimisations inutiles.
Êtes-vous concerné ? Le tableau qui tranche
| Votre site | Concerné | Ce qu'il faut faire |
|---|---|---|
| Moins de 1 000 pages | Non | Rien, vraiment rien |
| 1 000 à 10 000 pages stables | Non | Publier, mailler correctement |
| Boutique avec filtres combinables | Oui | Fermer l'espace infini |
| Catalogue de plus de 100 000 pages | Oui | Trier ce qui mérite d'être exploré |
| Calendrier ou recherche exposés | Oui | Bloquer, pas optimiser |
| Serveur lent, plus de deux secondes | Oui | Corriger le temps de réponse |
Les deux premières lignes couvrent la quasi-totalité des sites qui posent la question. Si vous y êtes, la meilleure décision est de refermer cet article et d'aller écrire une page utile.
Qui est réellement concerné
Les sites à espace d'URL illimité. Une boutique où chaque combinaison de filtres est une adresse distincte. Un calendrier qui génère volontiers l'année 2147. Une page de recherche qui transforme n'importe quelle requête en URL explorable. Ces sites n'ont pas dix mille pages, ils en ont une infinité, et c'est cela, le vrai problème : ce n'est pas un budget insuffisant, c'est une dépense sans fond.
Les très grands catalogues : des centaines de milliers de pages réelles, où la longue traîne se dispute réellement l'attention. À cette échelle, la question n'est plus technique mais éditoriale : quelles pages méritent d'exister.
Les sites qui répondent lentement. Si votre serveur met deux secondes par page, un robot lève le pied pour ne pas vous nuire. Ici le correctif n'est pas un réglage SEO : c'est le temps de réponse, et il profite aussi à vos visiteurs, ce qui en fait le seul travail de cette liste qui rapporte deux fois.
Ce que l'on prend à tort pour un problème de budget
Un tas de 404. Cela a l'air d'un gaspillage, et ce n'en est pas un. Un robot apprend qu'une URL a disparu et cesse de la demander. Corrigez ceux vers lesquels quelque chose pointe encore, pas les autres, et surtout ne supprimez pas de pages pour « alléger » quoi que ce soit.
Des pages non indexées. Presque toujours un jugement de qualité ou de duplication, pas de budget. La page a été vue et n'a pas été retenue : c'est une autre conversation, et elle se règle en améliorant la page, pas en réglant un robot.
Un démarrage lent après une migration. Les nouvelles URL sont découvertes progressivement. C'est normal et sans rapport avec un rationnement : la check-list de migration couvre ce qui aide vraiment, à savoir des redirections propres et un sitemap à jour.
Des chaînes de redirections. Elles coûtent effectivement des requêtes, mais le problème qu'elles posent est ailleurs : elles finissent par être coupées, et elles perdent des visiteurs bien avant de coûter la moindre exploration. La règle du saut unique se justifie sans invoquer le budget de crawl.
Si vous êtes réellement concerné
Le travail consiste à supprimer des adresses, pas à ajouter des directives.
Cessez de générer des combinaisons d'URL que personne ne devrait voir : c'est un
réglage de gabarit, pas un fichier de configuration. Utilisez robots.txt pour
les espaces infinis, calendriers et recherches internes en tête. Renvoyez des
codes de statut corrects, pour qu'un robot sache quoi oublier. Gardez un sitemap
limité aux pages que vous voulez réellement faire visiter, et retirez-en tout ce
qui renvoie une erreur.
Un mot sur noindex et robots.txt, que l'on confond en permanence : le premier
demande de ne pas indexer une page qui sera quand même visitée, le second demande
de ne pas la visiter du tout. Pour un espace infini, c'est le second qu'il faut,
et c'est aussi celui qui rend la page définitivement invisible, donc à manier
avec précaution.
Avant de poser une règle dans robots.txt, testez-la : une directive trop large
ferme un pan entier du site sans rien annoncer.
Vérifier ce qu'un robot a le droit de visiter prend dix
secondes et évite l'erreur la plus coûteuse de cette page.
D'où vient l'inquiétude, et pourquoi elle dure
Le sujet a une histoire, et la connaître aide à s'en défaire. L'expression vient de documentations destinées aux très grands sites, où elle décrivait un problème réel d'allocation de ressources. Elle a ensuite été reprise dans des guides généralistes qui ont retiré la condition de taille, et il n'est resté qu'une inquiétude sans seuil.
Elle dure pour deux raisons. D'abord parce qu'elle est agréable : elle offre une explication technique à un manque de résultats, ce qui est plus confortable que la conclusion éditoriale. Ensuite parce qu'elle est invérifiable pour la plupart des gens, faute d'accès aux journaux du serveur. Une croyance qu'on ne peut pas tester ne meurt pas.
Le test qui la tranche tient en une question : une page que j'ai publiée la semaine dernière est-elle indexée ? Si oui, votre site est exploré autant qu'il en a besoin, et le sujet est clos.
Ce qui aide vraiment à être exploré
Trois choses, aucune ne portant le nom de budget.
Des liens internes vers vos pages profondes. Une page qu'aucun lien n'atteint depuis votre accueil en trois clics est une page que les robots trouvent tard et revisitent rarement. C'est le levier le plus efficace, et c'est aussi le seul qui serve à vos lecteurs.
Un sitemap propre. À jour, sans URL en erreur, sans pages bloquées, avec des dates de modification honnêtes. Un sitemap qui ment sur les dates cesse rapidement d'être pris au sérieux.
Un site qui répond vite. Cela ne relève pas du référencement, cela relève de l'hébergement, et cela profite d'abord aux gens qui vous lisent. Les liens morts et les redirections en cascade y contribuent aussi, ce qui est une raison de plus de les traiter sans jamais invoquer le budget de crawl.
Comment mesurer, plutôt que deviner
Les journaux de votre serveur sont le seul endroit où cette question se tranche honnêtement. Ils disent quelles URL ont été demandées, par quel robot, combien de fois, et avec quel code de réponse.
Trois chiffres suffisent, relevés avant puis un mois après :
- Le nombre d'URL distinctes explorées. S'il est très supérieur au nombre de vos pages réelles, vous avez un espace infini quelque part.
- La part des réponses en erreur. Une proportion élevée indique un problème de structure, pas de budget.
- La part des requêtes portant sur des pages sans intérêt. C'est la seule mesure qui justifie une intervention.
Sans ces trois chiffres, toute optimisation de budget de crawl est une croyance. Avec eux, la question se règle en général en une après-midi, et la plupart du temps la conclusion est qu'il n'y avait rien à faire.
Reste un travail qui, lui, mérite vraiment votre temps et n'a rien à voir avec les robots : les liens qui partent de chez vous vers des pages mortes ailleurs. Ceux-là ne figurent dans aucun rapport d'exploration, et ce sont vos lecteurs qui les rencontrent en premier.
Questions fréquentes
À partir de combien de pages le budget de crawl compte-t-il ?
Il n'existe pas de seuil officiel, mais le sujet vise les très grands sites : des centaines de milliers d'URL, ou un site qui génère des adresses sans limite. Quelques milliers de pages, ce n'est pas cela.
Les erreurs 404 gaspillent-elles du budget de crawl ?
À peine. Un robot apprend vite qu'une URL a disparu et cesse de la demander. Les 404 méritent d'être corrigés quand quelque chose pointe encore dessus, pas pour une histoire de coût d'exploration.
Qu'est-ce qui consomme réellement du budget de crawl ?
Les espaces d'URL infinis, surtout : combinaisons de filtres, calendriers sans fin, paramètres de session, versions imprimables de chaque page. Le volume de contenu réel est rarement en cause.
Ne perdez plus jamais un backlink
Ajoutez vos sites et vos liens, Expansel les surveille pour vous.
Commencer gratuitement