Google a récemment mis à jour sa documentation consacrée au crawl budget. La plupart des modifications ont pour objectif de clarifier le vocabulaire employé et de mieux expliquer des mécanismes déjà en place. Certaines précisions apportent toutefois un éclairage utile aux équipes SEO. La principale concerne la manière dont Google attribue sa capacité de crawl.
Google commence avec une capacité de crawl réduite
La nouvelle documentation précise que chaque site commence avec une même capacité de crawl, volontairement réduite. Googlebot n’alloue donc pas immédiatement des ressources importantes à un nouveau domaine ou à un site qu’il connaît encore peu.
Cette capacité n’est pas figée. Elle peut augmenter progressivement lorsque Google identifie un besoin de crawl plus élevé et que le site reste techniquement capable de supporter cette activité.
Le crawl budget apparaît ainsi moins comme un quota accordé une fois pour toutes que comme une ressource ajustée en fonction des caractéristiques du site, de son évolution et de sa qualité technique.
Cette précision confirme que le crawl budget ne dépend pas uniquement du nombre de pages publiées et qu’il repose aussi sur la capacité de l’infrastructure à répondre rapidement à ses robots.
La demande de crawl dépend de la valeur perçue des pages
Google distingue la capacité de crawl, qui correspond aux ressources que le moteur de recherche consacre à chaque site, de la demande de crawl, qui reflète son intérêt pour ses contenus.
Plusieurs facteurs influencent cette demande :
- La taille du site
- La fréquence de mise à jour des contenus
- La qualité des pages
- Leur pertinence par rapport aux contenus disponibles sur d’autres sites
Un site qui publie régulièrement de nouveaux contenus à valeur ajoutée peut donc susciter une demande de crawl plus forte. Il en va de même pour un site dont les contenus sont fréquemment actualisés.
À l’inverse, la multiplication de contenus pauvres, redondants ou qui ne se différencient pas suffisamment de ce qui a déjà été publié ne suffit pas à augmenter la demande de crawl.
Une capacité de crawl partagée entre les robots de Google
La documentation apporte une autre précision technique : la capacité de crawl d’un site est partagée entre les différents robots de Google. Une activité importante du robot qui indexe les images peut donc réduire temporairement la capacité de celui qui indexe les contenus textuels. L’analyse du crawl doit donc porter sur l’ensemble des user-agents de Google.
La performance du serveur reste un levier central
Google rappelle que les éditeurs peuvent agir sur la capacité de crawl en améliorant les performances techniques du site. Plus le serveur répond rapidement, plus les Googlebot peuvent consulter de pages dans une période donnée.
L’optimisation porte aussi sur le comportement de l’infrastructure face aux requêtes des robots : disponibilité du serveur, stabilité des réponses, poids des ressources, temps de génération des pages et gestion des erreurs.
Le cache HTTP peut améliorer l’efficacité du crawl
Google recommande également de configurer correctement le cache HTTP et de prendre en charge le statut 304 « Not Modified ». Lorsqu’un robot revient sur une page dont le contenu n’a pas changé, le serveur peut lui renvoyer une réponse 304 sans corps de réponse. Google réutilise alors la version du contenu précédemment explorée, sans avoir à la télécharger de nouveau.
Ce mécanisme repose notamment sur les en-têtes de validation Last-Modified ou ETag, ainsi que sur le traitement des requêtes conditionnelles If-Modified-Since et If-None-Match susceptibles d’être envoyées par les robots. Google précise toutefois que ces en-têtes conditionnels ne sont pas utilisés lors de chaque tentative d’exploration.
Le statut 304 n’augmente pas directement la demande de crawl et ne garantit pas que les ressources économisées seront réaffectées à d’autres pages. Il réduit cependant la bande passante consommée et les ressources de traitement mobilisées par le serveur, ce qui peut améliorer indirectement l’efficacité de l’exploration.
L’enjeu consiste donc moins à inciter Googlebot à explorer davantage qu’à faciliter ses passages et à limiter les ressources consacrées aux contenus qui n’ont pas changé.
