Derniers Articles
Goossips SEO : Robots.txt [Evénement] Un apéro Web à Nantes le 30 juillet, pour networker avant les vacances IA agentique : pourquoi vos données personnelles vous échappent un peu plus chaque jour Bruxelles sanctionne Google à hauteur de 890 millions d’euros pour non-respect du DMA Google face à la fronde des grands médias : plusieurs éditeurs envisagent le blocage Crawl Budget : Google met à jour sa documentation Google contre SerpApi : le tribunal rejette la plainte, mais l’affaire n’est pas terminée Google lance officiellement les AI Overviews en France ! Google Ads : règles d’éligibilité à l’IA Search et lancement des Qualified Future Conversions Goossips SEO : First Link PriorityLire l'article complet : Goossips SEO : Robots.txt
Publié le 28/07/2026 à 06:22:59 par Abondance
Goossips SEO : Robots.txt
Robots.txt : pourquoi Google peut ignorer vos règles de blocage
Un utilisateur Reddit gérait un client Shopify dont la barre de recherche interne se faisait exploiter par du spam : des requêtes de spammeurs généraient des URLs de résultats de recherche pointant vers des sites tiers. Le client avait bloqué /search via disallow dans le robots.txt, mais Google continuait d'indexer ces pages malgré tout.
John Mueller a examiné le fichier robots.txt du site en question et identifié la cause : le fichier contenait à la fois une section user-agent: Googlebot et une section user-agent: * (pour tous les robots), avec des règles différentes dans chacune.
Le point clé qu’il met en exergue : avec le robots.txt, la règle la plus spécifique l'emporte toujours. Si un fichier contient une section dédiée à Googlebot, ce dernier n'appliquera que les règles de cette section précise, il ignorera complètement celles définies sous user-agent: *, même si elles semblaient censées s'appliquer à tous les robots, Googlebot inclus.
John Mueller propose une solution pratique : si on veut appliquer les mêmes règles à plusieurs user-agents, il faut soit dupliquer les règles dans chaque section, soit lister tous les user-agents concernés ensemble au-dessus d'un même bloc de règles partagées.
Source : Search Engine Journal
Taux de fiabilité : 

On est d'accord !
Comme rappelé dans l’article de Search Engine Journal, le fichier robots.txt ne contrôle pas le crawl, mais l’indexation, d’où l’intérêt d’utiliser plutôt une directive noindex.
L’article "Goossips SEO : Robots.txt" a été publié sur le site Abondance.