Derniers Articles
Dans la stack de retrieval de ChatGPT : l’index, le cache, et les pages qu’il lit vraiment Se former à l’IA générative en 2026 : quelle formation choisir selon votre profil ? Goossips SEO : Metadonnées Recherches IA vs Google : ce que révèle le rapport Similarweb 2026 Google Search Console ouvre enfin les données de vos posts Instagram, TikTok, X et YouTube Google muscle ses règles sur les avis en ligne et prévient des sanctions manuelles Goossips SEO : Robots.txt [Evénement] Un apéro Web à Nantes le 30 juillet, pour networker avant les vacances IA agentique : pourquoi vos données personnelles vous échappent un peu plus chaque jour Bruxelles sanctionne Google à hauteur de 890 millions d’euros pour non-respect du DMALire l'article complet : Dans la stack de retrieval de ChatGPT : l’index, le cache, et les pages qu’il lit vraiment
Publié le 05/08/2026 à 12:51:43 par Abondance
Dans la stack de retrieval de ChatGPT : l’index, le cache, et les pages qu’il lit vraiment
En juillet 2026, notre équipe chez RESONEO a capturé et disséqué 1 200 réponses ChatGPT, 88 000 résultats de recherche et 26 900 pages distinctes pour répondre à une question : quand ChatGPT cite une page, d'où vient-elle ? Jérôme Salomon (Oncrawl) a guidé toute la partie cache. L'étude complète est publiée sur think.resoneo.com ; cet article en tire ce que les professionnels du search doivent retenir.
La version courte : le grounding de ChatGPT repose sur trois étages de stockage. Un index de discovery qui trouve les pages, un cache de lecture qui conserve la copie intégrale des pages déjà fetchées, et un petit lot de pages ouvertes en live. Chaque étage a ses règles, sa fraîcheur et ses angles morts. Une fois qu'on a ces trois étages en tête, le comportement de citation de ChatGPT cesse d'être mystérieux et redevient ce qu'il est : un système construit pour répondre au moindre coût.
Comment on sait tout ça
Notre extension chrome enregistre le flux de données brut que chatgpt.com envoie au navigateur, y compris des champs que l'interface n'affiche jamais. Jusqu'au 21 juillet 2026, ce flux contenait un champ result_source qui nommait le pipeline interne derrière chaque résultat de recherche. Quatre valeurs revenaient sans cesse : labrador, bright, oxylabs, serp. Aucune n'est documentée par OpenAI, qui ne parle publiquement que de « third-party search providers ».
Puis le champ a disparu du flux. Du jour au lendemain, sur tous les comptes qu'on surveille. Nous ré-identifions désormais chaque pipeline par ses signatures de format (longueur de snippet, forme des title...), avec un classifieur qui tombe juste environ 98 % du temps. La V5 de notre extension l'embarque en natif. Nous avons aussi fait tourner une flotte de comptes sur plusieurs tiers et plusieurs pays, rejoué les mêmes prompts via l'API d'OpenAI, et publié des pages canari sur notre propre domaine avec les logs serveur complets, pour voir exactement ce que les robots d'OpenAI récupèrent au lieu de le deviner.
Le casting des pipelines
Ce qu'on avait établi avant cette campagne, et qui tient toujours :
- labrador est le hub de retrieval maison d'OpenAI. En plus du web search, il renvoie des résultats news, academia (arXiv), Reddit et YouTube : il fonctionne comme un orchestrateur d'index internes, de dépôts ouverts type Wikipedia et de partenariats presse.
- bright et oxylabs, ce sont des résultats Google scrapés, achetés en live.
- P1/P2/P3 servent le shopping, depuis les feeds marchands propres à OpenAI, avec Google conservé en oracle pour les prix et les avis.
- B1/B3, Yelp et Tripadvisor servent le local, avec une subtilité : les liens affichés aux utilisateurs pointent vers Google Maps.
Le shopping et le local ne touchent jamais au web search. Si vous vendez des produits ou tenez un restaurant, votre bataille se joue dans les feeds marchands et les fiches locales, en plus des citations classiques. Cet article se concentre sur le versant web search, parce que c'est là que sont tombées les surprises.
Étage 1 : l'index, et Bing n'y est pour rien
Commençons par le résultat principal : OpenAI a son propre index web, et ce n'est pas Bing qui l'alimente. On l'a vérifié de trois façons. Seules 1,5 % des URLs labrador apparaissent dans le top 20 de Bing sur les mêmes fan-outs. Aucun snippet labrador ne correspond à un snippet Bing. Et Bing coupe les title à 75 caractères, alors que 24 % des title labrador dépassent allègrement cette limite. Le plus long qu'on ait capturé fait 289 caractères.
Cet index alimente la quasi-totalité des citations search en mode instant, le mode rapide servi aux utilisateurs gratuits. L'exception, ce sont les questions dont la réponse nécessite des données quasi en live (« qui a gagné le match hier soir »), où il partage à peu près 50/50 avec des résultats Google scrapés.
Maintenant, que contient concrètement un résultat...