Derniers événements

Plus de vidéos
Fil d'actualités / Pourquoi les IA de recherche génèrent-elles toujours les mêmes résultats ? La solution de Google !

Publié le 18/09/2026 à 08:02:58 par Abondance

Pourquoi les IA de recherche génèrent-elles toujours les mêmes résultats ? La solution de Google !

Ce qu'il faut retenir :

  • Les modèles de langage classiques, utilisés pour décomposer une requête large en sous-requêtes, tombent souvent dans le piège de la reformulation : ils produisent des variantes proches du même terme au lieu de couvrir des angles différents.
  • Retrieve-for-Train sépare l'apprentissage de l'exécution : un entraînement par renforcement, mené une seule fois hors ligne, sert à produire les données qui entraînent ensuite un modèle de diffusion léger, rapide à l'usage.
  • Le modèle final ne compte que 53,9 millions de paramètres et affiche un gain de vitesse compris entre 12 et 20 fois par rapport aux approches autorégressives classiques.
  • Un système de récompense à trois critères (ancrage dans la base de données, diversité, fidélité à la requête initiale) empêche le modèle de tricher en générant des résultats absurdes ou redondants.

Des résultats de recherche qui se ressemblent tous

Quand un utilisateur tape une requête large comme « matériel de camping », il n'attend pas dix variantes du même modèle de tente. Au contraire, il attend un ensemble cohérent et complémentaire : une tente, un sac de couchage, un réchaud portable, une lampe frontale. Pour produire ce type de résultat, les systèmes de recherche utilisent une technique appelée query fan-out, qui consiste à décomposer une requête générale en plusieurs sous-requêtes censées couvrir les différents besoins de l'utilisateur.

Le souci, c'est que confier cette décomposition à un modèle de langage classique pose deux problèmes de fond.

Le premier est ce que les chercheurs appellent le collapse paraphrastique. Sans optimisation spécifique à la base de données ciblée, un modèle de langage a tendance à générer des requêtes redondantes, presque synonymes les unes des autres. Pour une requête comme « style festival bohème », un modèle standard peut se contenter de produire « mode festival bohème » et « vêtements festival bohème », deux formulations qui reviennent au même. Un expert du secteur, lui, explorerait des directions distinctes : veste à franges, robe en crochet, bottes en daim.

Le second problème est la latence liée au fonctionnement autorégressif des modèles de langage. Pour décomposer correctement une requête complexe, ces modèles doivent générer des centaines de jetons de raisonnement intermédiaire avant de produire les termes de recherche eux-mêmes. Ce fonctionnement séquentiel, acceptable pour une conversation, devient un frein sérieux dès qu'il faut produire un grand nombre de sous-requêtes simultanément. Même avec des optimisations serveur avancées, cette architecture token par token crée un plancher de latence incompatible avec les temps de réponse attendus d'une barre de recherche en production.

Le principe de Retrieve-for-Train : entraîner une fois, exécuter instantanément

L'idée centrale du framework consiste à traiter l'entraînement comme une session de préparation hors ligne plutôt que comme un examen à passer en direct pendant que l'utilisateur attend. Au lieu de faire réfléchir le modèle à chaque requête, Retrieve-for-Train lance un programme d'apprentissage par renforcement une seule fois, en amont.

Ce programme s'appuie sur un système de récompense rigoureux qui transforme des objectifs abstraits, comme « des résultats divers et disponibles en stock », en instructions précises et reproductibles. Une fois ce travail effectué, le modèle final peut exécuter ces instructions instantanément lors d'une recherche réelle.

Le pipeline se décompose en trois étapes :

  1. Entraînement du modèle de fan-out : un modèle de langage est entraîné par renforcement pour produire des sous-requêtes alignées avec les propriétés recherchées, évaluées par une récompense qui juge l'ensemble des résultats plutôt que chaque résultat pris isolément.
  2. Synthèse des données de supervision : une fois figé, ce modèle de fan-out génère automatiquement des paires requête / ensemble cible, entièrement hors ligne et sans intervention humaine.
  3. Entraînement du modèle de diffusion : un modèle compact de 53,9 millions de paramètres apprend à faire correspondre directement l'embedding d'une requête à un ensemble complet d'embeddings cibles, en un seul passage non séquentiel....