SEO et IA : l’ordre sujet-objet change les réponses
Google montre que les modèles connaissent les faits mais échouent à les rappeler quand l’ordre des entités s’inverse. Conséquences concrètes pour le SEO.
Les moteurs génératifs n’oublient pas forcément les faits. Ils peuvent simplement être incapables de les ressortir au moment où l’utilisateur pose sa question. Cette nuance change beaucoup de choses pour le SEO.
Une étude publiée par Google Research et remise en lumière ce 17 août analyse 2 150 faits issus de Wikipédia, testés sur 13 modèles avec environ 4,5 millions de réponses. Le constat est net : les modèles avancés encodent 95 à 98 % des faits, mais échouent à en rappeler directement 26 à 34 %. Même avec un mode de raisonnement, 11 à 12 % restent inaccessibles.
Le savoir est dans la machine. La clé pour y accéder ne fonctionne pas toujours.
L’ordre des entités n’est pas neutre
L’étude s’intéresse notamment à la relation entre un sujet et un objet. Prenons la phrase : « Oasis a donné son premier concert au Boardwalk Club ». Oasis est le sujet. Le Boardwalk Club est l’objet.
Demander « Où Oasis a-t-il donné son premier concert ? » suit l’ordre appris. Demander « Quel groupe a donné son premier concert au Boardwalk Club ? » inverse la relation. Le fait reste identique, mais la seconde question est plus difficile pour le modèle.
Ce phénomène porte un nom : la reversal curse, ou malédiction de l’inversion. Le point intéressant est que le modèle reconnaît souvent la bonne réponse lorsqu’on lui propose plusieurs choix. Il possède donc bien l’information. Il peine seulement à la produire dans le sens inverse.
Google a aussi testé différentes formulations. Reformuler une question change peu le résultat. En revanche, inverser l’ordre sujet-objet dégrade réellement le rappel. Autrement dit, multiplier les synonymes dans une page n’est pas la réponse. Il faut travailler les relations entre les entités.
Pourquoi les faits de longue traîne sont plus fragiles
Les faits rares souffrent davantage. Leur taux d’encodage reste proche de celui des faits populaires, mais leur rappel est moins fiable. C’est une information importante pour les entreprises très spécialisées, les consultants, les fabricants spécialisés ou les acteurs locaux.
Votre modèle de pompe industrielle, votre certification précise ou votre zone d’intervention peuvent avoir été lus. Cela ne signifie pas qu’un moteur génératif saura les citer quand la question part d’un besoin plutôt que de votre marque.
Par exemple, une page répète souvent : « Société X installe des pompes cryogéniques ». L’utilisateur, lui, demande : « Qui installe des pompes cryogéniques en Île-de-France ? » La relation est inversée. Si le contenu ne présente jamais clairement cette information dans les deux directions, la marque devient plus difficile à rappeler.
Faut-il écrire chaque phrase deux fois ?
Non. Ce serait illisible, et l’étude ne prouve pas qu’une duplication mécanique améliore les citations dans AI Mode, ChatGPT ou Gemini. Elle porte sur la mémoire paramétrique des modèles, pas sur le classement d’une page web. Confondre les deux serait malhonnête.
Mais elle fournit une piste éditoriale sérieuse : rendre les relations importantes explicites sous plusieurs angles utiles.
Une page produit peut répondre à « Que fait ce produit ? », mais aussi à « Quel produit répond à ce besoin ? ». Une page locale doit relier l’entreprise à la ville, puis la ville au service. Une fiche expert doit expliquer ses compétences, mais aussi identifier clairement quel expert possède la compétence recherchée.
Cela passe par des titres précis, des tableaux comparatifs, des FAQ utiles et des phrases qui nomment les entités sans ambiguïté. Pas par une pluie de mots-clés.
Un test SEO simple à intégrer aux audits
Je recommande de sélectionner les 20 relations factuelles les plus rentables du site : marque-service, produit-usage, expert-compétence, établissement-ville, logiciel-intégration. Pour chacune, rédigez une question directe et une question inversée.
Testez ensuite ces 40 questions dans les moteurs génératifs suivis par votre audience. Notez trois résultats : réponse correcte, citation de votre site, mention d’un concurrent. Répétez le test chaque mois avec les mêmes formulations et un compte vierge lorsque c’est possible.
Le but n’est pas de fabriquer un nouveau score décoratif. Il s’agit d’identifier les faits que votre contenu expose clairement dans un sens, mais que les systèmes ne retrouvent pas dans l’autre.
Le raisonnement avancé récupère 40 à 65 % des faits encodés mais initialement introuvables, selon l’étude. Or tous les moteurs ne déclenchent pas ce calcul coûteux pour chaque requête. Un contenu compréhensible sans effort reste donc un avantage.
Mon avis : le GEO ne se résume ni au balisage Schema.org ni aux mentions de marque. La prochaine bataille se joue sur la direction des relations sémantiques. Si votre entreprise peut être comprise uniquement quand on commence la phrase par son nom, votre visibilité dans les réponses IA repose sur une clé trop fragile.
Sources : Google Research et étude arXiv.