Retour au blog

SEO vs GEO : arrêtez de penser mots-clés. Nous avons mesuré les requêtes que l'IA génère

Les moteurs IA écrivent leurs propres requêtes de recherche, et des outils vous les revendent comme mots-clés. Nous avons mesuré 224 appels à Gemini : deux exécutions du même prompt partagent 3 à 9 % de leurs requêtes, et sur une intention locale le moteur ne fait que vérifier une liste qu'il connaissait déjà.

La réponse courte

Le mot-clé n'a pas disparu. Il a changé de main. Ce n'est plus l'utilisateur qui le tape, c'est le moteur qui l'écrit, parfois par dizaines, avant de rédiger sa réponse. Google appelle ce mécanisme le query fan-out. Plusieurs plateformes proposent aujourd'hui d'extraire ces requêtes machine et de vous les revendre comme une nouvelle liste de mots-clés à travailler.

Nous avons testé si cette liste veut dire quelque chose. 224 appels à l'API Gemini, 3 intentions commerciales, 8 paraphrases équivalentes de chacune, 2 modèles, et 4 hypothèses dont les critères de réfutation étaient fixés avant la collecte. Deux hypothèses sur quatre sont tombées. Nous les publions comme telles, c'est ce qui rend le reste opposable.

Trois résultats, tous mesurés :

  • Deux exécutions du même prompt, mot pour mot identique, ne partagent que 3 à 9 % de leurs requêtes machine. Sur un modèle, 62 appels ont produit 237 requêtes distinctes.
  • Sur le modèle que vous utilisez aujourd'hui, un appel sur deux n'émet aucune requête. La réponse sort des poids du modèle. Sur l'une de nos trois intentions, aucune recherche n'a eu lieu, sur 24 appels.
  • Sur une intention locale, 94 % des requêtes nomment un établissement précis. Et quand on coupe l'outil de recherche, le modèle nomme déjà ces mêmes établissements.

Donc une liste de mots-clés extraite d'un moteur IA décrit une exécution et les croyances préalables du modèle. Pas l'intention de votre client. Le papier complet, les données brutes et le code sont en bas de cet article.


Une intention, deux formulations, aucun mot commun

Le 1er octobre 2026, deux recherches lancées à quelques secondes d'intervalle :

Requête tapée Géographie résolue par le moteur Réponse mise en avant
meilleure pizza Paris Paris, FR Peppe Pizzeria, classement 50 Top Pizza
Pizzeria numéro 1 dans la capitale de la France France Peppe Pizzeria, Giuseppe Cutraro, 50 Top Pizza

Zéro mot commun hors le radical « pizz- ». Deux résolutions géographiques différentes. La même adresse en tête.

Un moteur à appariement de chaînes, celui de 2010, aurait traité ces deux lignes comme deux marchés distincts, avec deux volumes de recherche, deux difficultés, deux pages à écrire. Un moteur qui encode la requête et l'index dans le même espace vectoriel les traite comme deux points voisins. L'unité de travail n'est plus la chaîne de caractères, c'est l'intention.

C'est là que le raisonnement par mots-clés commence à coûter cher, et il y a un chiffre pour le mesurer. Semrush a confronté les prompts observés dans son panel de clickstream, plus d'un milliard de lignes sur 200 millions d'utilisateurs américains, à sa propre base de 27 milliards de mots-clés : sur l'essentiel de la période octobre 2024 à février 2026, 65 à 85 % des prompts ne correspondent à aucun mot-clé existant (Semrush). Pas de volume, pas de CPC, pas de difficulté. Rien à acheter.

Au passage, la même étude corrige un chiffre qui circule beaucoup. Le « les prompts IA font 23 mots contre 4 sur Google » (et sa variante « 60 contre 3,4 ») compte tous les prompts, dont le code, la traduction, la rédaction et le brainstorming, qui ne déclenchent jamais de recherche web. Quand on sépare les deux populations, la lecture s'inverse :

Population de prompts Janvier-février 2025 Janvier-février 2026
Prompts qui déclenchent une recherche 4,7 mots 8,7 mots
Prompts qui n'en déclenchent pas 24,9 mots 13,5 mots

La moyenne haute vient des prompts qui ne cherchent rien, et elle baisse. Ceux qui comptent pour la visibilité IA font 8,7 mots, et ils rallongent. Construire une stratégie sur « les prompts sont longs, pensez conversation » revient donc à répéter une erreur de lecture.


Ce que fait vraiment le moteur : le query fan-out

Définition du query fan-out : mécanisme par lequel un moteur génératif décompose la question de l'utilisateur en sous-sujets et émet lui-même plusieurs requêtes de recherche simultanées, dont les résultats alimentent ensuite sa réponse.

Ce ne sont pas nos mots, ce sont ceux de Google, qui décrit AI Mode comme « breaking down your question into subtopics and issuing a multitude of queries », et Deep Search comme capable d'émettre « hundreds of searches » (Google).

Côté ChatGPT, Nectiv a extrait ces requêtes machine sur plus de 8 500 prompts commerciaux dans neuf verticales : 31 % des prompts déclenchent une recherche, 2,17 recherches par prompt qui cherche, 5,48 mots par requête, et le local cherche le plus (59 %) (Nectiv). Un an plus tard, sur environ 4 000 prompts rejoués : 7,61 requêtes par prompt, maximum 29, et 64 % des requêtes utilisent un opérateur site: (Nectiv).

Retenez ce dernier chiffre, nous y revenons : une requête site: interroge un domaine déjà choisi. Le moteur ne cherche pas qui pourrait répondre, il vérifie quelqu'un qu'il a déjà en tête.

Le mot-clé est donc passé d'un input que vous choisissiez à un output du moteur que vous ne voyez jamais, et qui n'apparaît dans aucune Search Console. D'où l'offre qui se construit autour : des plateformes qui promettent de « transformer une requête IA en mots-clés ». La promesse suppose deux choses. Que ces requêtes soient stables pour une intention donnée, et qu'elles existent. Nous avons vérifié les deux.


Notre test : 3 intentions, 8 paraphrases, 224 appels

Pourquoi Gemini. C'est, à notre connaissance, le seul moteur grand public dont une API officielle renvoie ses propres requêtes de recherche : generateContent avec l'outil google_search expose groundingMetadata.webSearchQueries, la liste exacte des requêtes émises, et groundingChunks[], les sources retenues (documentation Gemini). Les requêtes de ChatGPT sont visibles dans le JSON de son interface web, mais aucune API officielle ne les expose. Tous les chiffres ci-dessous sont donc mesurés sur Gemini, et nous ne les généralisons pas aux autres moteurs.

Le matériel. Trois intentions commerciales en français, choisies pour couvrir trois surfaces de recherche différentes : un CRM pour une PME (B2B SaaS), la meilleure pizzeria napolitaine de Paris ouverte le dimanche soir (B2C local), un vélo électrique pour 15 km de trajet quotidien à environ 2 000 € (B2C achat réfléchi).

Chaque intention a huit paraphrases de 21 à 25 mots (moyenne 21,4) qui conservent toutes les contraintes : question directe, synonymes lexicaux, ordre des contraintes inversé, registre familier, forme impérative, contexte narratif d'abord, contrainte exprimée en négatif, et paraphrase du terme de tête lui-même. Cette dernière est reportée à part : c'est le test le plus dur, et un sceptique pourrait contester qu'il s'agisse d'une vraie paraphrase.

Le groupe de contrôle, qui est tout l'enjeu. Chaque prompt est rejoué 3 fois (5 fois dans un second run de puissance). Comparer deux paraphrases ne veut rien dire si l'on ne sait pas de combien deux exécutions du même prompt diffèrent déjà. Sans cette référence, on publie du bruit d'échantillonnage en le présentant comme un effet. C'est la même exigence que celle qui nous a fait démonter une étude de cas AEO populaire : un chiffre sans point de comparaison ne dit rien.

Les hypothèses, avec leur critère de réfutation, fixées avant la collecte :

# Hypothèse Réfutée si Verdict
H1 Des paraphrases équivalentes produisent des jeux de requêtes différents Jaccard inter-paraphrases > 0,80 tient (0,011)
H1-bis Cette divergence excède le bruit de non-déterminisme du moteur écart avec le contrôle < 0,10 réfutée
H2 La paraphrase déplace les requêtes bien au-delà du bruit, mais pas les sources citées différence de différences < 0,10 réfutée
H3 Une part substantielle des prompts ne déclenche aucune recherche 0 % d'appels sans recherche tient (49 %)

Nous nous étions engagés à ne rien publier d'une hypothèse qui tombe. Deux sont tombées. La suite explique pourquoi elles tombent, et pourquoi la conclusion en sort plus solide.


Résultat 1 : les requêtes machine ne sont pas reproductibles

Nous voulions montrer que deux formulations équivalentes produisent des requêtes différentes. C'est vrai, trivialement : l'indice de Jaccard entre les requêtes de deux paraphrases vaut 0,011, soit à peu près aucun recouvrement.

Sauf que le contrôle raconte autre chose.

Mesuré sur les appels ayant cherché gemini-3.8-flash gemini-2.5-flash
Jaccard des requêtes, même prompt rejoué 0,085 0,030
Jaccard des requêtes, entre paraphrases 0,011 0,010
Écart (seuil de publication : 0,10) 0,074 0,020

Relancez le prompt identique : 91 à 97 % des requêtes changent. Sur gemini-2.5-flash, 62 appels ayant cherché ont produit 237 requêtes distinctes, c'est-à-dire presque une requête neuve par appel. Avec 70 paires de contrôle sur l'intention pizzeria, l'écart tombe à 0,049, intervalle de confiance à 95 % de 0,018 à 0,073. Sur les deux modèles, l'intervalle entier est sous notre seuil de 0,10.

H1-bis est donc réfutée, et c'est un meilleur argument que celui que nous cherchions. Nous voulions dire « reformulez, et les mots-clés changent ». La réalité est plus dure : ne reformulez rien du tout, et les mots-clés changent quand même. Le « mot-clé IA » n'est pas une propriété de la requête, ni de l'intention. C'est un artefact de l'exécution.

Conséquence opérationnelle directe : il n'existe pas de « bonne formulation » dont on pourrait tirer des mots-clés plus justes, et une liste extraite d'un appel n'est pas reproductible par la personne à qui vous la présentez. Si vous achetez un rapport de fan-out, vous achetez un tirage.

À un autre niveau de mesure, la paraphrase fait quand même bouger quelque chose : au niveau des mots plutôt que des chaînes entières, l'écart monte à 0,115 sur l'intention locale. Ce que partagent ces requêtes, ce sont les contraintes du prompt (dimanche soir, horaires, prix, réservation), pas des requêtes communes.


Résultat 2 : dans la moitié des cas, il n'y a aucune requête à extraire

Sur gemini-3.8-flash, 49 % des appels n'ont émis aucune requête de recherche. Ventilation par intention, et elle est parlante :

Intention Appels sans aucune recherche
CRM pour PME (B2B SaaS) 24 sur 24
Vélo électrique (achat réfléchi) environ la moitié
Pizzeria à Paris (local) 0 sur 24

Sur l'intention B2B, le modèle n'a jamais cherché. Il a répondu depuis ses poids, environ 4 000 caractères de recommandations, avec des noms de produits, sans qu'aucune page web ne soit consultée. Il n'y a là aucun mot-clé à extraire, aucune source à influencer sur le moment, et aucune trace à auditer. La visibilité s'y joue entièrement en amont, dans ce que le modèle a mémorisé à l'entraînement.

Le taux dépend du modèle : sur gemini-2.5-flash, seuls 1,6 % des appels se passent de recherche. On ne peut donc pas écrire « la moitié des prompts ne cherchent jamais » comme une loi générale. On peut écrire « sur le modèle que les utilisateurs ont aujourd'hui, un appel sur deux ». Et ce point précis converge avec ce que Nectiv observe sur ChatGPT, où 31 % des prompts commerciaux déclenchent une recherche, et où le local est la verticale qui cherche le plus.

C'est la première faille conceptuelle des offres de fan-out : elles mesurent le chemin de récupération, et sur une partie substantielle des prompts, ce chemin n'existe pas.


Résultat 3 : en local, le fan-out vérifie une short-list, il ne découvre rien

Voici les requêtes réellement émises sur l'intention pizzeria :

peppe pizzeria paris dimanche soir reservation
popine paris dimanche soir reservation
guillaume grasso pizzeria paris dimanche soir
agata pizzeria paris reservation dimanche soir
"da michele" bastille paris pizza prix dimanche

94 % des requêtes de cette intention (66 sur 70) nomment un restaurant précis ou un classement. Hors le nom, les mots qui restent sont les contraintes du prompt. Sur l'intention vélo, 57 % des requêtes nomment une marque ou un modèle.

Ces requêtes ne cherchent pas « où manger une pizza napolitaine à Paris ». Elles vérifient si Peppe est ouvert le dimanche soir. Reste à savoir d'où viennent les noms.

Nous avons rejoué le même prompt sans aucun outil de recherche, avec les résumés de raisonnement du modèle activés. Sans accès au web, le modèle nomme déjà douze établissements : Peppe, Popine, Guillaume Grasso, Dalmata, La Manifattura, Agata, Iovine's, Popolare, Bricktop, Da Michele et d'autres. On rallume la recherche : les cinq établissements interrogés appartiennent tous à cette liste, et sur l'ensemble du run de 72 appels, 9 des 12 établissements interrogés en font partie. Un résumé de raisonnement, pendant un appel avec recherche, dit ceci : « First, I need to consider my top candidates. »

La formule du fan-out sur une intention locale est donc :

requêtes machine = [la short-list que le modèle a déjà en tête] × [les contraintes du prompt]

Et là, l'argument devient structurel plutôt que statistique. Même si les requêtes machine étaient parfaitement stables, les extraire ne vous apprendrait rien sur la demande. Vous liriez la liste de candidats que le modèle avait déjà, filtrée par les contraintes de l'utilisateur. Un classement de n-grammes récurrents dans ces requêtes, « reviews », l'année courante, « comparison », décrit le comportement du modèle. Ce n'est pas un inventaire d'intentions.

Les 64 % de requêtes site: mesurées chez ChatGPT disent exactement la même chose, par un autre chemin : interroger un domaine nommé suppose de l'avoir déjà choisi.

Ce qui déplace la question de travail. Elle n'est plus « quels mots-clés viser », elle est « comment entrer dans la short-list », c'est-à-dire exister dans ce que le modèle a mémorisé et dans les sources qu'il consulte pour se vérifier.


Ce que nous voulions démontrer, et qui est faux

Notre hypothèse de départ était élégante : les requêtes divergent, mais les sources citées convergent, donc l'intention est l'objet stable et le chemin lexical n'est qu'un bruit. Elle est fausse, et la façon dont elle est tombée vaut la peine d'être racontée.

Le test naïf semblait la confirmer. Les domaines cités se recoupent effectivement bien plus que les requêtes : environ 0,23 à 0,34 contre 0,01. Mais ce test ne discrimine rien. Nous l'avons passé sur des données simulées où toutes les paraphrases tirent leurs requêtes au hasard dans un même réservoir, donc sans aucun effet à détecter : les domaines sortent à 0,47 contre 0,05 pour les requêtes, et le test déclare « confirmé ». La raison est mécanique : il y a beaucoup moins de domaines possibles que de chaînes de requête possibles, donc les domaines se recoupent davantage même sous bruit pur.

Nous avons donc remplacé le test, avant de lancer l'étude, par une différence de différences : l'effet de la paraphrase sur les requêtes, moins son effet sur les domaines, chacun mesuré par rapport au bruit du même prompt rejoué. Verdict : −0,018 sur un modèle, −0,068 sur le run de puissance, 0,010 sur l'autre modèle. La paraphrase déplace les sources au moins autant que les requêtes. H2 est réfutée.

Pire pour l'hypothèse élégante : sur l'intention locale, la paraphrase déplace la short-list elle-même. Le recouvrement des restaurants nommés par appel passe de 0,555 entre deux exécutions du même prompt à 0,395 entre paraphrases. Les sources suivent. Ce n'est pas « réponse stable, chemin instable », c'est l'inverse : les chaînes de requêtes sont du bruit, et là où la formulation agit, elle agit sur la réponse.

Nous n'écrirons donc jamais « les sources convergent alors que les requêtes divergent ». Nos propres données le réfutent. Et cette nuance a une conséquence commerciale qui n'est pas confortable : sur une intention locale, la façon dont votre client formule sa question change la liste où vous devez figurer.


Ce qui reste vrai du SEO

Rien de ce qui précède ne dit que le SEO est inutile. Le GEO (Generative Engine Optimization) n'est pas un remplacement, c'est une extension, et deux planchers restent entièrement techniques.

Le plancher de récupération. Sans crawl, pas de citation. Quand le moteur vérifie sa short-list, il lit des pages, et il faut que les vôtres soient accessibles et lisibles par les robots des moteurs IA, qui n'ont pas les mêmes capacités que Googlebot (comparatif des crawlers).

Le plancher d'extraction. Les requêtes que nous avons observées sont des vérifications de contraintes : horaires, prix, disponibilité, réservation, compatibilité. Si la réponse à une contrainte est dans une image, derrière un onglet JavaScript ou noyée dans un paragraphe, le moteur ne la trouve pas et le candidat sort de la liste.

Ce qui change, c'est l'objet du travail. Pas une liste de chaînes à viser, mais une présence à construire et une absence à mesurer.


Plan d'action

  1. Arrêtez d'acheter des listes de mots-clés IA. Si un rapport vous présente les requêtes de fan-out comme des mots-clés à viser, demandez le contrôle : la même mesure rejouée deux fois sur le même prompt. Sans ce chiffre, le rapport décrit un tirage.
  2. Travaillez par intentions, pas par chaînes. Une intention est un jeu de contraintes (qui, où, quand, combien, à la place de quoi). Listez les contraintes de vos clients, pas les formulations.
  3. Échantillonnez au lieu de mesurer une fois. Puisque deux exécutions du même prompt divergent, une mesure ponctuelle de votre visibilité n'est pas fiable : la visibilité GEO est une distribution, pas un score.
  4. Mesurez par modèle, pas en moyenne. Nos deux modèles ne se comportent pas pareil : 49 % d'appels sans recherche contre 1,6 %. Un chiffre de visibilité agrégé sur plusieurs moteurs cache l'essentiel.
  5. Traitez l'entrée dans la short-list comme l'objectif. Donc : mentions sur des sources tierces que le moteur consulte, nommage de produit cohérent partout, présence dans les classements et comparatifs de votre catégorie.
  6. Rendez chaque contrainte vérifiable en une ligne. Horaires, prix, périmètre, compatibilité, délais, en texte, dans une page crawlable. C'est ce que le moteur vient contrôler.
  7. Surveillez les intentions qui ne cherchent pas. Sur vos sujets B2B, testez si le moteur consulte le web. Si non, votre levier est la mémoire du modèle, qui se construit sur des mois.

Traaker mesure cette présence par moteur, par intention et dans le temps, avec les sources réellement citées. Voir comment la plateforme fonctionne.


Questions fréquentes

Qu'est-ce que le query fan-out ? C'est le mécanisme par lequel un moteur génératif décompose la question de l'utilisateur en sous-sujets et émet lui-même plusieurs requêtes de recherche avant de répondre. Google le décrit pour AI Mode, et Nectiv en mesure 7,61 par prompt en moyenne sur ChatGPT, avec un maximum de 29.

Peut-on extraire les mots-clés qu'une IA utilise et les travailler comme en SEO ? Non, pour trois raisons mesurées. Ces requêtes ne sont pas reproductibles : deux exécutions du même prompt n'en partagent que 3 à 9 %. Une part substantielle des prompts n'émet aucune requête (49 % sur le modèle que nous avons testé). Et sur une intention locale, 94 % des requêtes nomment un candidat que le modèle avait déjà en tête, donc elles décrivent ses croyances plutôt que la demande.

Les mots-clés sont-ils morts pour autant ? Le mot-clé comme unité de ciblage achetable est mort : 65 à 85 % des prompts ne correspondent à aucun mot-clé de la base de 27 milliards de Semrush. Le vocabulaire, lui, reste utile pour une autre raison : le moteur vérifie des contraintes, et ces contraintes doivent être écrites en clair sur vos pages.

Pourquoi « meilleure pizza Paris » et « Pizzeria numéro 1 dans la capitale de la France » donnent-ils la même réponse ? Parce que l'appariement ne se fait plus entre chaînes de caractères mais entre vecteurs. Le moteur encode la requête et les contenus indexés dans le même espace sémantique et compare des positions, pas des mots. Deux formulations d'une même intention tombent donc dans la même zone. Attention toutefois : cela ne rend pas les formulations parfaitement interchangeables. Nos données montrent que sur une intention locale, paraphraser déplace la liste de candidats retenus (recouvrement 0,555 contre 0,395).

Faut-il encore faire du SEO technique pour être cité par les IA ? Oui. Sans crawl il n'y a pas de récupération, et donc pas de citation. Les requêtes que nous avons observées sont des vérifications de contraintes précises : si la réponse n'est pas lisible par un robot, le candidat sort de la liste. Le SEO technique est devenu un plancher, plus un levier de différenciation.

Ces résultats valent-ils pour ChatGPT et Perplexity ? Ils sont mesurés sur Gemini, le seul moteur dont une API officielle publie ses propres requêtes. Deux points seulement convergent avec les données publiées sur ChatGPT : l'absence fréquente de recherche, et le fait que le local soit la verticale qui cherche le plus. Les données ChatGPT existantes ne mesurent ni la reproductibilité ni l'effet de la paraphrase, donc nous ne transposons pas le reste.

Qu'est-ce qu'il faut suivre à la place d'un classement de mots-clés ? La présence : sur quelle part d'un échantillon d'intentions êtes-vous cité, par quel moteur, avec quelles sources, et où êtes-vous absent. C'est une distribution à échantillonner dans le temps, pas une position à relever.


Le papier, les données et le code

Pour rejouer l'étude il faut une clé API Gemini, Node, et environ quatre minutes par run de 72 appels. Les verdicts peuvent différer des nôtres : le comportement des moteurs change dans le temps, et c'est précisément pour cela que nous publions les fichiers.


Note de méthode et limites. Démonstration de mécanisme reproductible, pas estimation de population : 3 intentions, 24 prompts en français, 224 appels, 2 modèles, une seule géographie et un seul instantané temporel (1er octobre 2026). Un seul moteur, Gemini, parce que c'est le seul dont une API officielle publie ses requêtes ; aucune transposition mécanique à ChatGPT ou Perplexity. webSearchQueries est une déclaration du moteur sur lui-même, pas une capture réseau, et l'API avec l'outil google_search n'est pas l'application Gemini grand public. Les résumés de raisonnement sont écrits par le modèle, et l'API ne les horodate pas par rapport aux recherches : l'ordre entre sélection des candidats et recherche est donc inféré, pas observé. L'équivalence sémantique des paraphrases est un jugement humain, rendu auditable par un jeu de contraintes imposé et une grille de transformations nommées, pas prouvée. Le lexique d'entités qui classe les requêtes a été construit à la main depuis les données brutes. L'intention CRM ne fournit aucune donnée pour H1 et H2 sur le modèle principal puisqu'elle n'a jamais cherché, et l'intention vélo a peu de paires de contrôle. Les intervalles sont des intervalles de confiance à 95 % obtenus par bootstrap sur les variantes. Mesure descriptive, aucune causalité revendiquée.

X LinkedIn

Mettez ces stratégies en pratique

Lancez votre audit GEO gratuit et découvrez votre visibilité dans les réponses IA.