La réponse courte
Les quatre moteurs IA majeurs n'ont pas la même architecture de crawl, et cela change directement ce qui est visible sur votre site. OpenAI fait tourner quatre robots distincts (dont GPTBot pour l'entraînement et OAI-SearchBot pour la recherche) et construit peu à peu son propre index tout en s'appuyant encore sur Bing ([1]). Anthropic prend l'approche la plus légère : Claude délègue entièrement la récupération à l'API de Brave Search ([2]). Perplexity a construit l'infrastructure la plus indépendante, un index de plus de 200 milliards d'URL ([3]), mais fait aussi l'objet des soupçons les plus sérieux de contournement du robots.txt ([4]). Google n'a pas de robot IA séparé : Googlebot fait tout, avec un jeton dédié, Google-Extended, pour contrôler l'usage en entraînement ([5]). Et le point technique le plus lourd de conséquences : seul Googlebot exécute le JavaScript. GPTBot, ClaudeBot et PerplexityBot ne le font pas ([6]).
OpenAI : quatre robots, et un index maison encore en construction
OpenAI est l'écosystème le plus complexe, avec quatre robots séparés et contrôlables indépendamment via robots.txt ([7]) :
| Robot | Rôle |
|---|---|
| GPTBot | Collecte de données d'entraînement pour les modèles génératifs |
| OAI-SearchBot | Indexation pour les résultats de ChatGPT Search |
| ChatGPT-User | Récupération en temps réel quand un utilisateur demande une page précise |
| OAI-AdsBot | Actions produit annexes |
Fait notable : depuis le lancement de GPT-5 en août 2025, OAI-SearchBot génère environ 3,5 fois plus d'événements de log que GPTBot ([8]), signe que la recherche pèse désormais plus lourd que la collecte d'entraînement dans l'activité de crawl d'OpenAI. GPTBot avait généré environ 569 millions de requêtes sur le réseau de Vercel en décembre 2024 ([9]).
ChatGPT Search reste une architecture hybride : les requêtes des espaces Enterprise et Edu passent encore par Bing ([10]), mais OpenAI construit son propre index en parallèle, avec des verticales séparées pour l'actualité, le shopping, les PDF et les articles académiques repérées par Peec AI dans des noms d'expérimentation comme prefer-index-over-serp-v3 ([1]). Le pipeline de récupération fonctionnerait sur trois couches : un index de découverte, un cache de lecture qui conserve des copies de pages déjà récupérées, et un petit nombre de pages ouvertes en direct au moment de la requête ([11]).
Anthropic : l'approche la plus légère, la plus dépendante de Brave
Anthropic fait tourner trois robots : ClaudeBot pour l'entraînement, Claude-User pour la récupération en temps réel, et Claude-SearchBot pour l'optimisation de l'index de recherche, chacun contrôlable séparément via robots.txt ([12]).
La particularité de Claude, c'est qu'il n'a pas d'index de recherche propre. Quand la recherche web est activée, Claude s'appuie entièrement sur l'API de Brave Search, confirmé en mars 2025 quand Anthropic a ajouté « Brave Search » à sa liste de sous-traitants ([2]). L'outil de récupération de page de Claude va ensuite chercher le contenu complet à la demande, avec un prétraitement HTML qui retire scripts et styles ([13]).
C'est aussi le moteur qui a la meilleure précision de citation grâce à son API Citations, qui découpe les documents sources en phrases avant de les transmettre au modèle, permettant une attribution au niveau de la phrase exacte ([14]). Anthropic indique que cette fonctionnalité améliore le rappel de citation jusqu'à 15 % par rapport à une citation implémentée à la main dans le prompt ([14]).
ClaudeBot a aussi connu son incident de notoriété : en juillet 2024, iFixit a signalé environ un million de requêtes en 24 heures, un rythme de crawl suffisant pour déclencher des alertes internes ([15]).
Perplexity : l'infrastructure la plus indépendante, la plus contestée
Perplexity a investi le plus massivement dans une infrastructure de recherche propriétaire : un index de plus de 200 milliards d'URL uniques, qualifié d'« index à l'échelle de l'exaoctet », soutenu par des dizaines de milliers de CPU et des centaines de téraoctets de RAM ([3]). L'entreprise traite environ 200 millions de requêtes par jour ([3]) et affichait environ 30 millions de réponses citées par jour dès mai 2025 ([16]).
Deux robots sont déclarés : PerplexityBot pour l'indexation et Perplexity-User pour les récupérations initiées par un utilisateur ([17]). Le problème, c'est ce qui n'est pas déclaré. Cloudflare a documenté un comportement de « crawl furtif » : des user-agents modifiés en cours de crawl et un basculement vers des plages IP non annoncées, ce qui a conduit Cloudflare à retirer Perplexity de sa liste de robots vérifiés ([4]). Plusieurs éditeurs ont porté l'affaire devant la justice, dont le New York Times, Reddit, Dow Jones et la BBC ([18]).
Google : un seul robot pour tout, un jeton pour l'entraînement IA
Google fait le choix inverse des trois autres : pas de robot IA séparé. Googlebot récupère tout, et Google contrôle l'usage en entraînement via un jeton robots.txt dédié, Google-Extended, introduit en septembre 2023 ([5]). Bloquer Google-Extended empêche l'usage des pages pour l'entraînement de modèles, mais n'affecte pas l'indexation dans la recherche classique.
Un fetcher plus récent, Google-Agent, gère les requêtes en temps réel déclenchées par un utilisateur dans les produits Gemini, et se comporte davantage comme un navigateur web standard que comme un crawler de recherche ([19]). Gemini s'appuie sur un pipeline de grounding en six étapes qui réécrit la requête, reclasse les résultats et les injecte dans le contexte du modèle avant génération ([20]).
Le fossé JavaScript : le point technique qui décide de votre visibilité
C'est la limitation la plus lourde de conséquences de tout cet écosystème. GPTBot, ClaudeBot et PerplexityBot n'exécutent pas de JavaScript, un constat établi par l'analyse de Vercel sur plus d'un demi-milliard de requêtes de crawlers IA ([6]). ChatGPT-User et ClaudeBot récupèrent parfois des fichiers JavaScript (respectivement 11,5 % et 23,8 % des requêtes) mais ne les exécutent jamais ([6]). Googlebot est la seule exception : il rend le JavaScript via un pipeline basé sur Chrome headless, ce qui en fait le seul robot lié à l'IA capable de voir le contenu d'une application web monopage (SPA, une application où le contenu est construit dans le navigateur plutôt que livré en HTML déjà complet) totalement rendue ([21]).
Concrètement, cela veut dire que :
- Tout contenu injecté côté client, y compris les données structurées JSON-LD ajoutées via Google Tag Manager, est invisible pour GPTBot, ClaudeBot et PerplexityBot ([22]).
- Sur un site en SPA, ces robots ne voient que la coquille HTML initiale : squelette de navigation, balises meta, conteneurs vides ([6]).
- Le contenu chargé en AJAX, en défilement infini, ou tout ce qui dépend du rendu côté client, reste inaccessible ([22]).
- Le contenu payant est également invisible : les robots IA ne s'authentifient pas, ils ne voient que ce que renvoie la réponse HTML non authentifiée ([6]).
Le rendu côté serveur (SSR, la génération du HTML complet sur le serveur avant envoi au navigateur, plutôt que dans le navigateur) ou le HTML statique sont donc indispensables pour la visibilité auprès des moteurs IA ([23]).
Qui bloque quoi : les taux de blocage par robot
Près de 4 sites du top sur 10 bloquent désormais activement au moins un robot IA, selon l'analyse Zyte State of Web Access 2026 portant sur 11 100 pages d'atterrissage parmi les plus consultées ([24]) :
| Robot | Taux de blocage explicite |
|---|---|
| GPTBot | 8,4 % |
| CCBot | 7,3 % |
| ClaudeBot | 6,3 % |
| Google-Extended | 5,6 % |
| Bytespider | 5,5 % |
| PerplexityBot | 4,2 % |
| OAI-SearchBot | 2,9 % |
(Source : [25])
Le classement n'est pas un hasard. OAI-SearchBot est le moins bloqué, probablement parce qu'il renvoie du trafic de référencement vers les éditeurs, alors que GPTBot, purement dédié à l'entraînement sans aucune contrepartie de trafic, est le plus bloqué ([24]). Chez les éditeurs de presse spécifiquement, les taux grimpent bien plus haut : 79 % bloquent les robots d'entraînement IA et 71 % bloquent aussi les robots de récupération ([26]). Cloudflare rapporte que plus de 2,5 millions de sites ont choisi de bloquer entièrement l'entraînement IA via sa fonctionnalité de robots.txt géré ([27]).
Côté volume, les écarts sont massifs. D'après les données réseau de Vercel fin 2024, Googlebot générait 4,5 milliards de requêtes par mois, contre 569 millions pour GPTBot, 370 millions pour ClaudeBot et seulement 24,4 millions pour PerplexityBot ([9]). Début 2026, GPTBot et ClaudeBot représentaient respectivement 12 % et 9,2 % du trafic mondial de robots selon les données de Cloudflare Radar ([28]), et le volume de GPTBot a progressé de 305 % entre mai 2024 et mai 2025 ([29]).
Une comparaison à plat des quatre moteurs
| Capacité | Perplexity | ChatGPT | Claude | Gemini |
|---|---|---|---|---|
| Index de recherche propre | Complet | Modéré | Aucun (Brave) | Complet (Google) |
| Rendu JavaScript | Aucun | Aucun | Aucun | Complet |
| Précision des citations | Modérée | Faible | Élevée | Modérée |
| Recherche agentique / Deep Research | Élevée | Complète | Faible | Complète |
| Conformité au robots.txt | Minimale | Élevée | Élevée | Élevée |
(Synthèse des positionnements qualitatifs relevés dans les études citées ci-dessus, notamment [6] et [4].)
Gemini ressort en tête grâce à l'index de Google et au rendu JavaScript, l'un des deux avantages qu'aucun concurrent ne partage. Claude compense l'absence d'index propre par la meilleure précision de citation, portée par son API Citations au niveau de la phrase. Perplexity égale les autres en échelle d'index mais paie le prix de sa conformité robots.txt la plus faible.
Le problème de fiabilité des citations, partagé par tous
Malgré ces architectures différentes, aucun moteur n'a résolu le problème de la fiabilité des citations. Une étude 2025 du Tow Center for Digital Journalism de Columbia University, menée sur 1 600 requêtes test auprès de huit moteurs de recherche génératifs, a constaté que ces moteurs échouent à récupérer l'information correcte plus de 60 % du temps ([30]). Une étude arXiv distincte de 2025 a trouvé que seulement 26,5 % des références bibliographiques étaient entièrement correctes, contre 39,8 % erronées ou fabriquées ([31]). Et le recouvrement des sources entre moteurs IA citant le même sujet peut descendre jusqu'à 16 % ([32]) : pour une question identique, deux moteurs peuvent s'appuyer sur des preuves quasiment sans point commun.
Sur la même période, le volume de visites générées par la recherche IA a bondi de 15,6 à 27,4 milliards, une hausse de 42,8 % entre le premier trimestre 2025 et le premier trimestre 2026 ([33]). L'audience grossit plus vite que la fiabilité des réponses ne s'améliore.
Chronologie : les dates qui comptent
- Septembre 2023 : Google introduit le jeton Google-Extended dans robots.txt pour séparer entraînement et indexation ([5]).
- Juin 2024 : WIRED et le développeur Robb Knight documentent indépendamment que Perplexity ignore le robots.txt et utilise des user-agents falsifiés.
- Juillet 2024 : iFixit signale environ un million de requêtes ClaudeBot en 24 heures ([15]).
- Mars 2025 : Anthropic confirme officiellement s'appuyer sur l'API Brave Search pour la recherche web de Claude ([2]).
- Été 2025 : Cloudflare documente le crawl furtif de Perplexity et le retire de sa liste de robots vérifiés ([4]).
- Août 2025 : lancement de GPT-5 ; l'activité de crawl d'OpenAI triple dans les semaines suivantes ([8]).
- Octobre à décembre 2025 : Reddit puis le New York Times portent plainte contre Perplexity pour violation de copyright ([18]).
- Mars 2026 : Google déploie Google-Agent, un fetcher distinct de Googlebot pour les usages Gemini en temps réel ([19]).
FAQ
ChatGPT, Claude et Perplexity peuvent-ils exécuter du JavaScript ? Non. GPTBot, ClaudeBot et PerplexityBot ne rendent pas le JavaScript ; ils ne voient que le HTML brut renvoyé par le serveur. Seul Googlebot, via son pipeline de rendu Chrome headless, exécute le JavaScript ([6], [21]).
Pourquoi Claude n'a-t-il pas son propre index de recherche ? Anthropic a choisi de ne pas construire d'infrastructure de recherche propre et délègue entièrement la récupération de résultats à l'API de Brave Search, un choix confirmé publiquement en mars 2025 ([2]).
Le fichier robots.txt bloque-t-il vraiment tous les crawlers IA ? Non de façon uniforme. OpenAI, Anthropic et Google respectent les directives robots.txt par jeton de robot. Perplexity, en revanche, a été documenté en train de contourner ces directives via des user-agents falsifiés et des IP non déclarées ([4]).
Qu'est-ce que Google-Extended, et en quoi diffère-t-il de Googlebot ? Google-Extended est un jeton robots.txt distinct qui contrôle uniquement l'usage des pages pour l'entraînement des modèles IA de Google. Le bloquer n'affecte pas l'indexation dans la recherche classique, qui reste gérée par Googlebot ([5]).
Pourquoi les citations de ces moteurs sont-elles souvent incorrectes ? Les études montrent des taux d'échec de récupération supérieurs à 60 % sur des requêtes tests, avec des liens parfois fabriqués et un recouvrement des sources entre moteurs aussi bas que 16 % pour une même question ([30], [32]).
Perplexity respecte-t-il le robots.txt ? Les preuves documentées par Cloudflare et par des développeurs indépendants indiquent que non, du moins pas systématiquement : user-agents modifiés en cours de crawl, IP non annoncées, ce qui a conduit à son retrait de la liste des robots vérifiés de Cloudflare ([4]).
Quel robot génère le plus de trafic sur un site donné ? Cela varie selon le secteur, mais à l'échelle globale, Googlebot domine largement (4,5 milliards de requêtes mensuelles selon Vercel), suivi de GPTBot puis ClaudeBot, PerplexityBot restant le plus petit volume des quatre principaux robots IA ([9]).
Votre plan d'action
- Servez du HTML rendu côté serveur ou statique pour tout contenu critique. GPTBot, ClaudeBot et PerplexityBot ne verront jamais ce qui n'existe que dans le DOM généré côté client.
- N'injectez jamais vos données structurées JSON-LD via un gestionnaire de balises côté client. Elles doivent être présentes dans le HTML brut renvoyé par le serveur.
- Vérifiez votre robots.txt jeton par jeton, pas seulement
User-agent: *. GPTBot, ClaudeBot, PerplexityBot, Google-Extended, OAI-SearchBot et Claude-SearchBot se contrôlent chacun indépendamment. - Distinguez les robots d'entraînement des robots de recherche dans vos logs serveur. Bloquer un robot d'entraînement (GPTBot, ClaudeBot) n'a pas le même impact sur votre visibilité que bloquer un robot de recherche (OAI-SearchBot, Claude-SearchBot).
- N'attendez pas de contenu payant ou authentifié qu'il soit vu. Aucun robot IA ne s'authentifie ; seul le contenu public en accès libre compte.
- Suivez ce qui est effectivement cité, pas seulement ce qui est crawlé. Un site parfaitement accessible techniquement peut rester absent des réponses si le contenu n'a pas la densité de preuve que ces moteurs recherchent.
Si vous voulez savoir précisément quels moteurs voient réellement votre contenu et lesquels vous citent, découvrez la méthode Traaker pour mesurer et améliorer votre visibilité dans la recherche IA.
Pour aller plus loin
Ces architectures de crawl ne sont que la première étape. Une fois qu'un moteur peut voir votre contenu, encore faut-il qu'il choisisse de le citer, ce qui dépend de facteurs propres à chaque moteur : consultez nos guides sur comment être cité par ChatGPT, comment être cité par Claude et comment être cité par Perplexity.
Méthodologie et limites. Cet article synthétise des données publiques provenant de sources tierces (Vercel, Zyte, Cloudflare Radar, Perplexity Research, Anthropic, OpenAI) collectées à des dates et avec des méthodologies différentes ; les pourcentages et volumes doivent être lus comme des ordres de grandeur plutôt que des mesures strictement comparables entre elles. Le comportement des crawlers IA évolue rapidement et certaines sources se recoupent imparfaitement sur les dates exactes de certains événements (notamment la chronologie de la détection du crawl furtif de Perplexity par Cloudflare). Vérifiez toujours le comportement actuel de votre propre robots.txt et de vos logs serveur avant de prendre une décision de blocage.
Sources
- SearchEngineWatch
- TechCrunch
- Perplexity Research
- Cloudflare
- ipregistry.co
- Adobe Experience League
- developers.openai.com
- Search Engine Journal
- Vercel
- OpenAI Help Center
- Search Engine Land
- anthropic.com/crawl
- Anthropic Docs
- Anthropic
- 404 Media
- The AI Engineer
- Perplexity Docs
- The Verge
- MarkTechPost
- WebSearchAPI
- NuxtSEO
- Search Engine Journal
- NuxtSEO
- Zyte
- Zyte, analyse 2026 sur 11 100 pages
- BuzzStream
- PCMag
- Oncrawl
- SEOptimer
- CJR
- arXiv
- Frase
- Contently