Robots d’IA sur un site WordPress : ce que j’ai mesuré en 60 jours
Par Vasile Boulay, fondateur de Stea Web · publié le
Du 23 juillet au 21 septembre 2026, j’ai relevé dans les journaux du serveur de stea-web.com chaque requête qui se présentait comme un robot d’intelligence artificielle, puis vérifié son adresse IP auprès des listes publiées par les opérateurs ou par un DNS inverse confirmé. Résultat : près d’un quart d’imposteurs, des robots d’entraînement très présents, des robots de recherche qui lisent surtout robots.txt et, en 68 jours, aucune visite humaine venue d’un assistant d’IA. Voici les chiffres, la méthode et leurs limites.
La méthode : journaux du serveur et adresses IP vérifiées
Sauf mention contraire, les chiffres de cet article viennent des journaux du serveur de stea-web.com et couvrent 60 jours : du 23 juillet 2026 à 23 h 43 au 21 septembre 2026 à 23 h 43, heure de Paris. Je ne retiens un passage que si son adresse IP est rattachée à l’opérateur que le robot annonce.
Pourquoi les journaux ? Une page servie depuis le cache de pages n’exécute pas PHP : un compteur intégré à WordPress ne la voit pas, le journal du serveur si. Une extension que j’ai développée lit ces journaux.
Le nom affiché par un robot ne prouve rien : n’importe quel programme peut se présenter comme « GPTBot ». J’ai donc contrôlé chaque adresse avec les listes publiées par OpenAI, Anthropic, Perplexity, Google, Bing et Apple, relevées le 21 septembre 2026. Pour Amazon et Common Crawl, j’ai utilisé un DNS inverse confirmé par une résolution directe. Je n’ai trouvé aucune liste publiée par Meta, ByteDance ou You.com : un passage venu d’adresses rattachées à ces opérateurs est classé « cohérent », ce qui est un indice, pas une preuve.
J’ai écarté 85 requêtes : 17 venues de mon propre serveur et 68 venues de deux connexions résidentielles que j’attribue à mes audits, sans pouvoir le prouver.
Je range les robots en trois familles, d’après la documentation des opérateurs : l’entraînement (collecter des textes pouvant servir à entraîner des modèles), l’index de recherche IA (explorer le web pour qu’un assistant propose des sources) et la lecture à la demande (ouvrir une page parce qu’un utilisateur le demande).
Qui passe vraiment : les robots d’IA par famille
En 60 jours, 4 854 requêtes se sont présentées sur stea-web.com comme des robots d’IA : 2 245 étaient authentiques, 980 seulement cohérentes et 1 155 fausses. Les robots d’entraînement dominent (2 882 requêtes authentiques ou cohérentes), loin devant les index de recherche IA (325) et les lectures à la demande (18).
| Famille et robot | Déclarées | Authentiques ou cohérentes | Fausses |
|---|---|---|---|
| Entraînement | 4 014 | 2 882 | 730 |
| ClaudeBot (Anthropic) | 1 260 | 1 207 | 50 |
| Bytespider (ByteDance) | 936 | 536 * | 37 |
| Amazonbot et Amzn-SearchBot (Amazon) ** | 681 | 187 | 492 |
| GPTBot (OpenAI) | 582 | 524 | 55 |
| Meta-ExternalAgent (Meta) | 441 | 398 * | 41 |
| CCBot (Common Crawl) | 44 | 0 | 37 |
| Index de recherche IA | 621 | 325 | 233 |
| OAI-SearchBot (OpenAI) | 362 | 239 | 68 |
| YouBot (You.com) | 91 | 46 * | 44 |
| PerplexityBot (Perplexity) | 87 | 40 | 45 |
| Claude-SearchBot (Anthropic) | 46 | 0 | 44 |
| DuckAssistBot | 35 | 0 | 32 |
| Lecture à la demande | 219 | 18 | 192 |
| ChatGPT-User (OpenAI) | 74 | 18 | 54 |
| Claude-User (Anthropic) | 57 | 0 | 55 |
| Perplexity-User (Perplexity) | 53 | 0 | 51 |
| MistralAI-User (Mistral AI) | 35 | 0 | 32 |
| Total | 4 854 | 3 225 | 1 155 |
* Cohérentes : aucune liste officielle trouvée, adresse rattachée à l’opérateur. ** Sur la période, mon extension rangeait Amzn-SearchBot sous le nom d’Amazonbot, alors qu’Amazon écrit qu’Amzn-SearchBot ne sert pas à l’entraînement. Les colonnes ne s’additionnent pas : il manque les 85 requêtes écartées comme tests et les 389 requêtes invérifiables, dont 361 pour Bytespider. Les totaux de l’entraînement comprennent aussi GoogleOther (30 authentiques), que Google décrit comme un robot générique, ainsi que cohere-ai et Applebot-Extended (aucune requête authentique). Bytespider, que ByteDance ne documente pas, et CCBot, qui alimente une archive publique, sont rangés ici par défaut. Pour comparer, sur la même période : 1 429 passages authentiques de Googlebot et 1 601 de Bingbot.
GPTBot, OAI-SearchBot et ChatGPT-User : trois robots, trois rôles
Ces trois robots d’OpenAI ont des rôles distincts : GPTBot sert à l’entraînement, OAI-SearchBot à la recherche de ChatGPT, ChatGPT-User à ouvrir une page à la demande d’un utilisateur. Sur stea-web.com, leurs comportements diffèrent nettement.
Selon la documentation d’OpenAI (developers.openai.com/api/docs/bots, consultée le 21 septembre 2026), GPTBot et OAI-SearchBot respectent robots.txt. Un site qui refuse OAI-SearchBot n’est pas montré dans les réponses de recherche de ChatGPT, même s’il peut encore y apparaître comme simple lien de navigation. Pour ChatGPT-User, déclenché par un utilisateur, les règles de robots.txt peuvent ne pas s’appliquer. Les réglages sont indépendants : on peut autoriser OAI-SearchBot et refuser GPTBot.
- GPTBot : 524 requêtes authentiques, toutes à partir du 28 août 2026. Jusque-là, un réglage de Cloudflare, le service placé devant mon serveur, empêchait GPTBot, Meta-ExternalAgent et Amazonbot de lire les pages. Le blocage a été levé le 27 août ; GPTBot a envoyé 187 requêtes le lendemain. Sur les 524, seules 83 visent des pages (27 différentes). Le reste se partage entre 330 feuilles de style, scripts et polices, 45 médias et 66 plans de site.
- OAI-SearchBot : 239 requêtes authentiques, dont 194 lectures de robots.txt et seulement 26 lectures de pages, faites en deux jours : 2 le 24 juillet, 24 le 8 septembre.
- ChatGPT-User : 18 lectures authentiques de 6 pages : l’accueil (6), les études de cas vidéo Cultura Vineuil et CJF Boxe (4 chacune), L’Atelier du Bijou (2), ATR Technology (1) et ma page de présentation (1). Aucune page de service.
Près d’un quart de faux robots d’IA
Sur 60 jours, 1 155 des 4 854 requêtes qui se disaient envoyées à stea-web.com par un robot d’IA étaient fausses, soit 23,8 %. Sur les 30 derniers jours, la part est de 21,6 % (726 sur 3 355).
- Claude-User, Claude-SearchBot, Perplexity-User et MistralAI-User : aucune requête authentique en 60 jours. En dehors des tests écartés et d’une requête invérifiable, tout ce qui portait ces noms était faux.
- Amazonbot : 492 requêtes fausses sur 681, soit 72 %. Ce total mélange deux robots d’Amazon, car mon extension rangeait alors aussi Amzn-SearchBot sous ce nom.
- « Google-Extended » : 262 requêtes ont porté ce nom du 15 juillet au 21 septembre 2026. Or Google écrit que Google-Extended n’a pas d’agent propre : c’est un jeton de robots.txt, pas un robot, et toute requête qui s’en réclame est donc fausse. Mon extension ne les enregistrait pas : elles ne figurent pas dans le tableau.
Tous robots confondus, 840 des 1 367 fausses requêtes de la période venaient d’adresses de Google Cloud (DNS inverse en googleusercontent.com) : des machines louées, absentes des listes des opérateurs annoncés. 255 autres visaient des fichiers sensibles, comme un fichier .env ou une clé SSH. Sur la période, mon extension ne comparait pas les adresses IP aux listes officielles : elle ne signalait pas 297 des 1 155 fausses requêtes d’IA.
Ce que lisent vraiment les robots d’IA
Sur stea-web.com, ClaudeBot et les robots de recherche IA lisent robots.txt bien plus souvent que les pages : en 60 jours, OAI-SearchBot l’a lu 194 fois pour 26 lectures de pages, PerplexityBot 39 fois pour aucune page. Parmi les pages, l’accueil arrive loin devant.
ClaudeBot a lu robots.txt 605 fois, pour 70 lectures de pages. PerplexityBot est le cas le plus net : sur 40 requêtes authentiques, 39 visaient robots.txt et une visait une image ; aucune ne visait une page. Je n’en connais pas la cause : je n’ai pas contrôlé les réglages de Cloudflare sur ce point. À l’inverse, je ne vois aucune lecture de robots.txt par GPTBot, Meta-ExternalAgent ou Amazonbot, ce qui peut venir du cache (voir les limites).
Pages les plus lues par l’ensemble de ces robots : l’accueil (84 lectures), la vidéo de la facetteuse Fralap (13), L’Atelier du Bijou (12) et la page de contact (11). En tout, ils ont demandé 45 adresses de pages différentes, dont d’anciennes adresses aujourd’hui redirigées.
J’ai refusé Bytespider dans robots.txt le 11 septembre, faute de documentation publiée par ByteDance sur ce robot. Des requêtes cohérentes à son nom ont encore lu l’accueil le 13 septembre, puis plus aucune page jusqu’au 21, tout en continuant à lire robots.txt. Je ne peux pas encore conclure que le refus est respecté : avant lui, ces requêtes ne lisaient déjà des pages que tous les 8 à 15 jours.
llms.txt : aucune lecture par un robot d’IA authentifié
Le fichier llms.txt de stea-web.com est en ligne depuis le 11 septembre 2026. Jusqu’au 21 septembre, aucun robot d’IA authentifié ne l’a lu.
La seule lecture relevée par mon extension venait de mon propre serveur, lors d’un test. Dans les journaux bruts, les six lectures réussies hors tests venaient d’un outil de référencement (quatre) et de deux requêtes de navigateur. Aucune ne venait d’OpenAI, d’Anthropic, de Perplexity, de Google ou de Meta.
llms.txt est une proposition de Jeremy Howard (llmstxt.org, 3 septembre 2024), pas une norme, et Google écrit que ses fonctions d’IA n’ont pas besoin de fichiers texte dédiés à l’IA. Dix jours, c’est court, et le cache peut masquer des lectures, mais rien ne permet de présenter ce fichier comme un levier. Je le tiens à jour parce qu’il coûte peu, sans en attendre d’effet.
Visites venues d’un assistant d’IA : zéro en 68 jours
Du 15 juillet au 21 septembre 2026, soit 68 jours, aucune visite humaine n’est arrivée sur stea-web.com depuis un assistant d’IA. Un passage de robot n’est pas une visite.
J’ai cherché dans tous les journaux disponibles pour cette période les visites dont le référent est chatgpt.com, chat.openai.com, perplexity.ai, claude.ai, gemini.google.com, copilot.microsoft.com, chat.mistral.ai, you.com, meta.ai, grok.com ou deepseek.com. J’ai aussi cherché les liens portant un paramètre utm_source au nom d’un assistant. Résultat : aucun.
Les 18 lectures de ChatGPT-User montrent que ChatGPT a ouvert des pages du site à la demande d’utilisateurs. Elles ne disent pas si le site a été cité, et aucune visite venue de ChatGPT ne les a suivies.
Les limites de cette mesure
Cette mesure a trois angles morts : ce que le cache sert à la place du serveur, ce qu’un pare-feu arrête en amont et les citations lues sans clic. Certains chiffres sont donc des minimums, et ils ne valent que pour ce site.
- Le cache. Cloudflare garde robots.txt et llms.txt en cache (en-tête de deux heures) : une partie des lectures n’atteint pas le serveur. Cela peut expliquer que je ne voie aucune lecture de robots.txt par GPTBot ; il serait faux d’en conclure qu’il l’ignore.
- Les blocages en amont. Un robot arrêté par le CDN ou l’hébergeur n’apparaît pas dans les journaux.
- Les citations sans clic. Une citation lue sans clic ne laisse aucune trace sur le serveur. Et la Search Console compte le trafic des fonctions d’IA de Google avec le reste du trafic Web, sans le séparer.
- Les listes sont des instantanés. 461 passages d’Applebot, du 16 juillet au 21 août 2026, sont absents de la liste d’Apple datée du 15 septembre. Ils sont pourtant authentiques d’après le DNS inverse confirmé. Une liste se complète donc par un DNS inverse.
- Un seul site. Ce sont les chiffres d’un site WordPress d’une trentaine de pages : ils ne font pas une tendance.
Ce que j’en retiens pour un site WordPress
Je retiens cinq règles : autoriser les robots de recherche des assistants, contrôler aussi le CDN, vérifier les adresses IP avant de conclure, ne pas compter sur llms.txt et mesurer à part robots et visites. Aucun prestataire ne peut garantir qu’une IA citera une entreprise ; on peut en revanche vérifier que ses robots peuvent lire le site.
- Autoriser les robots de recherche IA. OpenAI indique qu’un site qui refuse OAI-SearchBot n’est pas montré dans les réponses de recherche de ChatGPT ; Anthropic, que bloquer Claude-SearchBot ou Claude-User peut réduire la visibilité. Refuser GPTBot, robot d’entraînement, est un autre choix. Sur stea-web.com, parmi les robots d’IA, seul Bytespider est refusé.
- Contrôler aussi le CDN. Google recommande que l’exploration soit permise par robots.txt et par le CDN ou l’hébergeur. Mon propre réglage Cloudflare a tenu GPTBot loin de mes pages jusqu’au 27 août.
- Vérifier les IP. Un tableau de bord qui se fie au seul nom du robot mélange vrais et faux passages : ici, près d’un quart étaient faux.
- Ne pas présenter llms.txt comme un levier. Aucun robot d’IA authentifié ne l’a lu, et Google dit ne pas en avoir besoin.
- Mesurer à part robots et visites. Les journaux vérifiés comptent les robots, le référent compte les visiteurs ; les deux ne s’additionnent pas.
Pour le reste, Google précise que ses fonctions d’IA n’ont aucune exigence technique supplémentaire : une page indexée et éligible à un extrait peut servir de source. Le socle reste celui du référencement naturel.
Ces chiffres sont arrêtés au 21 septembre 2026. Pour faire le même constat sur votre site WordPress, il faut trois choses : les journaux du serveur, les listes d’adresses publiées par les opérateurs et un DNS inverse confirmé. Pour savoir si un assistant vous cite, en revanche, aucune mesure faite sur le serveur ne suffit. La page référencement IA décrit comment je mène ce travail sur un site client, sans promesse de citation.