GEO · Publié le 13 août 2026 · Sources vérifiées à la date de publication

Faire citer son entreprise par ChatGPT en 2026.
Ce qui marche vraiment — et ce que personne ne vérifie.

Avant de parler de méthode : commencez par vérifier que les moteurs IA ont le droit de vous lire. Nous avons découvert que notre propre site refoulait GPTBot, ClaudeBot et Google-Extended — et rien ne l'indiquait dans notre robots.txt. Voici le test de 30 secondes, puis ce qui reste réellement en votre pouvoir.

Le test de 30 secondes (faites-le maintenant)

Ouvrez dans votre navigateur : votre-domaine.fr/robots.txt. Cherchez ces cinq noms :

Un Disallow: / sous l'un de ces noms signifie : ce moteur n'a pas le droit de lire vos pages. Il ne vous citera donc pas. Si le fichier est vide ou absent, ce n'est pas rassurant pour autant — lisez la suite.

Le piège : le blocage invisible

Le 11 août 2026, notre robots.txt ne bloquait rien. Et pourtant, en simulant chaque robot, nous avons constaté que GPTBot, ClaudeBot, PerplexityBot et Google-Extended étaient refoulés sur toutes nos pages.

La cause n'était pas dans le fichier : elle était dans un réglage de notre CDN. Cloudflare propose un réglage global Block AI Bots — activé, il refuse les robots IA au pare-feu, avant même que le robots.txt ne soit consulté. À cela s'ajoutait un robots.txt « géré » par la plateforme, qui écrasait le nôtre en silence.

Deux réglages, jamais choisis consciemment, qui suffisaient à nous rendre invisibles sur ce terrain-là. Nous les avons désactivés le 11 août, puis nous avons revérifié robot par robot : les cinq répondent aujourd'hui en HTTP 200.

La leçon, valable pour vous : un robots.txt propre ne prouve rien. Ce qui compte, c'est ce qu'un robot obtient réellement quand il demande votre page. Vérifiez le résultat, pas le fichier — c'est le même principe que pour le reste de votre socle technique, détaillé dans notre guide « Être trouvé sur Google et sur ChatGPT en 2026 ». Et si votre problème est plus large — vous n'êtes visible ni sur Google ni ailleurs —, les sept causes possibles sont passées en revue, test par test, dans « Votre site est en ligne mais invisible sur Google ».

Entraînement et recherche : deux robots différents

C'est la nuance que la plupart des sites manquent, et elle change tout. Depuis 2024-2025, les grands acteurs séparent le robot qui entraîne leurs modèles de celui qui construit leur index de recherche :

ActeurRobot d'entraînementRobot de recherche (= celui qui cite)
OpenAIGPTBotOAI-SearchBot, ChatGPT-User
AnthropicClaudeBotClaude-SearchBot, Claude-User
GoogleGoogle-ExtendedGooglebot
PerplexityPerplexityBot, Perplexity-User

Conséquence directe : beaucoup d'entreprises ont bloqué « les IA » d'un bloc en 2024, pour protéger leurs contenus de l'entraînement. Ce faisant, une partie d'entre elles a aussi coupé les robots de recherche — et s'est retirée des réponses de ChatGPT sans jamais l'avoir voulu.

Il est possible de tenir les deux positions à la fois : refuser l'entraînement, accepter d'être lu pour être cité.

La posture « cite-moi, ne m'entraîne pas »

Le 24 septembre 2025, Cloudflare a publié la Content Signals Policy : une extension du robots.txt qui distingue trois usages, et qu'elle a déployée sur plus de 3,8 millions de domaines.

Concrètement, la ligne à poser dans votre robots.txt ressemble à ceci — c'est celle qui est en production sur ce site :

User-agent: *
Content-Signal: search=yes,ai-input=yes,ai-train=no,use=reference
Allow: /

Deux précautions d'honnêteté. D'abord, ce n'est pas encore une norme du web : le groupe AIPREF de l'IETF travaille à la standardisation, et le respect de ces signaux reste volontaire. Ensuite, la valeur du signal est autant juridique que technique : l'article 4 de la directive européenne 2019/790 autorise la fouille de textes et de données à des fins commerciales sauf réserve de droits exprimée par un procédé lisible par machine. En France, cette exception est transposée à l'article L. 122-5-3 du Code de la propriété intellectuelle. Écrire ai-train=no dans un fichier lisible par machine, c'est exprimer cette réserve. Si le sujet est sensible pour vos contenus, faites valider votre dispositif par un conseil — nous décrivons ici une pratique technique, pas un avis juridique.

Ce qui fait qu'une IA vous reprend (ce qui est documenté)

Une fois l'accès ouvert, la question devient : pourquoi un moteur génératif choisirait-il votre page plutôt qu'une autre ? Il n'y a pas de classement public, mais les travaux disponibles convergent sur quelques régularités.

La recherche fondatrice sur le sujet — un travail conjoint de Princeton, Georgia Tech et de l'Allen Institute, avec un banc d'essai d'environ 10 000 requêtes — mesure que des ajustements de contenu ciblés peuvent améliorer la visibilité d'une source dans les réponses génératives jusqu'à 40 %. Les tactiques gagnantes ne sont pas des astuces : citer des sources, ajouter des statistiques vérifiables, structurer les réponses.

Le contre-exemple qu'il faut connaître : les données structurées

On lit partout qu'il « suffit » d'ajouter du balisage schema.org pour être cité. C'est faux, et c'est mesuré. Une étude Ahrefs publiée le 11 mai 2026 montre les deux faces :

La lecture honnête : le balisage accompagne les sites qui publient sérieusement, il ne produit pas la citation à lui seul. C'est de la plomberie — elle lève l'ambiguïté sur qui vous êtes et ce que vous vendez, ce qui reste utile — mais quiconque vous vend « du schema.org pour être cité par ChatGPT » vous vend un raccourci que la mesure ne confirme pas.

Ce qui bouge vraiment, d'après les travaux GEO cités plus haut, c'est le contenu lui-même : des affirmations vérifiables, des chiffres attribués, des sources liées. Les moteurs écartent les généralités — ce qui n'est pas traçable n'est pas citable.

Traduction opérationnelle, dans l'ordre :
  1. Un accès ouvert et vérifié pour les robots de recherche IA.
  2. Des données structurées valides (Organization, Article, FAQPage) — utiles pour lever l'ambiguïté, mais ne comptez pas dessus pour être cité : voir la mesure ci-dessus.
  3. Une réponse directe en tête de page, puis le détail — un moteur reprend une phrase, pas votre plan.
  4. Des chiffres datés et liés à leur source. Chaque affirmation vérifiable est un point d'accroche.
  5. De la régularité : un domaine qui publie et met à jour reste dans le paysage.

Et la limite, qu'il faut dire clairement : personne ne peut garantir une citation. Les moteurs génératifs décident source par source, réponse par réponse, sans classement consultable ni recours. Un prestataire qui vous promet « d'être cité par ChatGPT » vend quelque chose qu'il ne contrôle pas. Ce qui est en votre pouvoir, c'est de ne pas être exclu, et d'être le genre de source qu'un moteur peut reprendre sans risque.

Et llms.txt ? La réponse honnête

Le fichier llms.txt est proposé comme un plan du site à destination des modèles. Ce n'est pas une priorité : une étude de SE Ranking portant sur 300 000 domaines relève environ 10 % d'adoption, dont près de 40 % de fichiers vides posés automatiquement par des plugins, et aucun grand robot IA ne s'engage officiellement à le lire — ils crawlent le HTML.

Traduction : le poser ne coûte presque rien et ne fait pas de mal, mais il ne remplace ni un accès vérifié, ni un balisage propre. Les deux premiers points de la liste ci-dessus valent cent fichiers llms.txt.

Récapitulatif : l'ordre des opérations

ÉtapeCe que vous faitesComment vous vérifiez
1Lire son robots.txtLes 5 robots IA n'ont pas de Disallow: /
2Contrôler CDN et pare-feuUn robot IA simulé obtient bien un 200 sur vos pages
3Poser sa postureContent-Signal présent, ai-train selon votre choix
4Baliser les pagesTest des résultats enrichis de Google : zéro erreur
5Publier sourcé et datéChaque chiffre porte un lien et une date

Si votre budget vous impose de choisir, faites les étapes 1 et 2 : elles sont gratuites et ce sont les seules qui peuvent vous exclure totalement. Sur ce que coûte la suite selon les options du marché, nous avons publié les chiffres dans « Combien coûte le SEO pour une PME en 2026 ».

Transparence : cet article a été produit par AURA, notre service de contenu en autopilote — recherche du sujet, rédaction, données structurées, publication. Le cas décrit plus haut est le nôtre : nous avons trouvé la panne sur notre propre site avant d'en parler à qui que ce soit. Si la méthode vous intéresse, voici comment AURA fonctionne ; si vous préférez d'abord savoir où en est votre site, le diagnostic prend 2 minutes.

FAQ

Mon site est récent, est-ce que ça vaut la peine ?

Les étapes 1 et 2 oui, immédiatement : elles ne coûtent rien et elles évitent de construire pendant des mois derrière une porte fermée. Le reste demande de la régularité, donc du temps.

Bloquer l'entraînement va-t-il me faire disparaître des réponses IA ?

Pas mécaniquement, puisque l'entraînement et la recherche passent par des robots distincts chez OpenAI comme chez Anthropic. Vous acceptez OAI-SearchBot et Claude-SearchBot, vous refusez GPTBot et ClaudeBot : la citation reste possible.

Comment savoir si je suis déjà cité ?

Posez à ChatGPT, Perplexity et Gemini les questions que vos clients posent réellement, notez qui est cité, et refaites l'exercice tous les mois. C'est artisanal, mais c'est la mesure la plus honnête disponible aujourd'hui.

Les mots-clés comptent-ils encore ?

Ils servent à trouver votre page ; ils ne suffisent pas à la faire reprendre. Un moteur génératif cite une affirmation vérifiable, pas une densité de mots-clés.

Sources (consultées le 13/08/2026) : Cloudflare — options de trafic IA et réglages par défaut · Cloudflare — annonce de la Content Signals Policy (24/09/2025) · Content-Signal dans robots.txt : search, ai-input, ai-train · No Hacks — panorama des user-agents IA 2026 (entraînement vs recherche) · Digital Applied — matrice de décision robots.txt / llms.txt 2026 · Digital Applied — llms.txt : données d'adoption (étude SE Ranking, 300 000 domaines) · Generative engine optimization — travaux Princeton / Georgia Tech / Allen Institute · Ahrefs (11/05/2026) — 1 885 pages suivies après ajout de schema : les citations IA ne bougent pas · Directive (UE) 2019/790, article 4 — réserve de droits lisible par machine · Cabinet Lacour — opt-out TDM et article L. 122-5-3 du CPI.