Pourquoi ChatGPT cite vos concurrents et pas votre entreprise
Ouvrez ChatGPT, tapez le nom de votre métier et votre ville. Deux concurrents apparaissent avec un lien vers leur site, vous non. Le premier réflexe est de tout faire réécrire : c'est l'erreur la plus chère, car deux des trois portes se vérifient sans toucher à une seule phrase de votre site.

Les trois conditions pour que ChatGPT cite vos pages
Quand ChatGPT affiche un lien sous sa réponse, deux choses se sont produites avant : un programme est venu lire la page, puis le moteur a choisi celle-là plutôt qu'une autre. OpenAI ne publie pas les règles de ce choix. Sa documentation atteste seulement ceci : ce programme existe, et son rôle déclaré est de faire remonter des pages dans les fonctions de recherche de ChatGPT[1].
Être mentionné n'est pas être cité. Un annuaire local publie une fiche sur votre entreprise. ChatGPT la lit et répond que telle société exerce ce métier à Strasbourg : votre nom sort, le lien mène à l'annuaire. C'est une mention. Une citation, c'est votre page en source, avec un lien vers votre site. Le Tow Center a constaté que des éditeurs ayant bloqué les robots étaient malgré tout nommés[10].
Une condition précède les trois autres : l'assistant doit décider d'aller chercher sur le web. Sur une question générale, il répond de mémoire, sans afficher un seul lien. Quand il cherche, la citation passe trois portes, dans cet ordre : le robot d'OpenAI entre, votre page figure dans la liste que le moteur consulte, le paragraphe qu'il en tire se comprend seul. La troisième demande des semaines parce qu'elle se joue passage par passage : un moteur peut ne prélever qu'un passage sans emporter tout ce qui le précède, et chaque passage se réécrit à la main. Un modèle de langage installé en entreprise impose la même contrainte.
Le robot peut-il entrer ?
Ouvrir « votredomaine.fr/robots.txt » dans un navigateur
La page est-elle dans l'index ?
Relever deux nombres : sitemap et Search Console
Le paragraphe tient-il seul ?
Le relire coupé du reste de la page
Voilà pourquoi l'ordre décide de tout. Une entreprise fait réécrire quarante pages, trois mois de travail, sans que personne ait ouvert le fichier robots.txt : il bloquait le robot d'OpenAI depuis deux ans, à cause d'une ligne laissée par un précédent prestataire. Les quarante pages neuves resteront invisibles dans ChatGPT tant que la ligne n'est pas retirée.
Accessibilité
- Symptôme observable
- Vos pages s’affichent normalement, mais ChatGPT ne les cite jamais.
- Vérification à effectuer
- Ouvrir « votredomaine.fr/robots.txt » et demander quel code reçoit OAI-SearchBot.
- Action possible
- Retirer la ligne « Disallow » fautive, corriger l’erreur serveur ; comptez vingt-quatre heures.
Indexation
- Symptôme observable
- Écart large entre les pages déclarées au sitemap et les pages indexées.
- Vérification à effectuer
- Relever deux nombres : pages du sitemap, pages indexées dans Search Console.
- Action possible
- Publier le sitemap et signaler chaque nouveauté avec IndexNow.
Citabilité
- Symptôme observable
- Vos pages sont indexées, mais les assistants citent d’autres sources sur vos sujets.
- Vérification à effectuer
- Poser à ChatGPT trois questions de votre domaine et noter les sources citées.
- Action possible
- Placer en tête de page une réponse directe, une preuve datée et un auteur identifié.
Vérifier que votre robots.txt laisse entrer le robot d'OpenAI
Ouvrez votre navigateur et tapez « votredomaine.fr/robots.txt ». Ce fichier décide si le robot appelé « OAI-SearchBot » a le droit de lire vos pages pour la recherche de ChatGPT. Sans interdiction, tout est autorisé par défaut : la porte reste ouverte tant qu'aucune ligne « Disallow: / » ne suit « User-agent: OAI-SearchBot » ni « User-agent: * », qui vaut pour tous les robots non nommés.
OpenAI exploite quatre robots. OAI-SearchBot va chercher des pages pour la recherche de ChatGPT : son nom occupe une ligne, l'instruction vient à la ligne suivante, et un « Disallow: / » sous ce nom vous retire de cette recherche. GPTBot copie des pages pour entraîner les modèles ; le bloquer ne touche pas à la recherche, mais les prochains modèles n'apprendront plus rien de vos pages. ChatGPT-User se déplace à la demande d'un utilisateur, OAI-AdsBot travaille pour la publicité. Ces quatre réglages sont indépendants[1] : on croit protéger son contenu, on se retire de la recherche.
Deux détails méritent attention. Vous corrigez le fichier ce matin : comptez environ vingt-quatre heures avant qu'OpenAI en tienne compte[1], et reposer la question dix minutes plus tard ne prouve rien. Le robot « ChatGPT-User », lui, échappe en partie à la règle : quand un utilisateur le déclenche, le « robots.txt » peut ne plus s'appliquer, prévient OpenAI[1].
Le piège est ailleurs : quand un robot réclame ce fichier, votre serveur lui renvoie un code, invisible pour vous et lu par la machine. Un code 4xx, celui d'une page absente, veut dire « tout est autorisé » ; un code 5xx, celui d'une panne serveur, dit l'inverse, et la norme RFC 9309 demande alors de traiter tout le site comme interdit[3]. Votre hébergeur laisse ce fichier en erreur pendant plusieurs jours : vos pages s'affichent, personne ne s'aperçoit de rien, et le robot fait demi-tour. La même norme autorise le robot à s'appuyer un moment sur la dernière version lue : une panne d'un après-midi ne ferme rien, c'est celle qui dure qui ferme la porte.
Ce fichier n'est pas la seule serrure : beaucoup d'hébergeurs et de pare-feux applicatifs, ces filtres placés devant un site, refusent les robots d'IA en amont, sans que rien n'apparaisse dans le « robots.txt ». Le fichier, vous le lisez vous-même. Le reste tient en une question, à poser à la personne qui administre le site : « quel code renvoie /robots.txt, et que reçoit OAI-SearchBot quand il demande une de mes pages ? » Seule l'adresse IP fait foi, comparée à la liste publiée par OpenAI[2] : n'importe qui peut se dire « OAI-SearchBot ».
Compter vos pages réellement indexées par Google et Bing
Votre page est en ligne. Vous la voyez, vos clients la voient : cela ne veut pas dire qu'un moteur la connaît. Un index, c'est la liste des pages qu'un moteur a enregistrées et peut ressortir en réponse ; une page absente de cette liste ne sortira jamais.
Aucun outil ne montre l'index de ChatGPT : OpenAI ne publie pas quelles listes ses fonctions de recherche consultent. Deux moteurs seulement ouvrent leurs chiffres aux propriétaires de site : Bing, avec Bing Webmaster Tools, et Google, avec la Search Console. Le chiffre qu'ils affichent parle de Bing ou de Google, jamais d'un « index de ChatGPT ».
Un mot brouille tout : « indexé ». Une adresse découverte, une page explorée et une page indexée sont trois états différents, et l'indexation ne garantit pas qu'une page sortira un jour dans une réponse générée[9][1]. Le détail de ces trois états et leur lecture dans Search Console relèvent d'un autre article de ce dossier : ici, un seul relevé suffit.
Si aucun outil ne peut garantir quand ni comment votre contenu apparaîtra dans les résultats générés par IA, combiner les sitemaps et des méthodes de soumission d'URL en temps réel comme IndexNow donne à votre contenu les meilleures chances d'être découvert.
Fabrice Canel et Krishna Madhavan, Microsoft — 31 juillet 2025 [9]Autrement dit : publiez un sitemap, la liste de vos adresses, et signalez chaque nouveauté avec IndexNow — sans garantie de résultat.
Le seul chiffre qui vaut quelque chose est un rapport entre deux nombres : combien de pages votre sitemap déclare, combien Search Console en compte comme indexées — pas le total des adresses connues. Un écart large signale que le moteur ignore une partie de votre site. Google écrit la règle sans détour pour ses propres produits : pour apparaître dans les Aperçus IA ou le Mode IA, une page doit être indexée et autorisée à afficher un extrait[4]. OpenAI ne publie pas l'équivalent : présence Google, présence Bing, accessibilité aux robots d'OpenAI et citation effective restent quatre choses distinctes.
Rendre vos paragraphes compréhensibles coupés du reste de la page
Explorer une page, l'indexer, en récupérer un passage, transmettre ce passage au modèle, le citer : cinq opérations distinctes. À l'étape de la récupération, rien ne garantit que le passage emporte ce qui le précède[4]. Si ce passage commence par « il » et que le mot remplacé se trouve trois paragraphes plus haut, il ne veut plus rien dire une fois détaché : la machine peut passer au site suivant, même si votre page est la meilleure du web sur le sujet.
La règle tient en une phrase : une information exacte peut devenir impossible à citer si sa formulation ne survit pas au détachement. « La livraison intervient sous 48 heures, hors week-end » se comprend seule ; « elle intervient sous 48 heures », posée trois paragraphes plus bas, peut désigner la livraison comme la commande. La démonstration phrase par phrase appartient à l'article du dossier consacré à la structure des pages : ici, retenez le principe.
Trois gestes suffisent, et aucun ne demande d'outil. Donnez la réponse dans la première phrase, le contexte ensuite. Nommez le sujet au lieu de le remplacer par un pronom : écrivez « le contrat de maintenance » plutôt que « celui-ci ». Accrochez enfin à chaque chiffre sa condition : « sous 48 heures, hors week-end, pour toute commande passée avant 16 heures » se recopie tel quel.
Un relevé indépendant éclaire ce que ces extraits deviennent une fois séparés de leur page, celui du Tow Center. L'équipe a pris deux cents extraits, soit dix articles chez chacun des vingt éditeurs retenus, et a demandé à ChatGPT d'en retrouver la source. Cent cinquante-trois réponses sont revenues partiellement ou entièrement fausses, et sept fois seulement le moteur a reconnu qu'il ne savait pas[10]. Attention à la date : ce relevé est de fin 2024.
Google, lui, coupe court à une inquiétude : il écrit qu'aucune exigence supplémentaire, aucune optimisation spéciale, n'est demandée pour ses fonctions génératives — autrement dit, rien à ajouter au-dessus du travail d'écriture, qui reste, lui, entier[4]. Un paragraphe qui se comprend seul sert Google, Bing, ChatGPT, et surtout le client pressé qui vous lit sur son téléphone dans une salle d'attente : vous écrivez pour quelqu'un qui n'a pas lu le paragraphe d'avant, pas pour une machine. Je retrouve cette contrainte dans les outils IA que je construis pour des entreprises, avec le même préalable : rendre ses contenus lisibles par une machine.
Quels chiffres croire quand un prestataire vous parle de ChatGPT
Une agence vous envoie une présentation. Une diapositive annonce un pourcentage : telle part des citations de ChatGPT viendrait d'un index tiers. Remontez la chaîne : la diapositive cite un billet d'agence, qui cite un autre billet, qui cite un message LinkedIn. Au bout de la chaîne, aucun relevé n'existe. Personne n'a compté, et c'est là-dessus que vous alliez fonder une décision.
D'où vient l'affirmation, et ce qu'elle vaut.
| Niveau | Ce que c'est | Ce qu'on peut en faire | Exemple dans cet article |
|---|---|---|---|
| Documentation de l'éditeur | une page publiée par l'éditeur sur son propre produit | affirmer au présent, sans « selon » | les quatre robots d'OpenAI et l'indépendance des réglages [1] |
| Norme publique d'un organisme | une règle de protocole publiée, que l'éditeur ne revendique pas | invoquer comme règle du protocole ; OpenAI ne s'y engage pas | RFC 9309 : une erreur serveur vaut interdiction présumée [3] |
| Mesure tierce datée | une étude avec auteur, date et échantillon | citer toujours avec sa date, son échantillon, son périmètre | l'étude du Tow Center, novembre 2024 [10] |
| Reprise sans source | une affirmation dont la chaîne ne mène à aucune donnée | rien : elle reste hors de l'article | le pourcentage attribué à un index tiers, sans jeu de données publié |
Ce tableau s'utilise en réunion, la proposition commerciale sous les yeux. On vous explique que ChatGPT découpe votre question en plusieurs sous-questions, cherchées en même temps. Le mécanisme est documenté — chez Google, pour ses propres produits[5]. Transposer cette phrase à l'assistant d'OpenAI revient à décrire une voiture avec le manuel d'une autre marque.
Deux sigles reviennent dans presque toutes les propositions commerciales : GEO, generative engine optimization, l'optimisation pour les moteurs génératifs, et AEO, answer engine optimization, l'optimisation pour les moteurs qui répondent au lieu de lister des liens. Les deux sont légitimes ; les méthodes qu'ils recouvrent ne le sont pas toujours. Une seule question tranche : « ce conseil vient de quelle ligne du tableau ? »
Les Aperçus IA de Google obéissent, eux, à des règles publiées : autre produit, autre documentation. Et ces documentations changent : OpenAI a revu la sienne fin 2025[13]. Une affirmation sans date est déjà à moitié fausse. Reste la question voisine — faut-il une optimisation par moteur ? Réponse courte, développée dans ce dossier : un même socle éditorial peut servir plusieurs moteurs, mais accès, sources et mesure se vérifient moteur par moteur.
Le fichier llms.txt ne rend pas votre site visible dans ChatGPT
On vous a peut-être proposé d'ajouter un fichier « llms.txt » à votre site, ligne dédiée sur le devis. C'est une proposition signée Jeremy Howard, reprise par des projets de développement logiciel pour décrire leur documentation[12]. Aucun grand moteur ne dit qu'il le lit pour choisir ses sources, et Google est le plus net : ce fichier n'est pas nécessaire pour ses fonctions génératives, même si sa présence ne gêne pas les quelques services qui le lisent[5].
Tapez « votredomaine.fr/llms.txt » dans votre navigateur : fichier présent ou page d'erreur, vos chances d'être cité ne changent pas. Il peut servir à d'autres usages ; pour être cité, il n'apporte rien, et il ne passe jamais avant le « robots.txt ».
Pourquoi vos statistiques comptent mal les visites venues de ChatGPT
ChatGPT cite votre page. Combien de visites cela vous rapporte-t-il ? Personne ne peut vous donner le total : aucun éditeur ne le publie. Vous obtiendrez un plancher, jamais un compte.
Je regarde d'abord ce que Google donne. Search Console compte désormais vos affichages dans les Aperçus IA, le Mode IA et Discover, sans les clics — et tous les sites n'y ont pas encore droit[6][7]. Microsoft expose à la même erreur de lecture. Bing Webmaster Tools propose un rapport de performance IA : on y lit des chiffres, on en conclut qu'on mesure ChatGPT. Non. Ce rapport couvre Copilot, les résumés générés dans Bing et des services partenaires que Microsoft ne nomme pas, sur un échantillon[8]. Ni ChatGPT ni OpenAI n'y figurent.
Reste votre outil d'analyse d'audience. Cherchez « chatgpt.com » dans la liste des sites référents : son chiffre est réel, mais incomplet, car une partie des visites venues d'un assistant arrive sans indication de provenance et se range dans le trafic direct, au milieu des visiteurs qui ont tapé votre adresse à la main. Aucune règle unique ne couvre toutes les applications ni tous les liens : le mode d'emploi du relevé — référents à chercher, paramètres à suivre, lecture en plancher — est traité à part dans ce dossier.
De là ma position : je ne promets pas de trafic sur ce sujet. Aucun éditeur ne publie la donnée qui permettrait de vérifier une telle promesse. Vendre un chiffre invérifiable, c'est faire passer un ressenti pour une mesure.
Dans quel ordre corriger votre site pour être cité par ChatGPT
Vous agissez sur les trois portes, sans jamais commander la citation. Ce qui décide du résultat, c'est l'ordre dans lequel vous les ouvrez : du moins cher au plus cher, jamais l'inverse. Commencer par la réécriture avant d'avoir lu le premier fichier, c'est payer le poste le plus lourd pour des pages que le robot n'a peut-être pas le droit de lire.
Voici l'ordre, pour lundi matin. Ouvrez « votredomaine.fr/robots.txt » et cherchez « OAI-SearchBot » puis « User-agent: * » : si un bloc « OAI-SearchBot » existe, c'est lui qui commande ; sinon, c'est le bloc « User-agent: * » qui s'applique. Une ligne « Disallow: / » dans le bloc qui commande : envoyez la correction à votre administrateur et comptez vingt-quatre heures. Relevez ensuite deux nombres, combien de pages votre sitemap déclare et combien Search Console en a indexées ; un écart large signale un problème d'indexation à traiter en parallèle, sans quoi les pages réécrites resteront hors de portée.
Le test qui prend trente secondes vient en troisième. Copiez un paragraphe de la page qui amène vos demandes de devis, collez-le dans un message, relisez-le seul : si vous ne savez plus de quoi il parle, une IA non plus. Trois pages suffisent pour savoir si le sujet relève, chez vous, de l'écriture ou de la technique.
Reste la citation elle-même. Tant que les deux premières portes restent fermées, interroger ChatGPT n'apprend rien ; et même ensuite, un test unique ne prouve rien. Le 10 septembre 2025, le laboratoire Thinking Machines Lab a posé mille fois la même question à un modèle ouvert, Qwen3-235B, avec le réglage censé garantir une réponse identique : quatre-vingts réponses différentes[11]. Le relevé porte sur un autre modèle que ChatGPT, et OpenAI ne publie rien d'équivalent : retenez la précaution, pas le chiffre. Vous posez la question à midi, votre associé la pose à quatorze heures : rien ne garantit la même réponse. Le protocole d'un test qui vaut quelque chose — prompt exact, date, modèle, nombre d'essais consignés — est détaillé dans un autre article du dossier. Mieux vaut une veille courte qui change vos décisions qu'un tableau de bord de plus.
La position de farweb.fr
L'ordre de diagnostic que je recommande
La visibilité dans les IA devient un marché : les sigles se multiplient, les offres arrivent. Presque toutes taisent le même point.
Ce point, le voici : sur les trois portes, seule la troisième — écrire des passages qui tiennent seuls — demande un vrai travail d'auteur. C'est la seule qui mérite un budget, et celle dont on parle le moins ; les deux autres se vérifient avant de signer quoi que ce soit.
J'en tire une règle. Si vos concurrents sont cités et pas vous, écartez d'abord ce qui ne dépend pas de votre écriture : une ligne dans un fichier, une erreur serveur qui s'installe, une page que personne n'est venu chercher. Ce sont aussi les moins coûteuses à corriger.
Un vendeur vous promet un rang, une place, un classement ? Aucun éditeur n'en publie : on vous vend une chose qui n'existe pas.
La décision du jour — ouvrir « votredomaine.fr/robots.txt » dans votre navigateur et relever les deux nombres, sitemap et Search Console, avant de signer le moindre devis de rédaction. Si les deux portes sont ouvertes et que votre entreprise reste absente, le sujet devient un travail d'écriture.
Raphaël Uhlrich
Consultant en stratégie digitale et intelligence artificielle, Strasbourg
À retenir
- ChatGPT ne publie aucun classement d'entreprises. Votre page a trois portes à franchir, dans l'ordre : le robot entre, la page est indexée, le paragraphe se comprend seul.
- Le coût change d'ordre de grandeur à chaque porte, et la vérification va toujours du moins cher au plus cher : fichier d'accès, index, écriture. La réécriture ne vient qu'en dernier.
- Une IA peut ne prélever qu'un passage, sans le reste de la page. Un paragraphe qui ne se comprend pas détaché de son texte ne se cite pas : écrivez chaque réponse pour qu'elle tienne seule.
- Avant de croire un chiffre sur ChatGPT, remontez sa chaîne. Un chiffre dont la chaîne s'arrête sur un message LinkedIn n'a jamais été compté.
- Aucun éditeur ne publie les clics issus d'une réponse générative : ce qu'une citation rapporte, personne ne le mesure aujourd'hui.
Savoir pourquoi ChatGPT ne vous cite pas encore
Les trois contrôles — accès, index, citabilité — passés sur vos pages qui comptent, avec l'ordre des corrections. Sans promesse de classement : un diagnostic, des priorités.
Prendre rendez-vousL'audit IA en détailConférences pour dirigeantsStudio digital & IA
Exemple de grille à renseigner — données illustratives.
| Critère | Votre entreprise | Concurrent A |
|---|---|---|
| Page accessible | À contrôler | Oui |
| Page indexée | À contrôler | Oui |
| Réponse explicite | Faible | Forte |
| Preuve externe | Peu visible | Présente |
| Auteur identifiable | Partiel | Oui |
| Citation observée | Non | Oui |
Questions fréquentes
Mon robots.txt est correct : qu'est-ce qui peut encore bloquer les robots d'OpenAI ?
Pourquoi ChatGPT cite-t-il mes concurrents et jamais mon entreprise ?
Un site qui bloque GPTBot peut-il quand même être cité par ChatGPT ?
Combien de temps entre la publication et la première citation ?
Faut-il réécrire tout son site pour être cité par ChatGPT ?
Mon entreprise peut-elle apparaître dans ChatGPT sans que mon site soit cité ?
Sources et références
- OpenAI — Overview of OpenAI Crawlers — 22/07/2026 — developers.openai.com/api/docs/bots. Quatre robots ; OAI-SearchBot fait remonter des sites dans la recherche de ChatGPT ; réglages indépendants ; propagation ~24 h.
- OpenAI — Plages d'adresses IP OAI-SearchBot — openai.com/searchbot.json. La vérification d'un robot se fait par plage d'adresses publiée, non par chaîne d'agent utilisateur.
- IETF — RFC 9309, Robots Exclusion Protocol — sept. 2022. Racine, minuscules, UTF-8 ; 4xx = tout autorisé, 5xx = interdiction totale présumée.
- Google Search Central — AI Features and your website — 10/12/2025. Une page doit être indexée et éligible à un extrait ; aucune exigence supplémentaire.
- Google — Optimizing for Generative AI Features — 10/07/2026. Définition du query fan-out ; llms.txt non nécessaire (avec caveat).
- Google Search Central Blog — Generative AI performance reports — 03/06/2026. Impressions dans les Aperçus IA, le Mode IA et Discover ; pas de clics ; déploiement partiel.
- Search Engine Land — GSC AI performance reports — 03/06/2026, B. Schwartz. Corrobore [6] ; documente le bouton de retrait.
- Microsoft — AI Performance in Bing Webmaster Tools — 10/02/2026. Copilot, résumés Bing, partenaires ; données échantillonnées ; ne nomme ni ChatGPT ni OpenAI.
- Microsoft — Keeping Content Discoverable with Sitemaps — 31/07/2025, F. Canel & K. Madhavan. Aucun outil ne garantit quand un contenu apparaîtra ; sitemaps et IndexNow accélèrent la découverte.
- Tow Center / Columbia Journalism Review — 27/11/2024. 200 extraits, 20 éditeurs ; 153 réponses inexactes, 7 aveux ; bloquer les robots n'a pas empêché l'attribution.
- Thinking Machines Lab — Defeating Nondeterminism in LLM Inference — 10/09/2025. 1000 exécutions à température zéro sur Qwen3-235B, 80 sorties distinctes.
- llmstxt.org — Proposition llms.txt — 03/09/2024, J. Howard. Proposition ouverte, sans adoption revendiquée par un fournisseur.
- ppc.land — OpenAI revises ChatGPT crawler documentation — 09/12/2025. La documentation évolue : toute affirmation se date.


