07 78 32 42 69 hello@farweb.fr
SEO, GEO & moteurs de réponse IA

Pourquoi ChatGPT cite vos concurrents et pas votre entreprise

Ouvrez ChatGPT, tapez le nom de votre métier et votre ville. Deux concurrents apparaissent avec un lien vers leur site, vous non. Le premier réflexe est de tout faire réécrire : c'est l'erreur la plus chère, car deux des trois portes se vérifient sans toucher à une seule phrase de votre site.

18 min de lecture Note de décision Par Raphaël UHLRICH
Sur l'écran, la réponse de l'assistant met un concurrent en lumière ; à côté, le dossier de l'entreprise reste dans l'ombre, son parcours de validation inachevé.
Le concurrent atteint la réponse parce qu'il franchit les trois contrôles ; un seul blocage vous en retire.

Les trois conditions pour que ChatGPT cite vos pages

Quand ChatGPT affiche un lien sous sa réponse, deux choses se sont produites avant : un programme est venu lire la page, puis le moteur a choisi celle-là plutôt qu'une autre. OpenAI ne publie pas les règles de ce choix. Sa documentation atteste seulement ceci : ce programme existe, et son rôle déclaré est de faire remonter des pages dans les fonctions de recherche de ChatGPT[1].

Être mentionné n'est pas être cité. Un annuaire local publie une fiche sur votre entreprise. ChatGPT la lit et répond que telle société exerce ce métier à Strasbourg : votre nom sort, le lien mène à l'annuaire. C'est une mention. Une citation, c'est votre page en source, avec un lien vers votre site. Le Tow Center a constaté que des éditeurs ayant bloqué les robots étaient malgré tout nommés[10].

Une condition précède les trois autres : l'assistant doit décider d'aller chercher sur le web. Sur une question générale, il répond de mémoire, sans afficher un seul lien. Quand il cherche, la citation passe trois portes, dans cet ordre : le robot d'OpenAI entre, votre page figure dans la liste que le moteur consulte, le paragraphe qu'il en tire se comprend seul. La troisième demande des semaines parce qu'elle se joue passage par passage : un moteur peut ne prélever qu'un passage sans emporter tout ce qui le précède, et chaque passage se réécrit à la main. Un modèle de langage installé en entreprise impose la même contrainte.

Les deux premières se vérifient en une matinée, chez Bing et Google. La troisième est la seule qui se travaille.

Le robot peut-il entrer ?

Ouvrir « votredomaine.fr/robots.txt » dans un navigateur

Oui ou non
une minuteà vérifier

La page est-elle dans l'index ?

Relever deux nombres : sitemap et Search Console

Oui ou non
une heureà relever

Le paragraphe tient-il seul ?

Le relire coupé du reste de la page

Se travaille
des semainesà retravailler

Voilà pourquoi l'ordre décide de tout. Une entreprise fait réécrire quarante pages, trois mois de travail, sans que personne ait ouvert le fichier robots.txt : il bloquait le robot d'OpenAI depuis deux ans, à cause d'une ligne laissée par un précédent prestataire. Les quarante pages neuves resteront invisibles dans ChatGPT tant que la ligne n'est pas retirée.

1

Accessibilité

  • robots
  • serveur
  • page disponible
  • contenu accessible
Symptôme observable
Vos pages s’affichent normalement, mais ChatGPT ne les cite jamais.
Vérification à effectuer
Ouvrir « votredomaine.fr/robots.txt » et demander quel code reçoit OAI-SearchBot.
Action possible
Retirer la ligne « Disallow » fautive, corriger l’erreur serveur ; comptez vingt-quatre heures.
2

Indexation

  • Google
  • Bing
  • canonique
  • sitemap
Symptôme observable
Écart large entre les pages déclarées au sitemap et les pages indexées.
Vérification à effectuer
Relever deux nombres : pages du sitemap, pages indexées dans Search Console.
Action possible
Publier le sitemap et signaler chaque nouveauté avec IndexNow.
3

Citabilité

  • réponse claire
  • preuve
  • contexte suffisant
  • source identifiable
Symptôme observable
Vos pages sont indexées, mais les assistants citent d’autres sources sur vos sujets.
Vérification à effectuer
Poser à ChatGPT trois questions de votre domaine et noter les sources citées.
Action possible
Placer en tête de page une réponse directe, une preuve datée et un auteur identifié.
Chaque vérification conditionne la suivante : une page inaccessible n’est jamais indexée, une page non indexée n’est jamais citée.

Vérifier que votre robots.txt laisse entrer le robot d'OpenAI

Ouvrez votre navigateur et tapez « votredomaine.fr/robots.txt ». Ce fichier décide si le robot appelé « OAI-SearchBot » a le droit de lire vos pages pour la recherche de ChatGPT. Sans interdiction, tout est autorisé par défaut : la porte reste ouverte tant qu'aucune ligne « Disallow: / » ne suit « User-agent: OAI-SearchBot » ni « User-agent: * », qui vaut pour tous les robots non nommés.

OpenAI exploite quatre robots. OAI-SearchBot va chercher des pages pour la recherche de ChatGPT : son nom occupe une ligne, l'instruction vient à la ligne suivante, et un « Disallow: / » sous ce nom vous retire de cette recherche. GPTBot copie des pages pour entraîner les modèles ; le bloquer ne touche pas à la recherche, mais les prochains modèles n'apprendront plus rien de vos pages. ChatGPT-User se déplace à la demande d'un utilisateur, OAI-AdsBot travaille pour la publicité. Ces quatre réglages sont indépendants[1] : on croit protéger son contenu, on se retire de la recherche.

Deux détails méritent attention. Vous corrigez le fichier ce matin : comptez environ vingt-quatre heures avant qu'OpenAI en tienne compte[1], et reposer la question dix minutes plus tard ne prouve rien. Le robot « ChatGPT-User », lui, échappe en partie à la règle : quand un utilisateur le déclenche, le « robots.txt » peut ne plus s'appliquer, prévient OpenAI[1].

Le piège est ailleurs : quand un robot réclame ce fichier, votre serveur lui renvoie un code, invisible pour vous et lu par la machine. Un code 4xx, celui d'une page absente, veut dire « tout est autorisé » ; un code 5xx, celui d'une panne serveur, dit l'inverse, et la norme RFC 9309 demande alors de traiter tout le site comme interdit[3]. Votre hébergeur laisse ce fichier en erreur pendant plusieurs jours : vos pages s'affichent, personne ne s'aperçoit de rien, et le robot fait demi-tour. La même norme autorise le robot à s'appuyer un moment sur la dernière version lue : une panne d'un après-midi ne ferme rien, c'est celle qui dure qui ferme la porte.

Ce fichier n'est pas la seule serrure : beaucoup d'hébergeurs et de pare-feux applicatifs, ces filtres placés devant un site, refusent les robots d'IA en amont, sans que rien n'apparaisse dans le « robots.txt ». Le fichier, vous le lisez vous-même. Le reste tient en une question, à poser à la personne qui administre le site : « quel code renvoie /robots.txt, et que reçoit OAI-SearchBot quand il demande une de mes pages ? » Seule l'adresse IP fait foi, comparée à la liste publiée par OpenAI[2] : n'importe qui peut se dire « OAI-SearchBot ».

Compter vos pages réellement indexées par Google et Bing

Votre page est en ligne. Vous la voyez, vos clients la voient : cela ne veut pas dire qu'un moteur la connaît. Un index, c'est la liste des pages qu'un moteur a enregistrées et peut ressortir en réponse ; une page absente de cette liste ne sortira jamais.

Aucun outil ne montre l'index de ChatGPT : OpenAI ne publie pas quelles listes ses fonctions de recherche consultent. Deux moteurs seulement ouvrent leurs chiffres aux propriétaires de site : Bing, avec Bing Webmaster Tools, et Google, avec la Search Console. Le chiffre qu'ils affichent parle de Bing ou de Google, jamais d'un « index de ChatGPT ».

Un mot brouille tout : « indexé ». Une adresse découverte, une page explorée et une page indexée sont trois états différents, et l'indexation ne garantit pas qu'une page sortira un jour dans une réponse générée[9][1]. Le détail de ces trois états et leur lecture dans Search Console relèvent d'un autre article de ce dossier : ici, un seul relevé suffit.

Si aucun outil ne peut garantir quand ni comment votre contenu apparaîtra dans les résultats générés par IA, combiner les sitemaps et des méthodes de soumission d'URL en temps réel comme IndexNow donne à votre contenu les meilleures chances d'être découvert.

Fabrice Canel et Krishna Madhavan, Microsoft — 31 juillet 2025 [9]

Autrement dit : publiez un sitemap, la liste de vos adresses, et signalez chaque nouveauté avec IndexNow — sans garantie de résultat.

Le seul chiffre qui vaut quelque chose est un rapport entre deux nombres : combien de pages votre sitemap déclare, combien Search Console en compte comme indexées — pas le total des adresses connues. Un écart large signale que le moteur ignore une partie de votre site. Google écrit la règle sans détour pour ses propres produits : pour apparaître dans les Aperçus IA ou le Mode IA, une page doit être indexée et autorisée à afficher un extrait[4]. OpenAI ne publie pas l'équivalent : présence Google, présence Bing, accessibilité aux robots d'OpenAI et citation effective restent quatre choses distinctes.

Rendre vos paragraphes compréhensibles coupés du reste de la page

Explorer une page, l'indexer, en récupérer un passage, transmettre ce passage au modèle, le citer : cinq opérations distinctes. À l'étape de la récupération, rien ne garantit que le passage emporte ce qui le précède[4]. Si ce passage commence par « il » et que le mot remplacé se trouve trois paragraphes plus haut, il ne veut plus rien dire une fois détaché : la machine peut passer au site suivant, même si votre page est la meilleure du web sur le sujet.

La règle tient en une phrase : une information exacte peut devenir impossible à citer si sa formulation ne survit pas au détachement. « La livraison intervient sous 48 heures, hors week-end » se comprend seule ; « elle intervient sous 48 heures », posée trois paragraphes plus bas, peut désigner la livraison comme la commande. La démonstration phrase par phrase appartient à l'article du dossier consacré à la structure des pages : ici, retenez le principe.

Trois gestes suffisent, et aucun ne demande d'outil. Donnez la réponse dans la première phrase, le contexte ensuite. Nommez le sujet au lieu de le remplacer par un pronom : écrivez « le contrat de maintenance » plutôt que « celui-ci ». Accrochez enfin à chaque chiffre sa condition : « sous 48 heures, hors week-end, pour toute commande passée avant 16 heures » se recopie tel quel.

Un relevé indépendant éclaire ce que ces extraits deviennent une fois séparés de leur page, celui du Tow Center. L'équipe a pris deux cents extraits, soit dix articles chez chacun des vingt éditeurs retenus, et a demandé à ChatGPT d'en retrouver la source. Cent cinquante-trois réponses sont revenues partiellement ou entièrement fausses, et sept fois seulement le moteur a reconnu qu'il ne savait pas[10]. Attention à la date : ce relevé est de fin 2024.

Google, lui, coupe court à une inquiétude : il écrit qu'aucune exigence supplémentaire, aucune optimisation spéciale, n'est demandée pour ses fonctions génératives — autrement dit, rien à ajouter au-dessus du travail d'écriture, qui reste, lui, entier[4]. Un paragraphe qui se comprend seul sert Google, Bing, ChatGPT, et surtout le client pressé qui vous lit sur son téléphone dans une salle d'attente : vous écrivez pour quelqu'un qui n'a pas lu le paragraphe d'avant, pas pour une machine. Je retrouve cette contrainte dans les outils IA que je construis pour des entreprises, avec le même préalable : rendre ses contenus lisibles par une machine.

Quels chiffres croire quand un prestataire vous parle de ChatGPT

Une agence vous envoie une présentation. Une diapositive annonce un pourcentage : telle part des citations de ChatGPT viendrait d'un index tiers. Remontez la chaîne : la diapositive cite un billet d'agence, qui cite un autre billet, qui cite un message LinkedIn. Au bout de la chaîne, aucun relevé n'existe. Personne n'a compté, et c'est là-dessus que vous alliez fonder une décision.

D'où vient l'affirmation, et ce qu'elle vaut.

NiveauCe que c'estCe qu'on peut en faireExemple dans cet article
Documentation de l'éditeurune page publiée par l'éditeur sur son propre produitaffirmer au présent, sans « selon »les quatre robots d'OpenAI et l'indépendance des réglages [1]
Norme publique d'un organismeune règle de protocole publiée, que l'éditeur ne revendique pasinvoquer comme règle du protocole ; OpenAI ne s'y engage pasRFC 9309 : une erreur serveur vaut interdiction présumée [3]
Mesure tierce datéeune étude avec auteur, date et échantillonciter toujours avec sa date, son échantillon, son périmètrel'étude du Tow Center, novembre 2024 [10]
Reprise sans sourceune affirmation dont la chaîne ne mène à aucune donnéerien : elle reste hors de l'articlele pourcentage attribué à un index tiers, sans jeu de données publié

Ce tableau s'utilise en réunion, la proposition commerciale sous les yeux. On vous explique que ChatGPT découpe votre question en plusieurs sous-questions, cherchées en même temps. Le mécanisme est documenté — chez Google, pour ses propres produits[5]. Transposer cette phrase à l'assistant d'OpenAI revient à décrire une voiture avec le manuel d'une autre marque.

Deux sigles reviennent dans presque toutes les propositions commerciales : GEO, generative engine optimization, l'optimisation pour les moteurs génératifs, et AEO, answer engine optimization, l'optimisation pour les moteurs qui répondent au lieu de lister des liens. Les deux sont légitimes ; les méthodes qu'ils recouvrent ne le sont pas toujours. Une seule question tranche : « ce conseil vient de quelle ligne du tableau ? »

Les Aperçus IA de Google obéissent, eux, à des règles publiées : autre produit, autre documentation. Et ces documentations changent : OpenAI a revu la sienne fin 2025[13]. Une affirmation sans date est déjà à moitié fausse. Reste la question voisine — faut-il une optimisation par moteur ? Réponse courte, développée dans ce dossier : un même socle éditorial peut servir plusieurs moteurs, mais accès, sources et mesure se vérifient moteur par moteur.

Le fichier llms.txt ne rend pas votre site visible dans ChatGPT

On vous a peut-être proposé d'ajouter un fichier « llms.txt » à votre site, ligne dédiée sur le devis. C'est une proposition signée Jeremy Howard, reprise par des projets de développement logiciel pour décrire leur documentation[12]. Aucun grand moteur ne dit qu'il le lit pour choisir ses sources, et Google est le plus net : ce fichier n'est pas nécessaire pour ses fonctions génératives, même si sa présence ne gêne pas les quelques services qui le lisent[5].

Tapez « votredomaine.fr/llms.txt » dans votre navigateur : fichier présent ou page d'erreur, vos chances d'être cité ne changent pas. Il peut servir à d'autres usages ; pour être cité, il n'apporte rien, et il ne passe jamais avant le « robots.txt ».

Pourquoi vos statistiques comptent mal les visites venues de ChatGPT

ChatGPT cite votre page. Combien de visites cela vous rapporte-t-il ? Personne ne peut vous donner le total : aucun éditeur ne le publie. Vous obtiendrez un plancher, jamais un compte.

Je regarde d'abord ce que Google donne. Search Console compte désormais vos affichages dans les Aperçus IA, le Mode IA et Discover, sans les clics — et tous les sites n'y ont pas encore droit[6][7]. Microsoft expose à la même erreur de lecture. Bing Webmaster Tools propose un rapport de performance IA : on y lit des chiffres, on en conclut qu'on mesure ChatGPT. Non. Ce rapport couvre Copilot, les résumés générés dans Bing et des services partenaires que Microsoft ne nomme pas, sur un échantillon[8]. Ni ChatGPT ni OpenAI n'y figurent.

Reste votre outil d'analyse d'audience. Cherchez « chatgpt.com » dans la liste des sites référents : son chiffre est réel, mais incomplet, car une partie des visites venues d'un assistant arrive sans indication de provenance et se range dans le trafic direct, au milieu des visiteurs qui ont tapé votre adresse à la main. Aucune règle unique ne couvre toutes les applications ni tous les liens : le mode d'emploi du relevé — référents à chercher, paramètres à suivre, lecture en plancher — est traité à part dans ce dossier.

De là ma position : je ne promets pas de trafic sur ce sujet. Aucun éditeur ne publie la donnée qui permettrait de vérifier une telle promesse. Vendre un chiffre invérifiable, c'est faire passer un ressenti pour une mesure.

Dans quel ordre corriger votre site pour être cité par ChatGPT

Vous agissez sur les trois portes, sans jamais commander la citation. Ce qui décide du résultat, c'est l'ordre dans lequel vous les ouvrez : du moins cher au plus cher, jamais l'inverse. Commencer par la réécriture avant d'avoir lu le premier fichier, c'est payer le poste le plus lourd pour des pages que le robot n'a peut-être pas le droit de lire.

Voici l'ordre, pour lundi matin. Ouvrez « votredomaine.fr/robots.txt » et cherchez « OAI-SearchBot » puis « User-agent: * » : si un bloc « OAI-SearchBot » existe, c'est lui qui commande ; sinon, c'est le bloc « User-agent: * » qui s'applique. Une ligne « Disallow: / » dans le bloc qui commande : envoyez la correction à votre administrateur et comptez vingt-quatre heures. Relevez ensuite deux nombres, combien de pages votre sitemap déclare et combien Search Console en a indexées ; un écart large signale un problème d'indexation à traiter en parallèle, sans quoi les pages réécrites resteront hors de portée.

Le test qui prend trente secondes vient en troisième. Copiez un paragraphe de la page qui amène vos demandes de devis, collez-le dans un message, relisez-le seul : si vous ne savez plus de quoi il parle, une IA non plus. Trois pages suffisent pour savoir si le sujet relève, chez vous, de l'écriture ou de la technique.

Reste la citation elle-même. Tant que les deux premières portes restent fermées, interroger ChatGPT n'apprend rien ; et même ensuite, un test unique ne prouve rien. Le 10 septembre 2025, le laboratoire Thinking Machines Lab a posé mille fois la même question à un modèle ouvert, Qwen3-235B, avec le réglage censé garantir une réponse identique : quatre-vingts réponses différentes[11]. Le relevé porte sur un autre modèle que ChatGPT, et OpenAI ne publie rien d'équivalent : retenez la précaution, pas le chiffre. Vous posez la question à midi, votre associé la pose à quatorze heures : rien ne garantit la même réponse. Le protocole d'un test qui vaut quelque chose — prompt exact, date, modèle, nombre d'essais consignés — est détaillé dans un autre article du dossier. Mieux vaut une veille courte qui change vos décisions qu'un tableau de bord de plus.

La position de farweb.fr

L'ordre de diagnostic que je recommande

La visibilité dans les IA devient un marché : les sigles se multiplient, les offres arrivent. Presque toutes taisent le même point.

Ce point, le voici : sur les trois portes, seule la troisième — écrire des passages qui tiennent seuls — demande un vrai travail d'auteur. C'est la seule qui mérite un budget, et celle dont on parle le moins ; les deux autres se vérifient avant de signer quoi que ce soit.

J'en tire une règle. Si vos concurrents sont cités et pas vous, écartez d'abord ce qui ne dépend pas de votre écriture : une ligne dans un fichier, une erreur serveur qui s'installe, une page que personne n'est venu chercher. Ce sont aussi les moins coûteuses à corriger.

Un vendeur vous promet un rang, une place, un classement ? Aucun éditeur n'en publie : on vous vend une chose qui n'existe pas.

La décision du jour — ouvrir « votredomaine.fr/robots.txt » dans votre navigateur et relever les deux nombres, sitemap et Search Console, avant de signer le moindre devis de rédaction. Si les deux portes sont ouvertes et que votre entreprise reste absente, le sujet devient un travail d'écriture.

Raphaël Uhlrich

Consultant en stratégie digitale et intelligence artificielle, Strasbourg

À retenir

  • ChatGPT ne publie aucun classement d'entreprises. Votre page a trois portes à franchir, dans l'ordre : le robot entre, la page est indexée, le paragraphe se comprend seul.
  • Le coût change d'ordre de grandeur à chaque porte, et la vérification va toujours du moins cher au plus cher : fichier d'accès, index, écriture. La réécriture ne vient qu'en dernier.
  • Une IA peut ne prélever qu'un passage, sans le reste de la page. Un paragraphe qui ne se comprend pas détaché de son texte ne se cite pas : écrivez chaque réponse pour qu'elle tienne seule.
  • Avant de croire un chiffre sur ChatGPT, remontez sa chaîne. Un chiffre dont la chaîne s'arrête sur un message LinkedIn n'a jamais été compté.
  • Aucun éditeur ne publie les clics issus d'une réponse générative : ce qu'une citation rapporte, personne ne le mesure aujourd'hui.

Savoir pourquoi ChatGPT ne vous cite pas encore

Les trois contrôles — accès, index, citabilité — passés sur vos pages qui comptent, avec l'ordre des corrections. Sans promesse de classement : un diagnostic, des priorités.

Prendre rendez-vous

L'audit IA en détailConférences pour dirigeantsStudio digital & IA

Exemple de grille à renseigner — données illustratives.

CritèreVotre entrepriseConcurrent A
Page accessibleÀ contrôlerOui
Page indexéeÀ contrôlerOui
Réponse expliciteFaibleForte
Preuve externePeu visiblePrésente
Auteur identifiablePartielOui
Citation observéeNonOui
Tant que les deux premières lignes restent « À contrôler », l’écart avec le concurrent ne s’explique pas encore par l’écriture : le diagnostic commence par elles.

Questions fréquentes

Mon robots.txt est correct : qu'est-ce qui peut encore bloquer les robots d'OpenAI ?
Deux serrures invisibles depuis un navigateur. Un pare-feu applicatif ou un réglage d'hébergeur peut refuser les robots d'IA en amont, sans qu'aucune ligne n'apparaisse dans le fichier. Et un robots.txt en erreur serveur durable vaut interdiction présumée pour un robot qui respecte la norme. Dans les deux cas, la vérification passe par la personne qui administre le site : quel code renvoie le fichier, et que reçoit « OAI-SearchBot » quand il demande une page — en authentifiant le robot par ses adresses IP publiées, jamais par son nom, que n'importe qui peut imiter.
Pourquoi ChatGPT cite-t-il mes concurrents et jamais mon entreprise ?
Trois causes, à écarter dans cet ordre. Le robot n'entre pas, à cause d'une ligne dans le fichier « robots.txt » ou d'une erreur serveur. La page n'est pas dans l'index consulté. Le paragraphe qu'une IA en tire ne se comprend pas sans le reste. Une quatrième explication ne dépend pas de vos pages : votre concurrent est peut-être cité à partir d'un annuaire ou d'un comparatif, et non de son propre site. Pour le versant Google de cette question, le raisonnement change de terrain.
Un site qui bloque GPTBot peut-il quand même être cité par ChatGPT ?
Oui, et le lien peut mener chez lui. GPTBot sert à l'entraînement des modèles, pas à la recherche : le bloquer ne coupe pas les citations. Le robot qui les alimente s'appelle « OAI-SearchBot » et se règle séparément ; c'est le seul dont le blocage supprime le lien vers vos pages. Le Tow Center a d'ailleurs constaté en novembre 2024 que des éditeurs ayant bloqué les robots restaient malgré tout nommés, souvent avec une attribution fausse ou un lien vers une reprise de leur texte. Pour que le lien mène chez vous, c'est OAI-SearchBot qui doit pouvoir entrer.
Combien de temps entre la publication et la première citation ?
Personne ne le garantit, et Microsoft le dit sans détour pour ses propres produits : aucun outil ne dit quand un contenu apparaîtra. Un seul délai est documenté, celui de la prise en compte d'un changement du fichier « robots.txt », autour de vingt-quatre heures côté recherche. Pour la citation elle-même, aucun éditeur ne publie de délai. Si un prestataire vous en annonce un, demandez-lui où il l'a lu.
Faut-il réécrire tout son site pour être cité par ChatGPT ?
Non, et c'est le contresens le plus coûteux. Commencez par les pages qui portent votre activité : celle qui amène les demandes de devis, celle qui décrit votre offre principale, celle qui répond à la question que vos clients posent réellement. Trois pages retravaillées après vérification de l'accès des robots et de l'indexation valent mieux qu'un site entier réécrit à l'aveugle. Étendez ensuite, page par page, en partant de celles que vos clients consultent avant d'appeler.
Mon entreprise peut-elle apparaître dans ChatGPT sans que mon site soit cité ?
Oui. ChatGPT peut nommer votre entreprise à partir d'un annuaire, d'un comparatif ou d'un article de presse, avec un lien qui mène vers cette source et non vers vous. Vous êtes alors mentionné sans être cité : votre nom circule, le trafic part ailleurs, et c'est la page tierce qui contrôle ce qui se dit de vous. Vérifiez l'exactitude de ces pages tierces — informations, coordonnées, périmètre d'activité — car elles peuvent répondre à votre place.

Sources et références

  1. OpenAI — Overview of OpenAI Crawlers — 22/07/2026 — developers.openai.com/api/docs/bots. Quatre robots ; OAI-SearchBot fait remonter des sites dans la recherche de ChatGPT ; réglages indépendants ; propagation ~24 h.
  2. OpenAI — Plages d'adresses IP OAI-SearchBot — openai.com/searchbot.json. La vérification d'un robot se fait par plage d'adresses publiée, non par chaîne d'agent utilisateur.
  3. IETF — RFC 9309, Robots Exclusion Protocol — sept. 2022. Racine, minuscules, UTF-8 ; 4xx = tout autorisé, 5xx = interdiction totale présumée.
  4. Google Search Central — AI Features and your website — 10/12/2025. Une page doit être indexée et éligible à un extrait ; aucune exigence supplémentaire.
  5. Google — Optimizing for Generative AI Features — 10/07/2026. Définition du query fan-out ; llms.txt non nécessaire (avec caveat).
  6. Google Search Central Blog — Generative AI performance reports — 03/06/2026. Impressions dans les Aperçus IA, le Mode IA et Discover ; pas de clics ; déploiement partiel.
  7. Search Engine Land — GSC AI performance reports — 03/06/2026, B. Schwartz. Corrobore [6] ; documente le bouton de retrait.
  8. Microsoft — AI Performance in Bing Webmaster Tools — 10/02/2026. Copilot, résumés Bing, partenaires ; données échantillonnées ; ne nomme ni ChatGPT ni OpenAI.
  9. Microsoft — Keeping Content Discoverable with Sitemaps — 31/07/2025, F. Canel & K. Madhavan. Aucun outil ne garantit quand un contenu apparaîtra ; sitemaps et IndexNow accélèrent la découverte.
  10. Tow Center / Columbia Journalism Review — 27/11/2024. 200 extraits, 20 éditeurs ; 153 réponses inexactes, 7 aveux ; bloquer les robots n'a pas empêché l'attribution.
  11. Thinking Machines Lab — Defeating Nondeterminism in LLM Inference — 10/09/2025. 1000 exécutions à température zéro sur Qwen3-235B, 80 sorties distinctes.
  12. llmstxt.org — Proposition llms.txt — 03/09/2024, J. Howard. Proposition ouverte, sans adoption revendiquée par un fournisseur.
  13. ppc.land — OpenAI revises ChatGPT crawler documentation — 09/12/2025. La documentation évolue : toute affirmation se date.

© farweb.fr — Strasbourg — Tous droits réservés

Share This