Un directeur marketing nous appelle en moyenne deux fois par semaine avec la même phrase : « J'ai testé ChatGPT sur notre secteur, on n'apparaît pas. » La suite est presque toujours identique. Les fondamentaux SEO sont là. Le site est propre. Les contenus existent. Pourtant, aucune citation. La raison est rarement une seule — c'est un cumul. Voici les sept causes qui expliquent la quasi-totalité des cas d'invisibilité dans ChatGPT en 2026.
01Vos robots.txt bloquent GPTBot ou OAI-SearchBot
C'est la première chose que nous vérifions, et c'est souvent la bonne. OpenAI opère trois crawlers documentés : GPTBot pour l'entraînement des modèles, ChatGPT-User pour les actions déclenchées par un utilisateur (browsing, plugins), et OAI-SearchBot pour indexer les résultats de ChatGPT Search. Si votre robots.txt renvoie Disallow: / pour l'un de ces user-agents, vous êtes techniquement invisible pour la fonction correspondante.
Le piège classique en 2026 : le refus de GPTBot à l'entraînement, hérité de 2023-2024, oublié depuis, et qui inclut aussi OAI-SearchBot parce que la règle vise User-agent: * ou tout ce qui contient « GPT ». Résultat : votre site n'apparaît jamais en source ChatGPT Search alors qu'il est censé être ouvert.
Correctif : autorisez explicitement OAI-SearchBot (Search) et ChatGPT-User (browsing) même si vous refusez GPTBot (entraînement). Les trois user-agents sont listés dans la documentation officielle OpenAI.
02Votre contenu principal est chargé en JavaScript non pré-rendu
Les crawlers d'OpenAI, comme ceux de Perplexity ou d'Anthropic, ne rendent pas le JavaScript de la même manière que Googlebot. Ils lisent principalement le HTML brut renvoyé par le serveur. Un site en React ou Vue qui hydrate son contenu côté client — donc dont le <body> initial ne contient qu'un <div id="root"> vide — livre aux moteurs génératifs une page blanche.
Vous pouvez le tester en trente secondes : lancez curl https://votresite.com et lisez la sortie brute. Si vos titres, sous-titres et corps de texte n'y sont pas, aucun LLM ne peut les citer, quel que soit le budget d'annotation que vous mettez derrière.
Correctif : pré-rendu (SSR ou SSG) systématique pour toute page à vocation éditoriale ou commerciale. Next.js, Nuxt, Astro ou Remix règlent le problème structurellement. Pour un site legacy, un service de pré-rendu HTTP en amont du CDN suffit à débloquer la citation.
03Aucun balisage schema.org qui vous identifie comme entité citable
ChatGPT ne « comprend » pas votre entreprise à partir d'un logo et d'un slogan de home page. Il a besoin de désambiguïsation structurée. Un bloc JSON-LD Organization — nom, URL, logo, adresse, sameAs vers Wikipedia, LinkedIn et bases publiques — donne aux modèles l'ancrage nécessaire pour vous relier à un concept nommé.
Le baromètre GeoPeak d'août 2026 sur les grands cabinets d'avocats parisiens a mesuré ce point : 3 sites sur 10 seulement exposent un schema Organization, aucun n'expose une FAQPage, et zéro n'est cité par ChatGPT sur les requêtes sectorielles testées. La corrélation n'est pas fortuite : sans balisage sémantique, un site est une entité floue pour les moteurs génératifs, et les moteurs génératifs citent ce qu'ils peuvent nommer sans ambiguïté.
Correctif : un bloc JSON-LD Organization sur toutes les pages, une FAQPage sur les pages FAQ, un Article sur les posts. Deux jours de développement pour un site standard.
04Vos pages ne répondent pas directement à une question
C'est la cause éditoriale la plus lourde. ChatGPT ne cite pas une home page qui déclare « leader de la transformation digitale ». Il cite une page qui, dans ses trois premiers paragraphes, énonce factuellement : « X est Y. X coûte Z. X se déroule en N étapes. » La citation générative est extractive avant d'être narrative.
Aggarwal et al., dans le papier fondateur GEO: Generative Engine Optimization (KDD 2024), montrent expérimentalement que l'ajout de statistiques citables, de citations sourcées et de langage factuel dans le corps d'un contenu augmente la probabilité d'être cité par un moteur génératif de 30 à 40 %. Le style « brochure institutionnelle » — adjectifs, superlatifs, absence de chiffres — est le pire ennemi de la citation IA.
Correctif : chaque page importante commence par une phrase-réponse. Un chiffre, une définition, une durée, un prix. Le reste peut narrer, mais le premier bloc doit être extractible.
05Aucune citation sortante traçable dans votre contenu
Le mécanisme n'est pas intuitif : plus vous citez d'autres sources (études, papers, données publiques, autorités reconnues), plus vous êtes vous-même citable. Les moteurs génératifs traitent les liens sortants vers des sources reconnues comme un signal d'ancrage factuel. Un article sans aucun lien sortant, ou avec uniquement des liens internes, ressemble à une opinion isolée.
Nous le voyons systématiquement dans les audits : les pages les plus citées d'un domaine sont presque toujours celles qui contiennent 5 à 15 liens sortants vers des références externes (études, sites gouvernementaux, papers académiques, Wikipedia, presse spécialisée). Ce n'est pas un artefact — c'est un signal actif.
Correctif : auditer les pages phares. Objectif : minimum 3 liens sortants par 1 000 mots, vers des sources vérifiables et non commerciales.
06Aucun signal E-E-A-T d'auteur identifié
ChatGPT — comme Google AI Overviews — pondère fortement les signaux d'expertise personnelle : nom d'auteur, biographie, affiliation, historique de publications. Une page publiée sous « L'équipe » ou sans nom du tout signale un contenu générique. Une page signée par une personne réelle, dont le nom apparaît aussi sur LinkedIn, sur des conférences, sur des papers ou sur d'autres publications, signale une source ancrée dans le monde réel.
Le balisage Person en JSON-LD, croisé avec sameAs vers LinkedIn, ORCID, Google Scholar ou une page personnelle, fait le lien machine-lisible. Sans ce lien, votre auteur n'existe pas dans le graphe de connaissances de ChatGPT.
Correctif : tout article majeur signé par une personne identifiable, avec bio ancrée, balisage Person, et présence croisée LinkedIn / réseaux professionnels.
07Aucune mention dans les corpus de fond utilisés par ChatGPT
C'est la cause la plus lourde à corriger, et la plus stratégique. ChatGPT ne cite pas seulement à partir de son index temps réel — il pondère aussi ce qu'il « sait » de vous à partir de son entraînement, où trois familles de sources dominent : Wikipedia, la presse spécialisée reconnue, et les forums techniques structurés (Reddit, Stack Exchange, GitHub).
Si votre marque n'a jamais été mentionnée par ces sources, elle n'existe pas dans la mémoire longue du modèle. Les prompts qui déclencheraient une citation renvoient alors vers des concurrents ou des acteurs génériques. C'est notamment ce qui explique que Wikipedia rafle 7,8 % de toutes les citations ChatGPT — ce n'est pas un biais, c'est la conséquence directe de sa densité éditoriale dans les corpus d'entraînement.
Correctif : stratégie de mentions tierces sur 6-12 mois. Presse spécialisée sectorielle, contribution à des articles Wikipedia thématiques, prises de parole sur des podcasts référencés, interventions sourcées sur Reddit ou Stack Exchange dans votre discipline. C'est le levier lent — mais c'est celui qui décale durablement une marque de l'invisibilité vers la citation.
Tableau récapitulatif : les 7 causes et leurs correctifs
| # | Cause | Correctif | Délai |
|---|---|---|---|
| 01 | robots.txt bloque OAI-SearchBot | Autoriser OAI-SearchBot et ChatGPT-User explicitement | 30 min |
| 02 | Contenu chargé en JavaScript | SSR / SSG systématique ou service de pré-rendu | 1-3 semaines |
| 03 | Aucun schema.org Organization | Bloc JSON-LD Organization, FAQPage, Article | 2-3 jours |
| 04 | Pages sans réponse directe | Réécriture des premiers paragraphes en mode extractif | 2-6 semaines |
| 05 | Aucune citation sortante | 3+ liens sortants sourcés par 1 000 mots | 2-3 semaines |
| 06 | Auteur non identifié | Signature Person + sameAs vers LinkedIn / ORCID | 1 semaine |
| 07 | Aucune mention corpus tiers | Presse spécialisée, Wikipedia, Reddit, podcasts | 6-12 mois |
La bonne nouvelle
Sur les 7 causes, 6 sont techniques ou éditoriales et se règlent en moins de 60 jours. Seule la septième — la présence dans les corpus tiers — demande un travail de fond. Si vous corrigez les six premières correctement, vous passez d'un statut d'invisibilité à celui de candidat crédible à la citation. La septième détermine si vous êtes cité quand la question tombe.
Concrètement : un site B2B avec produit, doc technique et blog qui applique correctement les correctifs 1 à 6 voit son score GeoPeak passer de 30-40 à 65-75 sur 100 en 90 jours. C'est ce que nous mesurons quantitativement sur les missions Vigie GEO.
Deuxième bonne nouvelle : la concurrence est très faible. Le baromètre GeoPeak d'août 2026 mesurait un score médian de 38/100 sur les grands cabinets d'avocats d'affaires parisiens — un secteur pourtant sensible aux questions de visibilité et disposant de budgets marketing conséquents. Les autres secteurs B2B français que nous auditons se situent dans une fourchette comparable, entre 32 et 45. Passer à 70 signifie prendre trois ans d'avance sur son marché.
Le calendrier compte. Les moteurs génératifs ne redistribuent pas leurs citations en temps réel. Une fois qu'un domaine s'installe comme source récurrente sur une requête sectorielle, il tient la position pendant douze à dix-huit mois. Chaque trimestre d'attente est un trimestre où un concurrent — ou pire, un annuaire générique — occupe la place que vous auriez pu prendre.
Découvrez laquelle des 7 causes vous concerne.
Audit express gratuit en 3 minutes : score par moteur, top 5 correctifs. Audit exécutif à 297 € livré en 24 heures : rapport de 50 pages, playbooks distincts par moteur, plan 30/60/90 jours.
Questions fréquentes
Pourquoi ChatGPT ne cite-t-il jamais mon site ?
robots.txt qui bloque GPTBot ou OAI-SearchBot, absence de balisage schema.org, contenu chargé en JavaScript non pré-rendu, absence de réponse directe dans les premiers paragraphes, aucune citation sortante traçable, aucun signal E-E-A-T d'auteur identifié, et absence de mentions dans les corpus tiers utilisés par ChatGPT (Wikipedia, presse spécialisée, forums structurés).Quelle est la différence entre GPTBot et OAI-SearchBot ?
GPTBot alimente l'entraînement des modèles OpenAI. OAI-SearchBot alimente les résultats de ChatGPT Search en temps réel. ChatGPT-User effectue les actions déclenchées par un utilisateur (browsing, plugins). Autoriser uniquement OAI-SearchBot et ChatGPT-User dans robots.txt permet d'être cité par ChatGPT sans que vos contenus n'entrent dans l'entraînement.Quel pourcentage de réponses ChatGPT contient des citations ?
Faut-il publier un fichier llms.txt pour être cité par ChatGPT ?
llms.txt n'est officiellement soutenu ni par OpenAI, ni par Google, ni par Perplexity. Il est adopté par Anthropic et Mintlify. Publier un /llms.txt reste utile comme manifeste éditorial pour les crawlers qui le respectent, mais ce n'est pas un levier direct de citation dans ChatGPT en 2026.