Pour être cité par un assistant IA, il faut d'abord comprendre où il va chercher. Contrairement à une idée répandue, les réponses commerciales de ChatGPT, Perplexity ou Gemini ne viennent pas de la mémoire du modèle mais d'une recherche en direct sur le web, suivie d'une lecture de quelques pages. Chaque moteur a son propre circuit, et les différences comptent.
Cet article décrit ces circuits tels que nous les observons à la date de publication, puis liste ce qu'un site doit mettre en place pour être trouvé, lu et cité.
Sommaire
Trois architectures de recherche
ChatGPT, lorsqu'il effectue une recherche, s'appuie sur un index tiers, principalement celui de Bing, complété par ses propres robots. Une page absente de Bing est donc invisible pour ChatGPT ; c'est la raison pour laquelle Bing Webmaster Tools et le protocole IndexNow sont devenus des outils de GEO.
Perplexity a construit son propre index avec son robot, PerplexityBot, et cite ses sources par défaut, avec des liens numérotés. Il est le plus transparent des trois et celui qui reprend le plus volontiers des pages de niche bien structurées.
Gemini et les AI Overviews de Google s'appuient sur l'index Google. Une page bien positionnée sur Google a donc une longueur d'avance, mais l'AI Overview sélectionne des passages, pas des pages : le premier résultat n'est pas forcément le premier cité.
Les robots à autoriser
Le fichier robots.txt décide de qui peut lire le site. Plusieurs entreprises ont bloqué les robots IA en 2023 par crainte de l'entraînement, et se privent aujourd'hui de la recherche. Les principaux agents à connaître :
GPTBot (OpenAI, collecte pour l'entraînement), OAI-SearchBot (OpenAI, index de la recherche ChatGPT) et ChatGPT-User (accès déclenché par un utilisateur).
PerplexityBot (Perplexity, index et citations).
ClaudeBot (Anthropic).
Google-Extended (contrôle l'usage des contenus par Gemini pour l'entraînement ; ne modifie pas l'indexation Google ni les AI Overviews).
Bingbot (Bing, et à travers lui la recherche ChatGPT et Copilot).
Comment une page est sélectionnée
Le moteur reformule la question de l'utilisateur en plusieurs requêtes, parfois une dizaine, qui explorent des angles différents : la catégorie, le lieu, la comparaison, le prix, la preuve. Il retient un petit nombre de pages, en extrait les passages qui répondent le plus directement, puis rédige. Trois critères reviennent dans nos tests : la fraîcheur (une page datée et mise à jour est préférée), la précision (des faits attribuables plutôt que des généralités) et la corroboration (une information reprise par plusieurs sources indépendantes).
La conséquence pour la rédaction est simple : chaque section doit pouvoir être extraite seule et rester compréhensible, avec le nom de l'entreprise, le fait et sa source dans le même paragraphe.
llms.txt : utile, à coût nul, sans garantie
Le fichier llms.txt, proposé en 2024 comme convention, décrit un site en langage clair à l'intention des modèles : ce que fait l'entreprise, ses pages principales, ses références. Aucun grand moteur ne s'est engagé publiquement à le lire, mais il ne coûte rien à produire, il oblige à formuler l'essentiel en quelques lignes, et il est déjà utilisé par certains outils. Nous le publions pour nos clients à la racine du site, à côté du robots.txt.
Données structurées et identité d'entité
Les balises schema.org (Organization avec adresses, fondateurs et domaines d'expertise, Service, Article avec auteur, FAQPage) décrivent la page à la machine et rattachent son contenu à une entité identifiable. Elles ne garantissent pas une citation, mais elles réduisent l'ambiguïté : une IA qui sait de qui elle parle cite plus volontiers. L'identité doit ensuite être identique sur LinkedIn, dans les annuaires et dans la presse.
IndexNow et Bing, le circuit court vers ChatGPT
IndexNow est un protocole qui prévient Bing, et les moteurs qui partagent son index, dès qu'une page est publiée ou modifiée. Pour une entreprise qui cible ChatGPT, c'est le moyen le plus rapide de faire connaître une nouvelle page. Nous l'avons automatisé sur notre propre site : chaque mise en ligne soumet les pages modifiées en quelques secondes.
Ce que nous observons
Sur nos jeux de questions en communication scientifique, Perplexity cite des agences spécialisées dès qu'elles ont des pages précises sur le sujet. ChatGPT, lui, privilégie les entreprises reprises par des sources tierces : annuaires d'agences, presse, comparatifs. Les AI Overviews de Google suivent de près le classement organique, avec un avantage aux pages qui répondent à la question en une phrase. Ces différences justifient une mesure moteur par moteur avant d'agir.
