Référencement LLM : comment ChatGPT, Perplexity et Gemini choisissent leurs sources

Trois architectures, un principe commun, et la liste de ce que votre site doit rendre possible.

Par Benoit Martin, co-fondateur de DigiObs5 septembre 20263 min de lecture

Pour être cité par un assistant IA, il faut d'abord comprendre où il va chercher. Contrairement à une idée répandue, les réponses commerciales de ChatGPT, Perplexity ou Gemini ne viennent pas de la mémoire du modèle mais d'une recherche en direct sur le web, suivie d'une lecture de quelques pages. Chaque moteur a son propre circuit, et les différences comptent.

Cet article décrit ces circuits tels que nous les observons à la date de publication, puis liste ce qu'un site doit mettre en place pour être trouvé, lu et cité.

Sommaire
  1. Trois architectures de recherche
  2. Les robots à autoriser
  3. Comment une page est sélectionnée
  4. llms.txt : utile, à coût nul, sans garantie
  5. Données structurées et identité d'entité
  6. IndexNow et Bing, le circuit court vers ChatGPT
  7. Ce que nous observons
  8. Pour aller plus loin

Trois architectures de recherche

ChatGPT, lorsqu'il effectue une recherche, s'appuie sur un index tiers, principalement celui de Bing, complété par ses propres robots. Une page absente de Bing est donc invisible pour ChatGPT ; c'est la raison pour laquelle Bing Webmaster Tools et le protocole IndexNow sont devenus des outils de GEO.

Perplexity a construit son propre index avec son robot, PerplexityBot, et cite ses sources par défaut, avec des liens numérotés. Il est le plus transparent des trois et celui qui reprend le plus volontiers des pages de niche bien structurées.

Gemini et les AI Overviews de Google s'appuient sur l'index Google. Une page bien positionnée sur Google a donc une longueur d'avance, mais l'AI Overview sélectionne des passages, pas des pages : le premier résultat n'est pas forcément le premier cité.

Les robots à autoriser

Le fichier robots.txt décide de qui peut lire le site. Plusieurs entreprises ont bloqué les robots IA en 2023 par crainte de l'entraînement, et se privent aujourd'hui de la recherche. Les principaux agents à connaître :

GPTBot (OpenAI, collecte pour l'entraînement), OAI-SearchBot (OpenAI, index de la recherche ChatGPT) et ChatGPT-User (accès déclenché par un utilisateur).

PerplexityBot (Perplexity, index et citations).

ClaudeBot (Anthropic).

Google-Extended (contrôle l'usage des contenus par Gemini pour l'entraînement ; ne modifie pas l'indexation Google ni les AI Overviews).

Bingbot (Bing, et à travers lui la recherche ChatGPT et Copilot).

Comment une page est sélectionnée

Le moteur reformule la question de l'utilisateur en plusieurs requêtes, parfois une dizaine, qui explorent des angles différents : la catégorie, le lieu, la comparaison, le prix, la preuve. Il retient un petit nombre de pages, en extrait les passages qui répondent le plus directement, puis rédige. Trois critères reviennent dans nos tests : la fraîcheur (une page datée et mise à jour est préférée), la précision (des faits attribuables plutôt que des généralités) et la corroboration (une information reprise par plusieurs sources indépendantes).

La conséquence pour la rédaction est simple : chaque section doit pouvoir être extraite seule et rester compréhensible, avec le nom de l'entreprise, le fait et sa source dans le même paragraphe.

llms.txt : utile, à coût nul, sans garantie

Le fichier llms.txt, proposé en 2024 comme convention, décrit un site en langage clair à l'intention des modèles : ce que fait l'entreprise, ses pages principales, ses références. Aucun grand moteur ne s'est engagé publiquement à le lire, mais il ne coûte rien à produire, il oblige à formuler l'essentiel en quelques lignes, et il est déjà utilisé par certains outils. Nous le publions pour nos clients à la racine du site, à côté du robots.txt.

Données structurées et identité d'entité

Les balises schema.org (Organization avec adresses, fondateurs et domaines d'expertise, Service, Article avec auteur, FAQPage) décrivent la page à la machine et rattachent son contenu à une entité identifiable. Elles ne garantissent pas une citation, mais elles réduisent l'ambiguïté : une IA qui sait de qui elle parle cite plus volontiers. L'identité doit ensuite être identique sur LinkedIn, dans les annuaires et dans la presse.

IndexNow et Bing, le circuit court vers ChatGPT

IndexNow est un protocole qui prévient Bing, et les moteurs qui partagent son index, dès qu'une page est publiée ou modifiée. Pour une entreprise qui cible ChatGPT, c'est le moyen le plus rapide de faire connaître une nouvelle page. Nous l'avons automatisé sur notre propre site : chaque mise en ligne soumet les pages modifiées en quelques secondes.

Ce que nous observons

Sur nos jeux de questions en communication scientifique, Perplexity cite des agences spécialisées dès qu'elles ont des pages précises sur le sujet. ChatGPT, lui, privilégie les entreprises reprises par des sources tierces : annuaires d'agences, presse, comparatifs. Les AI Overviews de Google suivent de près le classement organique, avec un avantage aux pages qui répondent à la question en une phrase. Ces différences justifient une mesure moteur par moteur avant d'agir.

Pour aller plus loin

Questions fréquentes

ChatGPT utilise-t-il Google pour chercher ?

Non. La recherche de ChatGPT s'appuie principalement sur l'index de Bing et sur les robots d'OpenAI. Une page absente de Bing n'apparaît pas dans ses réponses, d'où l'intérêt de Bing Webmaster Tools et d'IndexNow.

Bloquer GPTBot limite l'usage des contenus pour l'entraînement, mais bloquer OAI-SearchBot ou Bingbot rend le site invisible dans la recherche ChatGPT. Pour une entreprise qui veut être citée, l'accès ouvert est la règle ; le choix se fait robot par robot.

Non. C'est une convention proposée en 2024, sans engagement des grands moteurs. Elle est gratuite, rapide à produire et sans risque, ce qui justifie de la mettre en place, sans en attendre un effet garanti.

 Parlons de votre projet

Vous portez un projet de recherche innovation ? 
Vous cherchez un partenaire capable de faire vivre votre idée 
au-delà de la sphère scientifique ?

Quel mode de projet est le plus adapté ?