Aller au contenu

SEO

llms.txt en 2026 : utilité, limites et méthode de test sans promesse GEO

Le statut réel de /llms.txt, ce que Google et OpenAI documentent, sa différence avec robots.txt et un protocole pour décider sans promesse GEO.

Par
Ghezali Naim
Date de publication
Temps de lecture
10 min de lecture
Composition éditoriale abstraite sur les données, l’IA et l’automatisation pour l’article « llms.txt en 2026 : utilité, limites et méthode de test sans promesse GEO ».

Réponse en bref

/llms.txt est une proposition de fichier Markdown qui présente un site ou une documentation et renvoie vers des ressources utiles aux agents qui choisissent de le lire. Ce n’est ni un standard IETF, ni un contrôle d’exploration, ni une garantie de citation. Google Search indique explicitement, dans sa documentation mise à jour le 10 juillet 2026, qu’il ignore llms.txt : le fichier n’aide ni ne pénalise le classement, y compris dans les fonctionnalités génératives de Google. Il peut rester utile pour un agent ou un système qui déclare l’exploiter, ou comme index documentaire maintenu. La décision raisonnable est donc un test réversible, suivi dans les logs, après avoir corrigé indexation, contenu et architecture.

Le statut de llms.txt : une proposition technique, pas une norme universelle

La version 2 de la proposition llms.txt a été modifiée le 10 août 2026. Son auteur, Jeremy Howard, propose un fichier Markdown à la racine d’un site ou dans un sous-chemin. Le fichier contient au minimum un H1, puis peut ajouter un résumé, du contexte et des listes de liens vers des ressources détaillées, notamment des versions Markdown.

Ce sont des faits sur la proposition. Ils ne démontrent pas que chaque crawler, moteur ou assistant recherche le fichier, le suit, l’utilise pour le retrieval ou lui attribue un poids.

Ce qui est établi, recommandé ou encore hypothétique au 15 août 2026.
Niveau de preuveÉnoncéConséquence
Fait vérifiéllmstxt.org publie une proposition v2 avec un format Markdown et des liens vers des ressources.Vous pouvez implémenter un fichier conforme à cette proposition.
Fait vérifiéGoogle Search déclare ignorer llms.txt pour Search et ses fonctions d’IA générative.Ne le budgétez pas comme levier de classement Google.
Fait vérifiéOpenAI documente OAI-SearchBot et GPTBot via robots.txt, avec des usages distincts.Gérez accès à la recherche et entraînement selon la documentation du crawler, pas via llms.txt.
ObservationAnthropic publie un fichier llms.txt pour sa propre documentation développeur.Cela prouve une publication réelle, pas l’usage universel du fichier par Claude ou un moteur.
Recommandation Seven GoldTraiter le fichier comme une couche documentaire facultative et réversible.Le faire seulement si son maintien a un propriétaire et un coût faible.
Hypothèse à testerUn agent qui connaît le fichier pourrait trouver plus vite les bonnes ressources.Observer requêtes serveur et parcours de récupération ; ne pas annoncer un gain avant preuve.

Google est clair : llms.txt n’est pas un signal Google Search

Dans son guide officiel sur les fonctionnalités d’IA générative, mis à jour le 10 juillet 2026, Google écrit que Search n’utilise pas llms.txt. Créer et maintenir ce fichier pour un autre service n’aide ni ne dégrade la visibilité ou les classements Google.

Cette position corrige deux raccourcis :

  • un fichier accessible et indexable n’est pas forcément traité comme un signal spécial ;
  • une tactique dite “GEO” ne s’applique pas automatiquement à Google AI Overviews ou AI Mode.

Pour Google, la priorité reste une structure technique claire, des pages indexables, un contenu utile et original, puis la mesure dans Search Console. Le fichier llms.txt ne compense pas une page faible, du contenu dupliqué ou une architecture inaccessible.

Cette règle concerne Google Search. Elle ne permet pas de conclure que tous les autres agents ignorent le fichier.

Découverte, crawl, entraînement, retrieval et citation : cinq étapes différentes

Beaucoup de promesses autour de llms.txt mélangent des mécanismes qui n’ont pas la même fonction.

Un signal observé à une étape ne prouve pas les suivantes.
ÉtapeQuestionCe que llms.txt peut éventuellement faireCe qu’il ne prouve pas
DécouverteLe système connaît-il l’URL ?Offrir une URL conventionnelle si le système la recherche ou la reçoit.Que le système viendra la consulter.
CrawlLe système peut-il récupérer la ressource ?Présenter des liens publics dans un format simple.Que les règles d’accès sont respectées ou que toutes les pages seront explorées.
EntraînementLe contenu peut-il servir à entraîner un modèle ?Rien de normatif : la proposition n’est pas un mécanisme d’opt-in ou d’opt-out.Une inclusion ou une exclusion d’entraînement.
RetrievalUn agent sélectionne-t-il ce contenu pour répondre maintenant ?Aider un agent compatible à choisir une ressource plus ciblée.Que cette ressource sera jugée pertinente ou exacte.
CitationLe site apparaît-il dans la réponse ?Aucun effet garanti.Classement, visibilité, clic ou conversion.

La vraie question n’est donc pas “le fichier existe-t-il ?”, mais “quel système le récupère, dans quel contexte, puis que fait-il des liens ?”.

llms.txt ne remplace ni robots.txt ni une sécurité d’accès

Le RFC 9309 normalise le Robots Exclusion Protocol. Le fichier robots.txt exprime des règles allow et disallow pour des crawlers conformes. Le RFC précise aussi qu’il ne s’agit pas d’une autorisation d’accès ni d’une protection de sécurité.

llms.txt a une autre fonction : présenter du contexte et des liens. Il n’autorise pas, ne bloque pas et ne protège pas une ressource.

Comparaison de robots.txt, sitemap.xml et llms.txt selon rôle, statut et erreur à éviter.
Trois fichiers, trois rôles.
FichierRôleStatutErreur à éviter
robots.txtExprimer les règles d’exploration aux crawlers conformes.Protocole normalisé par le RFC 9309.Le traiter comme une authentification ou y exposer des chemins confidentiels.
sitemap.xmlLister des URL destinées aux moteurs qui acceptent ce protocole.Mécanisme SEO existant, distinct de llms.txt.Supposer qu’une URL listée sera indexée ou classée.
llms.txtPrésenter un contexte et des ressources à des agents compatibles.Proposition technique v2.Le vendre comme contrôle de crawl ou signal GEO universel.

OpenAI : les contrôles documentés passent par robots.txt

La documentation officielle des crawlers OpenAI distingue notamment :

  • OAI-SearchBot, utilisé pour faire apparaître des sites dans les fonctions de recherche de ChatGPT ;
  • GPTBot, utilisé pour collecter du contenu susceptible de contribuer à l’entraînement des modèles fondamentaux ;
  • ChatGPT-User, utilisé pour certaines actions déclenchées par un utilisateur et non pour déterminer l’apparition dans Search.

OpenAI documente des règles robots.txt séparées pour OAI-SearchBot et GPTBot. La page ne présente pas llms.txt comme un signal de visibilité ChatGPT Search. C’est la limite à retenir.

De son côté, Anthropic expose un llms.txt public pour sa documentation. C’est un exemple d’éditeur qui publie le format. Ce n’est pas une preuve que Claude consultera le llms.txt de votre entreprise, encore moins qu’il la citera.

Arbre de décision : utile, optionnel ou à différer ?

Utile comme test

Le fichier mérite un test si :

  • vous exploitez une documentation, une base de connaissances ou un corpus expert profond ;
  • les ressources prioritaires sont stables, publiques et disponibles dans un format propre ;
  • un agent que vous contrôlez ou un service ciblé sait explicitement utiliser ce point d’entrée ;
  • les logs serveur permettent de distinguer la récupération du fichier et des liens associés ;
  • une personne maintient le fichier lorsque les URL, versions ou priorités changent.

Optionnel

Le fichier est optionnel pour un site éditorial bien structuré, si le coût de génération et de maintenance est faible. Il peut alors jouer le rôle d’index documentaire supplémentaire. Son intérêt reste une hypothèse tant qu’aucun usage n’est observé.

À différer

Différez-le si vos pages importantes ne sont pas indexables, si les contenus ne répondent pas clairement aux intentions, si la marque manque de preuves ou si personne ne peut analyser les logs. Dans ce cas, le fichier ajoute une surface à maintenir sans traiter le goulot.

Structure minimale conforme à la proposition

La version 2 n’exige qu’un H1. Une structure utile reste courte et oriente vers les ressources qui méritent vraiment d’être récupérées.

# Nom du site

> Description factuelle du site, de son public et de son périmètre.

## Ressources principales
- [Service principal](https://example.com/service.md): périmètre et limites
- [Documentation](https://example.com/docs/index.md): point d’entrée technique
- [FAQ](https://example.com/faq.md): réponses maintenues

## Optional
- [Archives](https://example.com/archives.md): contenu secondaire

Évitez les slogans, les listes infinies et les claims non sourcés. Ne référencez aucune URL privée ou confidentielle. Le fichier est public.

Recommandation Seven Gold : générez-le depuis une source de vérité lorsque c’est possible, puis contrôlez liens, codes HTTP, canonical et date de mise à jour. Un fichier manuel oublié devient rapidement une carte erronée.

Protocole de test sans confondre corrélation et effet

  1. Définissez l’hypothèse. Exemple : un agent ciblé récupérera le fichier puis une ressource prioritaire plus souvent qu’avant.
  2. Fixez la fenêtre avant le déploiement. Basez-la sur votre fréquence de crawl et votre volume de logs ; n’inventez pas une durée universelle.
  3. Conservez une baseline. Requêtes aux pages cibles, agents identifiés, citations observées et trafic référent.
  4. Déployez un fichier court. Servez une réponse 200, testez les liens et n’ajoutez que des ressources publiques à jour.
  5. Vérifiez l’identité du crawler. Un nom de user-agent seul peut être usurpé ; utilisez les méthodes et plages publiées par le fournisseur lorsqu’elles existent.
  6. Observez le parcours. Une requête vers llms.txt, puis vers un lien associé, est plus informative qu’un simple hit isolé.
  7. Mesurez séparément la sortie. Citation, clic, lead ou usage par l’agent. Une récupération ne prouve pas une visibilité.
  8. Décidez. Maintenir si un usage utile est observé à coût faible ; corriger si le fichier est consulté mais obsolète ; retirer si aucune cible ne l’utilise et que sa maintenance crée du risque.

Un test sans groupe de contrôle parfait peut produire un signal opérationnel, pas une preuve causale universelle. Consignez les changements de contenu, d’indexation et de plateforme pendant la période.

Ce qui reste prioritaire pour le SEO et le GEO

  • des pages indexables et techniquement accessibles ;
  • une réponse directe, des sources et une date de mise à jour ;
  • une entité de marque cohérente et des preuves tierces authentiques ;
  • des contenus originaux qui aident réellement une décision ;
  • le suivi de Search Console, des logs, des citations et des conversions.

Pour comprendre les différences de périmètre entre optimisation des moteurs de recherche et moteurs de réponse, consultez notre comparatif GEO vs AEO.

Le verdict : faible coût, faible certitude, priorité conditionnelle

llms.txt est une décision réversible. Pour une documentation riche ou un agent ciblé, un test peut être rationnel. Pour Google Search, le verdict officiel est déjà connu : le fichier est ignoré.

Avant d’ajouter un nouveau fichier, vérifiez ce qui limite réellement votre visibilité SEO et IA. Seven Gold peut auditer le crawl, les contenus citables et les signaux de marque via notre accompagnement SEO.

Sources primaires et officielles

Ce que cela change dans un système de croissance

Un levier isolé produit rarement un résultat durable. La valeur vient de la cohérence entre stratégie, acquisition, conversion et mesure.

Questions fréquentes

Google utilise-t-il llms.txt pour le SEO ou les AI Overviews ?
Non. Dans sa documentation mise à jour le 10 juillet 2026, Google Search indique qu’il ignore llms.txt, y compris pour ses fonctionnalités d’IA générative. Créer le fichier pour un autre service n’aide ni ne pénalise les classements Google. Les fondamentaux SEO, l’indexabilité et les contenus utiles restent prioritaires.
Quelle différence entre llms.txt et robots.txt ?
robots.txt suit le Robots Exclusion Protocol normalisé par le RFC 9309 et exprime des règles d’exploration pour les crawlers conformes. llms.txt est une proposition de fichier Markdown qui présente du contexte et des liens. Aucun des deux ne remplace une authentification ou une protection de sécurité.
Comment tester si un agent utilise réellement llms.txt ?
Déployez un fichier court, conservez une baseline et surveillez les requêtes serveur vers le fichier puis vers les ressources liées. Vérifiez l’identité du crawler avec les méthodes publiées par le fournisseur. Mesurez séparément récupération, citation, trafic et conversion : un accès au fichier ne prouve ni classement ni impact GEO.

Passer de la lecture à la décision.

Un diagnostic permet de situer votre marketing, d’identifier les points de friction et d’arbitrer les priorités.

Demander un diagnostic