Un nouveau fichier fait beaucoup parler depuis deux ans. Voici ce qu’il fait réellement, ce qu’il ne fait pas, et les réglages qui comptent vraiment.
Depuis l’arrivée des moteurs génératifs, une question revient systématiquement : faut-il ajouter un fichier llms.txt à son site ? Et plus largement, comment décide-t-on de ce que les IA ont le droit de lire ?
Réponse courte : llms.txt est peu coûteux et sans risque, mais son effet reste incertain ; robots.txt, lui, a un effet immédiat et concret. Voici le détail.
Ce qu’est llms.txt
C’est une proposition de convention, apparue en 2024 : un fichier Markdown placé à la racine du site (/llms.txt) qui présente le site de façon condensée et oriente vers les pages importantes. L’idée est de donner à un modèle une carte lisible, plutôt que de le laisser explorer une navigation complexe.
Un fichier type ressemble à ceci :
# Nom de l'entreprise
> Une phrase décrivant l'activité, la zone géographique et les clients servis.
## Services
- [Création de sites internet](https://exemple.fr/sites/) : ce que couvre la prestation.
- [Référencement naturel](https://exemple.fr/seo/) : ce que couvre la prestation.
## Ressources
- [Guide des tarifs](https://exemple.fr/tarifs/)
- [Questions fréquentes](https://exemple.fr/faq/)
## Contact
- Adresse, téléphone, email, zone d'intervention.
Est-ce que ça marche ?
Soyons précis, parce que le sujet est saturé d’affirmations non vérifiées : aucun des grands fournisseurs de modèles n’a officiellement annoncé utiliser llms.txt comme signal de référencement. La convention est communautaire, pas standardisée.
Faut-il en mettre un pour autant ? Oui, pour trois raisons pragmatiques :
- Le coût est d’une heure de travail, et le risque est nul.
- L’exercice force à formuler clairement ce que fait l’entreprise et quelles sont ses pages importantes — ce qui bénéficie au site entier.
- Si la convention s’installe, vous serez en place.
En revanche, méfiez-vous de tout prestataire qui vous vend un llms.txt comme un levier de positionnement. Ce n’en est pas un aujourd’hui.
robots.txt : là, l’effet est réel
C’est le fichier qui compte vraiment. Les principaux agents d’IA le respectent, et votre configuration actuelle décide déjà de votre visibilité — souvent à votre insu, car certains thèmes, extensions de sécurité ou hébergeurs ajoutent des directives par défaut.
Les agents à connaître :
GPTBot— collecte pour l’entraînement d’OpenAI.OAI-SearchBot— indexation pour la recherche dans ChatGPT.ChatGPT-User— consultation en direct quand un utilisateur pose une question.PerplexityBot— indexation de Perplexity.ClaudeBot/Claude-User— Anthropic.Google-Extended— contrôle l’usage pour les modèles de Google, sans affecter le classement dans la recherche.Applebot-Extended— équivalent chez Apple.CCBot— Common Crawl, source indirecte de nombreux jeux de données.
Le choix stratégique
Il se résume à une question : votre contenu est-il un argument commercial ou un produit ?
Site vitrine, agence, artisan, commerce, cabinet, industriel : autorisez tout. Vous voulez être lu, cité et recommandé. Bloquer revient à retirer son enseigne.
Éditeur, média, formation en ligne, base de données payante : l’arbitrage est réel. Une approche fréquente consiste à bloquer les agents d’entraînement tout en autorisant ceux qui citent avec un lien.
Exemple pour un site qui veut être visible :
User-agent: *
Allow: /
Sitemap: https://exemple.fr/sitemap_index.xml
Vérifiez simplement qu’aucune ligne Disallow ciblant un agent d’IA n’a été ajoutée automatiquement. C’est une vérification de deux minutes que très peu de sites ont faite.
Ce qui compte bien plus que ces deux fichiers
Il serait dommage de passer une journée sur llms.txt et d’ignorer les vrais facteurs de citabilité :
- Du contenu présent dans le HTML servi. Un texte injecté par JavaScript après chargement risque de n’être jamais lu. Sur les sites construits avec des constructeurs de pages lourds, c’est le premier point à vérifier : affichez le code source et cherchez votre texte.
- Des réponses courtes et extractibles placées juste sous les titres.
- Des données structurées propres :
Organization,LocalBusiness,Service,FAQPage,Article. - Un sitemap à jour et des pages rapides.
- Une information factuelle et datée : chiffres, délais, fourchettes de prix, zones couvertes.
- Des mentions sur des sources tierces — c’est souvent de là que vient la citation, pas de votre site.
Une checklist d’une heure
- Ouvrez
votresite.fr/robots.txtet vérifiez qu’aucun agent d’IA n’est bloqué sans décision de votre part. - Affichez le code source d’une page importante et vérifiez que votre texte s’y trouve bien.
- Testez vos données structurées avec l’outil de test des résultats enrichis de Google.
- Rédigez un
llms.txtde trente lignes et déposez-le à la racine. - Créez votre compte Bing Webmaster Tools et soumettez votre sitemap — ChatGPT s’appuie largement sur cet index.
- Posez dix questions types aux assistants et notez qui est cité.
Questions fréquentes
llms.txt remplace-t-il le sitemap ?
Non. Le sitemap reste le fichier de référence pour les moteurs de recherche. Les deux coexistent.
Bloquer les IA protège-t-il mon contenu ?
Partiellement. Les agents qui respectent robots.txt s’abstiendront, mais votre contenu peut être repris par d’autres voies, notamment s’il est cité ailleurs sur le web.
Est-ce que bloquer Google-Extended affecte mon référencement ?
Non, cet agent ne concerne que l’usage pour les modèles génératifs, pas le classement dans la recherche Google.
Faut-il mettre à jour llms.txt souvent ?
Deux fois par an suffit, ou à chaque changement significatif de vos offres.
La bonne hiérarchie
Vérifiez robots.txt aujourd’hui, ajoutez llms.txt quand vous avez une heure, et consacrez le reste de votre énergie à ce qui détermine vraiment les citations : des contenus factuels, structurés et réellement utiles. Notre guide GEO détaille cette méthode.
Pour savoir où vous en êtes, notre audit gratuit inclut la vérification de ces réglages.
