Ce qui se passe
Le compromis était connu de tous ceux qui publient : accepter que son contenu entraîne des modèles, ou risquer de sortir des moteurs de recherche. Il tient à une réalité technique — les crawlers à double usage, un seul robot qui alimente à la fois l'index de recherche et l'entraînement. Refuser l'un revenait à refuser l'autre.
Cloudflare a introduit le 15 septembre 2026 un réglage Disallow AI Training qui sépare les deux. Apple, Google et Microsoft le respectent ou se sont engagés à le respecter dans un délai annoncé.
Pourquoi un fichier texte ne suffisait pas
Un robots.txt exprime une préférence. Il ne peut ni identifier qui passe, ni
déterminer pourquoi, ni arrêter celui qui l'ignore. Un réseau, lui, le peut :
Cloudflare publie la préférence, identifie le visiteur, classe son comportement,
bloque ceux qui passent outre, et publie ce que fait chaque opérateur sur
Radar.
Les chiffres justifient l'effort : moins de 1 % des sites Cloudflare choisissent de bloquer les robots de recherche, mais 17 % activent un mécanisme de blocage de l'entraînement. La demande porte sur l'un, pas sur l'autre.
Les quatre réglages
Trois comportements sont distingués — Search (indexation), Training (entraînement ou fine-tuning), Agent (agent lancé par un humain) — et se règlent au niveau du domaine :
| Réglage | Effet |
|---|---|
| Allow | tout passe, sauf blocage par une autre règle ou le WAF |
| Disallow AI Training | publie la directive Disallow: dans robots.txt. Les crawlers mixtes Accountable restent autorisés pour la recherche ; tous les autres crawlers d'entraînement sont bloqués, y compris ceux d'Amazon, Anthropic, Meta et OpenAI |
| Block on pages with ads | blocage limité aux pages détectées comme portant une publicité |
| Block | blocage total, crawlers mixtes compris |
Disallow AI Training n'existe que pour le comportement Training : ni pour
Search, ni pour Agent. Pour ces derniers, aucune directive établie n'existe
encore côté agents — Cloudflare dit attendre la maturation de standards comme
ai-prefs.
La désignation « Accountable »
Pour y prétendre, un opérateur doit remplir ou s'engager à remplir quatre exigences :
- un mécanisme d'opt-out de l'entraînement, par
robots.txtou équivalent ; - un mécanisme d'opt-out des résumés IA chez l'opérateur — et l'an prochain depuis Cloudflare, avec l'objectif de doser quelle part du contenu y entre ;
- une visibilité au niveau de l'URL sur les pages rendues disponibles pour l'entraînement, plus des métriques sur leur apparition en recherche ;
- la garantie qu'un refus d'entraînement n'affecte pas les résultats de recherche classiques.
Apple, Google et Microsoft satisfont ces critères, en combinant des capacités livrées et des engagements datés.
Ce qui change pour un site déjà configuré
C'est le point à vérifier aujourd'hui :
- Block et Block on pages with ads s'appliquent désormais aussi aux crawlers mixtes — Applebot, Bingbot, Googlebot. Choisir Block coupe donc le référencement en même temps que l'entraînement. Pour couper l'entraînement en restant indexé, il faut Disallow AI Training ;
- Block AI Bots est déprécié au profit des contrôles Search / Training / Agent ;
- Managed Robots.txt est déprécié au profit de Bot Preference Sync ;
- les réglages existants sont migrés automatiquement : un ancien Block devient Search = Allow et Training = Disallow AI Training.
Dans la quasi-totalité des cas, il n'y a rien à faire : les préférences sont reportées. L'attention porte sur ceux qui voulaient réellement bloquer les crawlers mixtes — désormais, il faut le dire explicitement.
À retenir
Le fond du sujet n'est pas le réglage, c'est le fait qu'une préférence d'utilisation devienne vérifiable. Tant que « ne pas entraîner sur mon contenu » n'était qu'une ligne de texte, l'obéissance relevait du volontariat.