Ce qui se passe
Cloudflare annonce Bot Preference Sync : votre fichier robots.txt est
généré à partir de la configuration de robots IA que vous avez déjà posée dans
le tableau de bord, pour les trois usages distingués depuis le 1er juillet
2026 — Search, Agent et Training.
La fonctionnalité vise tous les plans, du gratuit à l'Enterprise, et s'active ou se coupe à tout moment. Cloudflare annonce sa disponibilité générale « dans la semaine à venir ».
Le problème : deux couches qui divergent
Il existe deux façons de gérer le trafic des robots, et elles n'ont pas la même nature.
La première déclare une préférence en supposant la bonne foi du crawler :
c'est robots.txt. La seconde applique un blocage en périphérie, via Bot
Management. Entretenir les deux à la main est fastidieux, et elles finissent par
se contredire — un robots.txt qui interdit un crawler que vos règles laissent
en réalité passer.
C'est cette incohérence qui pose problème. Selon Cloudflare, quand la préférence déclarée et la règle appliquée divergent, certains crawlers y voient une base pour ignorer la préférence, voire pour tenter de contourner l'application.
Ce que ça change vraiment
Au-delà de la génération du fichier, l'annonce fixe surtout une condition d'entrée pour les crawlers à double usage — ceux qui mélangent recherche, usage agentique et entraînement derrière un seul user-agent.
Pour ne pas être bloqués quand un site refuse l'entraînement, les opérateurs de ces bots devront désormais remplir quatre exigences :
- respecter une préférence « pas d'entraînement » exprimée dans
robots.txt, par quelque mécanisme que ce soit ; - offrir aux propriétaires de sites un moyen de sortir des résumés IA ;
- fournir une visibilité au niveau de l'URL sur les pages mises à disposition pour l'entraînement, ainsi que des métriques sur les résultats de recherche ;
- démontrer publiquement que refuser l'entraînement ne dégrade pas le référencement traditionnel.
Les bots conformes sont suivis dans la section de transparence de Cloudflare Radar. Les autres restent bloqués dès que l'entraînement est refusé. La formule de Cloudflare résume la position : la transparence devient le prix d'entrée.
Les valeurs par défaut
Un point à connaître avant d'activer : la fonctionnalité est active par défaut
pour tout nouveau client. Les clients existants qui utilisent l'ancien
robots.txt géré seront invités à revoir et confirmer leurs préférences avant la
bascule.
Cloudflare introduit aussi une valeur par défaut différente pour les éditeurs financés par la publicité. À l'intégration, une option « je monétise des pages avec de la publicité sur ce domaine » place Training en Disallow — rester dans l'index de recherche, sortir de l'entraînement. Pour les autres, aucun blocage n'est ajouté par défaut : le choix reste au client.
La limite
Deux, en réalité.
robots.txt reste déclaratif. Il ne bloque rien par lui-même. C'est la
couche d'application, Bot Management, qui fait le travail. La synchronisation ne
fait que mettre les deux d'accord — elle ne transforme pas une préférence en
barrière.
La synchronisation raisonne par catégorie. Elle est conçue pour des décisions prises à l'échelle d'une catégorie de bots, pas au cas par cas, et ne lit pas vos règles personnalisées à logique complexe. Si vous avez un arrangement particulier avec un opérateur précis, il faut couper la synchronisation et maintenir le fichier vous-même.