veilletech.fr
22 août Feed du jour
#06 CLOUDFLARE Article

Cloudflare synchronise votre robots.txt

Deux couches qui se contredisent, c'est une invitation à ne respecter ni l'une ni l'autre.

Bot Preference Sync génère le robots.txt d'un site à partir des préférences de robots IA déjà configurées chez Cloudflare, pour les catégories Search, Agent et Training. L'objectif est d'éliminer l'écart entre la préférence déclarée et la règle réellement appliquée, écart que certains crawlers utilisent comme prétexte.

3 min de lecturevidéo 1:19
Partager
Sommaire6 sections
  1. Ce qui se passe
  2. Le problème : deux couches qui divergent
  3. Ce que ça change vraiment
  4. Les valeurs par défaut
  5. La limite
  6. À retenir

Ce qui se passe

Cloudflare annonce Bot Preference Sync : votre fichier robots.txt est généré à partir de la configuration de robots IA que vous avez déjà posée dans le tableau de bord, pour les trois usages distingués depuis le 1er juillet 2026 — Search, Agent et Training.

La fonctionnalité vise tous les plans, du gratuit à l'Enterprise, et s'active ou se coupe à tout moment. Cloudflare annonce sa disponibilité générale « dans la semaine à venir ».

Le problème : deux couches qui divergent

Il existe deux façons de gérer le trafic des robots, et elles n'ont pas la même nature.

La première déclare une préférence en supposant la bonne foi du crawler : c'est robots.txt. La seconde applique un blocage en périphérie, via Bot Management. Entretenir les deux à la main est fastidieux, et elles finissent par se contredire — un robots.txt qui interdit un crawler que vos règles laissent en réalité passer.

C'est cette incohérence qui pose problème. Selon Cloudflare, quand la préférence déclarée et la règle appliquée divergent, certains crawlers y voient une base pour ignorer la préférence, voire pour tenter de contourner l'application.

Ce que ça change vraiment

Au-delà de la génération du fichier, l'annonce fixe surtout une condition d'entrée pour les crawlers à double usage — ceux qui mélangent recherche, usage agentique et entraînement derrière un seul user-agent.

Pour ne pas être bloqués quand un site refuse l'entraînement, les opérateurs de ces bots devront désormais remplir quatre exigences :

Les bots conformes sont suivis dans la section de transparence de Cloudflare Radar. Les autres restent bloqués dès que l'entraînement est refusé. La formule de Cloudflare résume la position : la transparence devient le prix d'entrée.

Les valeurs par défaut

Un point à connaître avant d'activer : la fonctionnalité est active par défaut pour tout nouveau client. Les clients existants qui utilisent l'ancien robots.txt géré seront invités à revoir et confirmer leurs préférences avant la bascule.

Cloudflare introduit aussi une valeur par défaut différente pour les éditeurs financés par la publicité. À l'intégration, une option « je monétise des pages avec de la publicité sur ce domaine » place Training en Disallow — rester dans l'index de recherche, sortir de l'entraînement. Pour les autres, aucun blocage n'est ajouté par défaut : le choix reste au client.

La limite

Deux, en réalité.

robots.txt reste déclaratif. Il ne bloque rien par lui-même. C'est la couche d'application, Bot Management, qui fait le travail. La synchronisation ne fait que mettre les deux d'accord — elle ne transforme pas une préférence en barrière.

La synchronisation raisonne par catégorie. Elle est conçue pour des décisions prises à l'échelle d'une catégorie de bots, pas au cas par cas, et ne lit pas vos règles personnalisées à logique complexe. Si vous avez un arrangement particulier avec un opérateur précis, il faut couper la synchronisation et maintenir le fichier vous-même.