Nouveau : Direction Marketing & IA 2027 Le kit de pilotage pour cadrer vos premiers projets IA en 90 jours. 29€
Découvrir le guide
Marketing DigitalSécurité

Cloudflare sépare recherche, entraînement et agents IA : les réglages à vérifier pour protéger vos contenus

Une nouvelle configuration permet de préserver le crawl de recherche tout en limitant l’entraînement des IA, avec des précautions pour Googlebot, Bingbot et Applebot.

Cloudflare a modifié le 15 septembre 2026 ses contrôles dédiés aux crawlers IA. Les propriétaires de sites peuvent désormais gérer séparément le crawl de recherche, l’entraînement des modèles et les agents IA qui visitent des pages pour le compte d’un utilisateur. La configuration demande une attention particulière : les réglages « Block » peuvent désormais bloquer des robots mixtes comme Googlebot, Bingbot et Applebot, avec un impact potentiel sur la visibilité de recherche.

Cloudflare remplace son ancien interrupteur « Block AI Bots » par trois catégories : Search, AI Training et AI Agents. Le changement apporte un niveau de contrôle plus précis, notamment grâce au nouveau paramètre « Disallow AI Training ». Cette option permet d’exprimer un refus d’entraînement IA tout en maintenant l’accès des crawlers mixtes reconnus pour l’indexation de recherche.

Pour les éditeurs, e-commerçants, responsables SEO et équipes marketing, la question porte sur la gestion des contenus publiés : quelles pages doivent rester accessibles aux moteurs ? Quels usages liés à l’entraînement accepter ? Faut-il autoriser des agents à consulter une page lorsqu’un utilisateur leur demande une information ou une action ?

À retenir : Cloudflare distingue désormais le crawl destiné à l’indexation, le crawl destiné à l’entraînement et l’accès d’agents IA. Le paramètre « Disallow AI Training » permet de continuer à être exploré pour la recherche tout en refusant l’entraînement par les crawlers concernés. Les réglages « Block » et « Block on pages with ads » peuvent bloquer des crawlers à usage mixte, y compris Googlebot, Bingbot et Applebot.

Cloudflare modifie ses réglages de crawl IA

Cloudflare a annoncé le 15 septembre 2026 une nouvelle architecture de contrôle pour les robots qui explorent les sites web. L’entreprise sépare les comportements en trois catégories : Search, Training et Agent. Cette distinction répond à une difficulté grandissante pour les propriétaires de sites : certains robots servent simultanément à construire un index de recherche et à collecter des données pour entraîner des modèles d’intelligence artificielle.

Cloudflare appelle ces robots des mixed-use crawlers, ou crawlers à usage mixte. Selon l’entreprise, ils représentent 36,6 % du trafic de crawlers vérifiés sur son réseau. Cloudflare indique aussi que moins de 1 % des sites clients bloquent les robots de recherche, tandis que 17 % utilisent au moins un mécanisme pour limiter l’entraînement IA. Ces données sont communiquées par Cloudflare et décrivent le comportement observé sur son propre réseau.

Le nouveau paramètre « Disallow AI Training » vise à éviter un arbitrage trop brutal. Il publie une préférence de refus de l’entraînement dans le fichier robots.txt grâce à Bot Preference Sync. Les crawlers à usage mixte identifiés par Cloudflare comme « Accountable » peuvent alors continuer à explorer le site à des fins de recherche, sous réserve de respecter cette préférence d’entraînement.

Un même crawler peut contribuer à la visibilité d’un site dans la recherche et collecter des contenus pour l’entraînement. Cloudflare propose désormais des réglages distincts pour gérer ces deux usages.

Search, Training et Agent : trois usages à distinguer

Les nouveaux réglages Cloudflare répondent à trois objectifs techniques différents. Les confondre peut conduire à une configuration qui ne correspond pas au modèle économique du site, à ses priorités SEO ou à ses règles de diffusion de contenu.

Catégorie Cloudflare Définition Conséquence possible pour un site
Search Exploration d’un site pour construire ou mettre à jour un index de recherche. Le crawl peut contribuer à la découverte et à l’indexation des pages dans des moteurs de recherche.
AI Training Exploration destinée à entraîner ou affiner un modèle d’intelligence artificielle. Le contenu peut être utilisé dans un processus d’entraînement, selon les règles déclarées par l’opérateur du crawler.
AI Agents Agent déclenché par un utilisateur qui consulte une page ou réalise une action pour son compte. L’agent peut accéder à une page sans qu’un visiteur humain ne consulte directement l’interface ou la publicité affichée.
Crawler mixte Robot utilisé à la fois pour la recherche et l’entraînement. Un blocage général peut empêcher le crawl de recherche et donc réduire la visibilité dans certains moteurs.

La catégorie Search concerne l’indexation et la découverte des pages. La catégorie Training concerne la collecte de contenus pour entraîner ou affiner des modèles. La catégorie Agent couvre les agents pilotés par un utilisateur, notamment les systèmes capables d’ouvrir une page, d’en extraire une information ou de réaliser une navigation à la demande.

Les agents IA ne posent pas exactement le même problème que les crawlers mixtes. Cloudflare indique qu’il n’existe pas encore de directive largement adoptée permettant d’exprimer un refus standardisé pour les agents. L’entreprise ne propose donc pas, à ce stade, d’équivalent de « Disallow AI Training » pour la catégorie Agent.

Point de vigilance : les réglages Search, Training et Agent s’appliquent au niveau du domaine. Une décision prise dans Cloudflare peut donc concerner l’ensemble d’une zone, avec des effets différents selon les pages, les contenus, les revenus publicitaires et les canaux d’acquisition.

Pourquoi Googlebot, Bingbot et Applebot demandent une attention particulière

Depuis le 15 septembre, Cloudflare indique que les options « Block » et « Block on pages with ads » s’appliquent aussi aux crawlers à usage mixte. Cette évolution concerne notamment Applebot, Bingbot et Googlebot. Un propriétaire de site qui choisit un blocage complet dans la catégorie Training peut désormais bloquer ces robots pour leurs usages de recherche et d’entraînement.

Cloudflare classe Apple, Google et Microsoft parmi les opérateurs « Accountable ». Cette désignation repose sur quatre critères : mécanisme permettant de refuser l’entraînement, moyen de refuser les résumés IA, visibilité au niveau des URL sur les usages de contenu et confirmation que le refus d’entraînement ne dégrade pas les résultats de recherche classiques.

Google permet aux propriétaires de sites d’exprimer un refus d’entraînement via la directive Google-Extended dans robots.txt. Cloudflare indique également que Google propose un contrôle dans son environnement webmaster pour gérer la présence dans les résultats génératifs. Google affirme que le refus de Google-Extended ne modifie pas le classement dans les résultats de recherche traditionnels.

Apple propose une préférence d’exclusion liée à Applebot-Extended. Microsoft propose actuellement des contrôles dans Bing Webmaster Tools et une préférence liée à la balise NOARCHIVE. Cloudflare précise que Bing prévoit de prendre en charge une préférence de refus d’entraînement dans robots.txt au niveau du domaine au début de 2027.

Précision sur Bing : Cloudflare indique que « Disallow AI Training » ne transmet pas encore automatiquement un refus d’entraînement à Bing via robots.txt. Les propriétaires de sites qui souhaitent exprimer ce choix auprès de Bing peuvent examiner les options disponibles dans Bing Webmaster Tools, dont les outils de blocage d’URL ou de retrait de contenu, selon leur situation.

Les réglages Cloudflare à connaître

Cloudflare présente quatre choix principaux pour gérer les crawlers destinés à l’entraînement. Chaque option produit un effet différent sur les crawlers spécialisés et sur les robots mixtes.

Réglage Effet annoncé par Cloudflare Usage possible Précaution principale
Allow Les crawlers sont autorisés, sauf règle distincte ou règle WAF. Site qui souhaite rester accessible à la recherche, à l’entraînement et aux agents. Vérifier que ce choix correspond aux règles internes de diffusion des contenus.
Disallow AI Training Cloudflare publie une préférence de refus de l’entraînement dans robots.txt. Les crawlers mixtes « Accountable » restent autorisés pour la recherche. Site qui veut préserver le crawl de recherche et limiter l’usage des contenus pour l’entraînement. Contrôler le comportement effectif de chaque opérateur et les limites associées à Bing.
Block on pages with ads Les crawlers sont bloqués sur les pages détectées comme diffusant de la publicité. Éditeur ou média qui cherche à protéger les pages dont la monétisation dépend de l’affichage publicitaire. Le réglage peut bloquer des crawlers mixtes et affecter la recherche sur les pages concernées.
Block Tous les crawlers sont bloqués, y compris les robots mixtes. Site qui souhaite interdire complètement l’accès d’une catégorie de bots. Le blocage de robots mixtes peut arrêter Googlebot, Bingbot et Applebot, recherche comprise.

Cloudflare précise que « Disallow AI Training » existe uniquement pour la catégorie Training. L’option fonctionne grâce à une directive publiée dans robots.txt. Une préférence équivalente pour les pages avec publicité serait plus difficile à exprimer dans ce fichier, car les pages qui diffusent des annonces peuvent varier rapidement.

Le paramètre « Block on pages with ads » répond à une logique économique particulière. Une page financée par l’affichage publicitaire génère des revenus lorsque la visite a lieu sur le site. Un agent qui récupère l’information sans afficher la page à un internaute, ou un système qui réutilise le contenu pour produire une réponse, peut réduire la part de trafic réellement monétisable pour certains éditeurs.

Quels réglages Cloudflare pour votre type de site ?

Cloudflare propose deux configurations recommandées pour les nouveaux domaines, selon que le site tire ou non des revenus de la publicité. Les réglages peuvent être modifiés à tout moment. La décision doit s’appuyer sur les objectifs de visibilité, le modèle économique, le type de contenu publié et les contraintes propres à chaque organisation.

Cloudflare recommande pour les nouveaux sites financés par la publicité : Search autorisé, AI Training réglé sur « Disallow AI Training » et AI Agents réglés sur « Block on pages with ads ». Cette configuration vise à préserver le crawl de recherche tout en limitant l’accès IA sur les pages publicitaires.

Un e-commerce ou un site B2B dépend souvent de la recherche organique, des pages produits, des fiches de services et des parcours de conversion. « Disallow AI Training » peut représenter un point de départ à étudier lorsque l’entreprise souhaite conserver la recherche tout en refusant l’entraînement. La décision doit être rapprochée des outils réellement utilisés par l’audience et des objectifs de visibilité.

Les contenus réservés, contractuels, confidentiels, payants ou à accès restreint demandent une protection spécifique. Les réglages de crawlers complètent les contrôles d’accès, les règles WAF, l’authentification et la gestion des droits. Un audit technique est utile avant toute modification de configuration.

Pour les sites existants, Cloudflare indique que les préférences sont migrées automatiquement vers les nouveaux contrôles. Les domaines qui n’avaient jamais configuré les catégories Search, Training et Agent seront migrés selon leur ancien réglage « Block AI Bots ». Une ancienne configuration de blocage ou de blocage sur pages avec publicité devient, selon Cloudflare, Search autorisé, Training réglé sur « Disallow AI Training » et Agent réglé sur « Block on pages with ads ».

Un audit après migration reste recommandé. Les réglages hérités peuvent répondre à une décision prise dans un contexte technique différent. La configuration actuelle doit être revue avec les objectifs SEO, les revenus publicitaires, les règles de diffusion et l’usage de solutions d’IA par l’entreprise.

Cloudflare, GEO et visibilité dans les moteurs de réponse IA

Les contrôles Cloudflare interviennent à un moment où les marques cherchent à comprendre leur présence dans les assistants et moteurs de réponse. Notre article sur Profound et le marché du GEO montre que les outils de suivi des mentions, des citations et des sources utilisées par les assistants IA attirent désormais des investissements significatifs.

Le contrôle de l’accès aux contenus doit être envisagé avec une logique de gouvernance. Un site peut vouloir conserver l’indexation classique pour générer du trafic, limiter l’entraînement de modèles sur ses contenus originaux et examiner séparément la place des agents IA. Les choix peuvent varier selon les sections du site, le type de public, la valeur des contenus et les objectifs de revenus.

Le GEO repose sur des contenus clairs, structurés, fiables et régulièrement mis à jour. Notre guide consacré au GEO, au SEO et à la recherche générative détaille ces principes. Cloudflare apporte une couche supplémentaire : la capacité de déclarer et d’appliquer des préférences sur les usages autorisés pour les crawlers identifiés.

Un e-commerçant doit porter une attention particulière au crawl de recherche. Ses fiches produits, ses données de disponibilité, ses prix, ses politiques de livraison et ses pages de catégories peuvent participer à la découverte de son offre dans des parcours de recherche et de shopping. L’article sur Google AI Mode et Gemini explique pourquoi un catalogue clair, exact et accessible représente une base importante pour les assistants dédiés au commerce.

Une méthode en cinq étapes pour auditer vos réglages

La modification de ces contrôles doit réunir les personnes qui pilotent le site, le référencement, les contenus, l’infrastructure et, selon le cas, la monétisation publicitaire. Une décision prise par une seule équipe peut avoir des effets sur les autres canaux d’acquisition ou de revenus.

1. Cartographiez vos contenus et vos revenus

Identifiez les pages qui dépendent de la publicité, les contenus stratégiques, les pages produits, les ressources réservées, les zones authentifiées et les contenus à forte valeur éditoriale.

2. Relevez les réglages Cloudflare actuels

Documentez les paramètres Search, Training et Agent par domaine. Vérifiez les règles WAF, les configurations robots.txt, les exceptions historiques et les contrôles appliqués par des prestataires.

3. Analysez votre dépendance à la recherche

Consultez Google Search Console, Bing Webmaster Tools, vos outils analytics et vos rapports d’acquisition. Identifiez les pages qui génèrent du trafic, des demandes, des ventes ou des revenus publicitaires.

4. Choisissez une préférence cohérente

Définissez la position de l’entreprise sur l’entraînement, les agents et les robots mixtes. Documentez la décision, la personne responsable, les effets attendus et les conditions de révision.

5. Contrôlez les effets après modification

Suivez l’exploration, l’indexation, le trafic organique, les erreurs de crawl, les impressions, les revenus publicitaires et les indicateurs commerciaux après la mise à jour.

    Checklist de décision pour les équipes marketing et web

    • Vérifiez si le domaine a été migré vers les nouveaux réglages Cloudflare.
    • Contrôlez les paramètres Search, AI Training et AI Agents avant toute modification.
    • Évitez d’utiliser « Block » sur Training sans mesurer l’effet possible sur Googlebot, Bingbot et Applebot.
    • Documentez les pages financées par la publicité et les contenus à forte valeur éditoriale.
    • Vérifiez la présence des préférences adaptées dans robots.txt et dans les outils webmaster concernés.
    • Associez les décisions de crawl à vos données SEO, analytics, conversion et monétisation.
    • Planifiez une revue périodique, car les contrôles Cloudflare et les engagements des opérateurs évoluent.

    Les agents IA demandent une gouvernance spécifique

    Les agents IA peuvent ouvrir une page, lire une information, comparer des offres ou accomplir certaines actions à la demande d’un utilisateur. Cette catégorie recouvre des usages différents du crawl destiné à construire un index ou à entraîner un modèle. Une entreprise peut ainsi choisir une politique dédiée aux agents, selon les pages et les services qu’elle souhaite exposer.

    Les organisations qui proposent des espaces clients, des formulaires, des devis, des réservations, des paniers ou des interfaces de compte doivent examiner les conséquences de cette navigation automatisée. Le contrôle des agents complète les protections liées à l’authentification, aux permissions, aux limites de requêtes, aux règles WAF et à la journalisation.

    Ces principes rejoignent les recommandations de notre guide sur les agents IA connectés au CRM et la protection des données. Les droits d’accès doivent correspondre à une finalité précise, les actions importantes doivent rester traçables et les équipes doivent prévoir une intervention humaine lorsqu’une décision engage une relation commerciale, des données personnelles ou une dépense.

    Les assistants conversationnels prennent également une place croissante dans les parcours de découverte et de publicité. Notre article sur Amazon Ads dans ChatGPT montre comment les environnements conversationnels peuvent devenir des surfaces de recommandation et de visibilité. Les propriétaires de sites ont donc intérêt à suivre les règles d’accès de leurs contenus, les sources utilisées par les assistants et les trajectoires réellement suivies par leur audience.


    FAQ : Cloudflare et les crawlers IA

    Qu’est-ce qu’un crawler IA ?

    Un crawler IA est un robot qui explore des pages web. Selon son comportement, il peut contribuer à un index de recherche, collecter des contenus pour entraîner ou affiner un modèle, ou visiter une page pour le compte d’un utilisateur via un agent IA.

    Que change Cloudflare depuis le 15 septembre 2026 ?

    Cloudflare remplace son ancien réglage « Block AI Bots » par trois contrôles distincts : Search, AI Training et AI Agents. Les options « Block » et « Block on pages with ads » s’appliquent désormais aux crawlers mixtes, dont Googlebot, Bingbot et Applebot.

    Qu’est-ce que Disallow AI Training ?

    Disallow AI Training est un réglage Cloudflare qui publie une préférence de refus de l’entraînement dans robots.txt. Les crawlers mixtes reconnus comme Accountable peuvent rester autorisés pour la recherche, tandis que les crawlers dédiés uniquement à l’entraînement sont bloqués.

    Le réglage Block peut-il bloquer Googlebot ?

    Oui. Cloudflare indique que depuis le 15 septembre 2026, les réglages « Block » et « Block on pages with ads » peuvent bloquer les crawlers mixtes, y compris Googlebot, Bingbot et Applebot. Cette décision peut donc affecter le crawl lié à la recherche.

    Comment préserver le SEO tout en refusant l’entraînement IA ?

    Cloudflare recommande le réglage « Disallow AI Training » pour la catégorie Training lorsque l’objectif est de préserver le crawl de recherche tout en exprimant un refus d’entraînement. Vérifiez également les contrôles proposés par Google, Bing et Apple, ainsi que votre configuration robots.txt.

    Cloudflare bloque-t-il automatiquement tous les crawlers IA ?

    Non. Cloudflare propose des réglages distincts et des configurations recommandées qui varient selon le modèle économique du site. Les propriétaires peuvent modifier leurs préférences à tout moment dans les paramètres de sécurité associés à leur domaine.

    Pourquoi les pages avec publicité reçoivent-elles un traitement particulier ?

    Cloudflare explique qu’un site financé par la publicité dépend généralement de visites humaines pour générer des revenus. Un agent IA qui récupère une information sans afficher la page à un visiteur peut modifier ce modèle. Cloudflare propose donc des réglages plus restrictifs pour les pages qui diffusent des annonces.


    Ce qu’il faut retenir

    Cloudflare apporte une séparation claire entre crawl de recherche, entraînement IA et navigation par agents. La nouveauté la plus importante est « Disallow AI Training », un réglage conçu pour laisser les crawlers mixtes identifiés continuer à indexer un site pour la recherche tout en respectant un refus d’entraînement.

    Les équipes SEO et marketing doivent vérifier leurs paramètres Cloudflare après le changement du 15 septembre 2026. Les options « Block » et « Block on pages with ads » peuvent désormais concerner Googlebot, Bingbot et Applebot. Une décision de blocage peut donc influencer l’exploration de recherche, les impressions, le trafic organique et les parcours de découverte.

    Une gouvernance utile associe les choix techniques à des objectifs commerciaux clairs : préserver l’indexation, protéger les contenus originaux, gérer les pages publicitaires, sécuriser les espaces sensibles et suivre les évolutions des assistants IA. Un audit régulier des réglages, des logs, des données SEO et des sources de trafic permet d’ajuster cette stratégie à mesure que les standards évoluent.

    Sources et pour aller plus loin

    Afficher plus

    Damien LADURELLE

    Après un long moment en tant que gérant d'une agence web & communication à Lille, j'ai rejoint les rangs de l'entreprise au poste de Directeur Marketing et Communication dans une holding. Aujourd'hui, j'accompagne TPE & PME dans leur croissance digitale grâce notamment à l'aide des dernières innovations technologiques. Toujours à la recherche de nouvelles façons de se démarquer, d'innover, de dépasser les barrières du "casual".

    Laisser un commentaire

    Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

    Bouton retour en haut de la page