Cloudflare et les robots d’IA : ce qui change

Cloudflare remplace le bouton « bloquer les robots d’IA » par trois réglages. Pour une agence, en fermer un de trop, c’est disparaître des réponses de ChatGPT.

J’ai reçu mardi le mail que Cloudflare envoie à tous ses clients. Cloudflare, c’est le service qui se met devant un site pour filtrer ce qui entre, et une bonne partie des sites d’agences que nous mettons en ligne passent par là. Le mail annonce la fin du bouton « bloquer les robots d’IA ». À la place, trois réglages : un pour la recherche, un pour l’entraînement des modèles, un pour les agents, ces programmes qui vont lire un site à la place de quelqu’un.

Je vous explique pourquoi je m’y arrête, parce qu’a priori vous n’avez jamais ouvert Cloudflare de votre vie, et c’est normal.

Depuis un an, quand on parlait d’IA à un hébergeur ou à un prestataire, la réponse la plus courante a été de cocher « bloquer » et de passer à autre chose. Pour un journal en ligne, je comprends, son contenu est sa marchandise. Pour une agence, c’est un contresens. Faites le test, demandez à ChatGPT quelle agence contacter pour vendre un appartement dans votre ville. La réponse est bâtie sur ce que les robots de recherche des IA ont pu lire. Si votre site leur était fermé, vous n’y êtes pas, et vous ne le verrez dans aucune statistique puisque la visite n’a jamais eu lieu. C’est le sujet sur lequel on travaille depuis le printemps en référencement, d’où mon intérêt pour ce mail.

Ce que Cloudflare a obtenu

Jusqu’ici, le même robot servait souvent à deux choses. Il remplissait l’index d’un moteur de recherche, et le contenu ramassé au passage servait aussi à entraîner un modèle. Impossible d’interdire l’un sans interdire l’autre. Cloudflare a obtenu de Google, Microsoft, Apple, OpenAI, Anthropic, Amazon et Meta qu’ils séparent leurs robots, un pour chercher, un pour apprendre, et qu’ils respectent ce que le site déclare dans son fichier robots.txt. Un site peut donc dire « indexez-moi et citez-moi, mais n’apprenez pas sur mes pages », et les gros acteurs s’y tiennent. Les petits robots inconnus, eux, ne se sont engagés à rien, Cloudflare le dit d’ailleurs lui-même dans son billet.

Le réglage recommandé devient recherche autorisée, entraînement refusé. Si vous aviez tout bloqué, Cloudflare vous migre tout seul vers ça dans la semaine, ce qui est déjà mieux qu’avant.

Ma lecture pour une agence

Le raisonnement de Cloudflare est pensé pour les sites qui vivent de la publicité. Là, une IA qui répond à la place de la page fait perdre une vue, donc de l’argent. Une agence, ce qu’elle attend de son site, c’est un mandat ou un contact, et une page vue en plus ou en moins ne change rien à son chiffre. Un agent d’IA qui vient lire vos annonces le fait pour un acheteur qui a une question précise, et je préfère qu’il puisse la lire.

Donc sur les sites que nous gérons, recherche ouverte, agents ouverts. Pour l’entraînement, je suis moins tranché. Refuser ne vous coûte rien de mesurable aujourd’hui, et laisser faire ne vous rapporte rien de mesurable non plus. J’ai tendance à penser qu’un modèle qui a lu vos pages de secteur connaît votre agence, mais je n’ai pas encore de preuve dans un sens ou dans l’autre. Donc on laisse ouvert pour l’instant, et on regardera ce que ça donne sur les prochains mois.