Performance et visibilité
GPTBot : faut-il laisser les robots d’IA lire votre site ?
OpenAI vient de documenter publiquement GPTBot, le robot qui parcourt le web pour alimenter ses modèles. Pour la première fois, un éditeur de site dispose d’un moyen simple et officiel de dire oui ou non.
Comment le bloquer ou l’autoriser
GPTBot annonce son nom et respecte le fichier robots.txt. Pour lui interdire tout le site :
User-agent: GPTBot
Disallow: /
Il est aussi possible de n’ouvrir que certaines parties, par exemple les articles et les pages de présentation, en fermant le reste.
Bloquer ou autoriser : la vraie question
Bloquer a du sens si vos contenus sont votre produit : articles de fond, guides payants, fiches rédigées avec soin qu’on ne veut pas voir reformulées ailleurs sans lien vers vous.
Autoriser a du sens si votre site sert d’abord à être trouvé : un artisan, un commerce, un prestataire. Les assistants conversationnels deviennent une porte d’entrée à part entière. Un site qu’ils n’ont jamais lu est un site qu’ils ne recommanderont pas.
Il n’y a pas de bonne réponse universelle, mais il y a une mauvaise : ne pas savoir ce que dit son propre fichier.
Le piège qu’on ne voit pas
Le fichier robots.txt n’est pas le seul filtre. Une protection anti-robots trop large sur le serveur, un pare-feu applicatif ou un service de protection en amont peuvent bloquer ces robots alors même que le fichier les autorise. Le site est alors invisible pour eux sans que personne l’ait décidé. Ça se vérifie dans les journaux du serveur : on y voit qui passe, et quelle réponse il reçoit.
Questions fréquentes
Comment bloquer GPTBot sur mon site ?
En ajoutant dans le fichier robots.txt les lignes « User-agent: GPTBot » puis « Disallow: / ».
Faut-il bloquer les robots d’IA ?
Cela dépend du site. Un éditeur de contenus peut vouloir les protéger ; un commerce ou un prestataire a plutôt intérêt à être lu pour être recommandé.
Sources
- OpenAI, documentation de GPTBot platform.openai.com