Définition
Le fichier robots.txt, servi à l'adresse /robots.txt, liste des règles robot par robot : ce qu'il peut lire (Allow) et ce qu'il doit laisser de côté (Disallow). Il peut aussi déclarer le plan du site. Les robots sérieux le respectent, mais il ne constitue pas une protection.
Google précise que ce fichier ne sert pas à retirer une page de ses résultats : une page bloquée peut rester indexée si d'autres sites y renvoient. Pour l'écarter, il faut une consigne noindex ou un accès protégé par un mot de passe.
Intérêt pour un dirigeant
Le robots.txt décide aussi de la présence dans les assistants. OAI-SearchBot alimente la recherche de ChatGPT et GPTBot l'entraînement des modèles d'OpenAI ; Claude-SearchBot et ClaudeBot jouent les mêmes rôles pour Anthropic ; PerplexityBot construit l'index de Perplexity. Google-Extended concerne les applications Gemini et Vertex AI, sans effet sur la recherche Google.
Chaque robot se règle séparément : bloquer GPTBot n'empêche pas OAI-SearchBot de lire le site. Bloquer un robot de recherche, en revanche, retire le site des réponses de l'assistant correspondant.
Chez Stratedge Consulting
Notre robots.txt nomme chaque robot d'assistant et interdit à tous les espaces privés. L'audit de visibilité IA lit le vôtre comme Google le lit, robot par robot, et signale ce qui vous retire des réponses.
Erreurs fréquentes
Garder la ligne « Disallow: / » d'un site de préproduction après la mise en ligne. Le site entier disparaît des moteurs et des assistants, souvent pendant des semaines avant que quelqu'un le remarque.
Se servir du robots.txt pour cacher une page sensible. Le fichier est public et indique précisément où chercher ; une page privée se protège par un mot de passe.
