Meilleurs Outils SEO
Tous les articles
Par La rédactioncrawlers IAcrawler logscrawlabilité

Les crawlers IA en 2026 : qui visite votre site

Crawler d'entraînement, index de recherche ou récupération de citation : les bots IA n'ont pas tous le même rôle. Voici comment lire vos logs sans les confondre.

Une requête signée GPTBot et une requête signée ChatGPT-User portent toutes deux le nom d'OpenAI. Elles n'ont pourtant pas le même but déclaré. Bloquer la première concerne l'usage du contenu pour l'entraînement. Bloquer la seconde peut empêcher la récupération d'une page au moment où un utilisateur attend une réponse.

Cette distinction est devenue indispensable en 2026. La liste des crawlers s'allonge, les fournisseurs séparent leurs usages et les protections anti-bot appliquent parfois une règle trop large. Lire seulement le nom de l'entreprise dans les logs ne suffit plus. Vous devez identifier le rôle déclaré du bot, vérifier qu'il est authentique et observer la réponse que votre serveur lui renvoie.

Trois tâches derrière le mot crawler

La documentation Promptwatch sur la crawlabilité, consultée le 30 août 2026, sépare les crawlers d'entraînement, les crawlers d'index de recherche et les agents de récupération des citations. Cette classification vient de la documentation produit de Promptwatch. Les noms et consignes doivent toujours être confirmés sur les pages officielles des fournisseurs avant de modifier vos règles.

Les crawlers d'entraînement collectent du contenu destiné à la création ou à l'amélioration de modèles. GPTBot et ClaudeBot entrent dans cette catégorie selon la page. Autoriser ou refuser cet usage relève d'une décision juridique et éditoriale propre à votre organisation. Ce choix ne doit pas être confondu avec l'accès à la recherche en direct.

Les crawlers d'index de recherche découvrent des pages pour les fonctions de recherche des assistants. La documentation cite OAI-SearchBot, Claude-SearchBot et PerplexityBot. Si vous souhaitez apparaître dans les réponses enrichies par le web, un blocage de ces agents peut vous écarter de leur index.

Les agents de récupération des citations interviennent lorsqu'une réponse a besoin de charger une page. ChatGPT-User, Claude-User et Perplexity-User sont les exemples donnés. Leur passage se rapproche d'une récupération à la demande. Une règle copiée depuis un article visant uniquement l'entraînement peut causer un dommage concret si elle bloque aussi ces agents.

Ce que les logs peuvent confirmer

Un crawler log enregistre une demande reçue par votre infrastructure. Il montre notamment l'heure, l'URL, le user agent déclaré et le résultat renvoyé. Cette trace permet de voir quelles sections attirent un bot, si le fichier robots.txt est consulté et si une protection refuse l'accès.

Elle ne prouve pas que la page sera citée. Le bot peut lire un contenu puis ne jamais le retenir. Un crawl réussi confirme l'accès, pas l'utilisation. À l'inverse, une série d'accès refusés sur des pages importantes suffit à expliquer pourquoi la chaîne ne démarre pas pour le bot concerné.

Les erreurs méritent une lecture séparée. Un accès refusé pointe souvent vers robots.txt, une règle de pare-feu, une protection anti-bot ou une limitation de débit. Une page introuvable peut révéler des liens obsolètes. Une erreur serveur signale un problème d'application. Le diagnostic dépend du chemin et du bot, pas d'un taux agrégé présenté sans contexte.

Un nom de bot peut être usurpé

Le user agent est une chaîne déclarée par le client. N'importe quel script peut écrire "GPTBot" dans cette chaîne. Autoriser aveuglément toute requête qui porte un nom connu ouvre une faille dans votre politique de trafic. La même documentation indique que Promptwatch vérifie les adresses lorsque certains fournisseurs publient des plages ou une méthode de validation, et écarte par défaut les requêtes qui échouent à ces contrôles.

Tous les crawlers ne fournissent pas les mêmes moyens de vérification. Votre procédure doit donc citer la source officielle utilisée et la date de contrôle. Ne recopiez pas une liste d'adresses trouvée dans un billet ancien. Les plages peuvent évoluer, tout comme les noms de bots et leurs rôles.

Le guide Promptwatch des user agents IA a été publié le 15 septembre 2025 et mis à jour le 28 juillet 2026. Nous l'utilisons comme répertoire de départ, pas comme autorité finale. La page contient aussi des affirmations chiffrées et commerciales que nous ne reprenons pas ici. Pour une règle d'infrastructure en 2026, seule la documentation actuelle du fournisseur doit décider de la configuration.

Où les blocages se cachent

robots.txt est la couche la plus visible, mais ce n'est pas la seule. Un CDN peut classer un crawler IA comme trafic automatisé indésirable. Un pare-feu applicatif peut le limiter. Une règle générale écrite pour réduire le scraping peut aussi toucher les agents utilisés par une fonction de citation.

Le rendu est un autre point de contrôle. Si le contenu essentiel n'apparaît qu'après l'exécution de JavaScript, le HTML reçu par certains crawlers peut sembler vide. Vérifiez la réponse réellement envoyée, pas seulement la page affichée dans votre navigateur. Une structure HTML claire, des liens internes accessibles et une version canonique stable aident aussi les moteurs classiques.

Auditer sans ouvrir tout le site

Commencez par vos pages qui répondent à des questions importantes : documentation, guides de référence, comparatifs sincères et pages produit utiles. Pour chaque groupe, listez les crawlers que vous souhaitez autoriser selon leur rôle. Faites valider la décision d'entraînement séparément.

Comparez ensuite la politique voulue avec les traces réelles. Un crawler attendu apparaît-il ? Reçoit-il la page utile ? Les erreurs se concentrent-elles sur un répertoire ? Une modification récente du CDN correspond-elle au début du problème ? Cette lecture produit une action vérifiable.

Après correction, observez les citations. Le guide Promptwatch sur l'attribution du trafic IA, consulté le 30 août 2026, place le crawl avant la citation et le clic. Cette séquence donne un ordre de travail, mais elle ne garantit pas le résultat : rendre une page accessible ne force aucun moteur à la choisir.

Le tableau de suivi utile

Pour chaque crawler, conservez son fournisseur, son rôle déclaré, le lien vers la documentation officielle, votre règle robots.txt, la règle CDN correspondante et la date de dernière vérification. Ajoutez les chemins importants vus dans les logs ainsi que les erreurs en cours. Ce registre évite qu'une décision de sécurité ancienne soit interprétée comme une stratégie GEO actuelle.

Nous recommandons Promptwatch lorsque vous voulez centraliser les crawler logs IA et les rapprocher des citations et du trafic humain. Notre fiche Promptwatch présente le reste de la plateforme. Gardez néanmoins vos règles d'accès sous votre contrôle et vérifiez chaque bot auprès de sa source officielle.

Le prochain audit ne doit pas demander seulement "les bots passent-ils ?". Il doit préciser quel bot, pour quelle tâche déclarée, sur quelle page et avec quelle réponse du serveur. C'est à ce niveau que vous trouverez un blocage réel, sans confondre un choix sur l'entraînement avec votre présence dans la recherche IA.