Réponse rapide : robots.txt indique aux moteurs de recherche et aux crawlers IA quels chemins de votre boutique ils peuvent explorer. Shopify propose un modèle par défaut raisonnable et vous permet de le personnaliser avec un modèle robots.txt.liquid. L'erreur courante et coûteuse est de désactiver accidentellement les chemins de produits ou de collections, ce qui les désindexe. Pour la recherche IA, autorisez explicitement les crawlers que vous souhaitez voir cités — GPTBot, ClaudeBot, PerplexityBot et Google-Extended.

Votre robots.txt indique aux moteurs de recherche et aux crawlers IA ce qu'ils peuvent explorer sur votre boutique. Sur Shopify, c'est principalement automatique, ce qui est bien — mais les paramètres par défaut causent deux problèmes récurrents, et l'avertissement de Google "Indexé, bien que bloqué par robots.txt" piège de nombreux marchands qui aggravent ensuite la situation en bloquant davantage. Voici comment le fichier fonctionne sur Shopify, comment le modifier en toute sécurité et comment corriger les erreurs qu'il cause.

Comment fonctionne le robots.txt de Shopify

Shopify génère automatiquement le fichier à votreboutique.com/robots.txt et propose un modèle par défaut raisonnable. Ce modèle par défaut désactive déjà les chemins internes que vous ne souhaitez jamais indexer — /cart, /checkout, /orders, /account, et les URL de recherche et de filtrage internes de Shopify — et oriente les crawlers vers votre sitemap. Pour de nombreuses boutiques, vous n'avez jamais besoin de le toucher.

Depuis 2021, vous pouvez le personnaliser en ajoutant un fichier templates/robots.txt.liquid à votre thème. Vous le créez dans l'éditeur de code du thème : depuis votre admin, allez à Boutique en ligne → Thèmes → [votre thème] → ⋯ → Modifier le code, puis sous le dossier Templates, cliquez sur "Ajouter un nouveau modèle" et choisissez robots.txt dans le menu déroulant du type de modèle. Shopify structure les règles par défaut en Liquid, et vous modifiez à partir de là. Le fichier est en Liquid, pas en texte brut, donc vous modifiez un modèle qui génère les règles plutôt que d'écrire des directives brutes — ce qui vous permet d'ajouter ou de supprimer des règles spécifiques tout en conservant les paramètres par défaut raisonnables de Shopify.

Deux précautions avant de modifier. Premièrement, ce fichier est puissant dans le mauvais sens — un Disallow: / accidentel dirait à chaque crawler d'ignorer votre boutique entière, alors changez-le délibérément et vérifiez le rendu à votreboutique.com/robots.txt après. Deuxièmement, robots.txt contrôle l'exploration, pas l'indexation. Ce sont des choses différentes, et les confondre est à l'origine de l'erreur la plus courante de robots Shopify.

L'exploration n'est pas l'indexation

Une règle Disallow dans robots.txt dit à un crawler "ne récupère pas cette URL." Elle ne dit pas à Google "n'indexe pas cette URL." Si Google découvre une URL bloquée via un lien quelque part, il peut toujours ajouter l'URL brute à son index — il ne peut tout simplement pas lire la page pour voir ce qu'elle contient. Le résultat est une liste sans titre ni description utiles, ce qui est pire que d'indexer correctement la page ou de la garder entièrement hors de l'index.

Cette distinction unique explique l'avertissement ci-dessous, et c'est pourquoi "il suffit de le bloquer dans robots.txt" est la mauvaise solution pour les pages que vous souhaitez garder hors de la recherche.

Correction de "Indexé, bien que bloqué par robots.txt"

Cet avertissement de la Search Console signifie que Google a trouvé une URL, généralement via un lien, mais n'a pas pu l'explorer car robots.txt bloque le chemin — il a donc indexé l'URL sans contenu. La solution dépend de ce que vous voulez faire de cette URL :

Si vous voulez... Alors... Parce que...
Garder l'URL indexée et corriger la liste Supprimez ou restreignez la règle Disallow ; demandez l'indexation dans la Search Console Google doit explorer la page pour voir son contenu et mettre à jour la liste
Supprimer l'URL des résultats de recherche entièrement Débloquez la page, puis ajoutez une balise meta noindex ou un en-tête X-Robots-Tag Un crawler ne peut pas lire une instruction noindex sur une page bloquée
  • Identifiez l'URL bloquée exacte dans le rapport Pages de la Search Console sous ce statut, et vérifiez-la par rapport à votre robots.txt pour trouver la règle Disallow correspondante.
  • Si elle doit être indexée — un vrai produit ou une collection pris par une règle trop large — supprimez ou restreignez la règle Disallow dans robots.txt.liquid pour que Google puisse l'explorer, puis demandez l'indexation. Une fois que Google lit la page, l'avertissement disparaît et la liste obtient un titre et une description appropriés.
  • Si elle ne doit pas être indexée — une page de filtre mince, un résultat de recherche interne, une page de connexion — ne vous fiez pas au blocage. Le blocage seul peut laisser l'URL brute indexée pour toujours. Au lieu de cela, laissez Google explorer la page et donnez-lui un signal noindex qu'il peut réellement lire : une balise meta robots noindex dans le balisage de la page, ou un en-tête X-Robots-Tag noindex. Paradoxalement, pour supprimer une page de l'index, vous devez souvent la débloquer d'abord pour que le crawler puisse voir l'instruction noindex. Une page bloquée est une page dont Google ne lira jamais la balise noindex.

Désactiver les pages de recherche et de tag

Deux modèles d'URL Shopify génèrent des pages à faible valeur ajoutée quasi infinies qui peuvent gonfler votre index : les résultats de recherche internes (chemins sous /search) et les URL de collections filtrées par tag (longues chaînes de requête avec ?constraint= ou des paramètres de tag). Les paramètres par défaut de Shopify gèrent une grande partie de cela, mais sur les thèmes personnalisés et les catalogues fortement tagués, ceux-ci peuvent passer à travers et être indexés comme des pages minces et duplicatives.

Si vous les trouvez indexés et que vous voulez les supprimer, appliquez la logique exploration-versus-indexation ci-dessus. Bloquer /search dans robots.txt arrête l'exploration fraîche mais ne supprimera pas les URL déjà indexées ; pour celles-ci, un signal noindex sur les modèles de recherche et de filtre est la solution durable. Les balises canoniques aident ici aussi — pointer les variantes de collection filtrées vers l'URL de collection propre est souvent plus propre que de bloquer, et c'est couvert dans le guide des balises canoniques. La décision est de savoir si vous voulez que la page soit inexplorable ou non indexée ; elles nécessitent des outils opposés.

Accueillir les crawlers IA, délibérément

Pour être cité par les moteurs de réponse IA, votre robots.txt doit autoriser les crawlers que ces moteurs utilisent — et de nombreuses boutiques les bloquent par accident, souvent via un CDN ou un paramètre de sécurité plutôt que par choix du propriétaire de la boutique. Les agents à connaître par leur nom :

  • GPTBot et OAI-SearchBot — les crawlers d'OpenAI, le second spécifiquement pour les citations de recherche de ChatGPT.
  • ClaudeBot — le crawler d'Anthropic.
  • Google-Extended — le contrôle de Google pour la formation et la base de l'IA, distinct de Googlebot.
  • PerplexityBot — le crawler de Perplexity.
  • CCBot — Common Crawl, qui alimente de nombreux modèles en aval.

Ceux-ci sont distincts de Googlebot et chacun explore selon ses propres termes. L'action AEO la plus rapide est de confirmer que votre robots.txt ne bloque pas ceux que vous souhaitez voir vous citer, et idéalement de les autoriser par nom avec un bloc User-agent et Allow explicite dans robots.txt.liquid. Les bloquer revient à exclure silencieusement votre boutique de la visibilité IA sans aucune erreur pour vous avertir. Cela est essentiel pour l'optimisation des moteurs de réponse et le travail plus large d'optimisation des moteurs génératifs et de visibilité IA — et cela s'associe naturellement à un bon fichier llms.txt, qui est la version affirmative de la même idée. Si vous pesez quels agents autoriser, le guide SEO ChatGPT approfondit spécifiquement les crawlers d'OpenAI.

Un moyen rapide de vérifier votre robots.txt

Ouvrez votreboutique.com/robots.txt dans un navigateur — c'est le rendu que chaque crawler voit, et c'est le fichier qui compte, pas votre modèle Liquid. Recherchez tout Disallow: / seul (un blocage de site complet), pour les agents utilisateurs de crawlers IA sous un Disallow, et pour une ligne Sitemap: pointant vers votre vrai sitemap.xml. Dans la Search Console, le rapport Pages vous indique ce qui se passe réellement — combien d'URL sont sous "Indexé, bien que bloqué par robots.txt" et lesquelles. Entre le fichier brut et le rapport Pages, vous pouvez voir à la fois la politique et ses conséquences.

L'hygiène de robots.txt s'aligne avec votre sitemap, vos redirections, et votre balisage schema comme la couche de crawlabilité du SEO Shopify ; la checklist 2026 et le guide SEO Shopify les relient ensemble, et l'aperçu des outils SEO Shopify couvre ce qui les automatise.

RankEngine audite votre politique de robots, signale les URL bloquées mais indexées à partir de vos données de la Search Console, et peut publier un robots.txt.liquid avec les bonnes règles de crawlers IA — puis le vérifie par rapport au fichier rendu en direct pour que vous sachiez que le changement a réellement pris effet plutôt que de faire confiance au fait que le modèle a été enregistré.