Respuesta rápida: robots.txt indica a los motores de búsqueda y rastreadores de IA qué rutas en tu tienda pueden rastrear. Shopify ofrece un valor predeterminado sensato y te permite personalizarlo con una plantilla robots.txt.liquid. El error común y costoso es desautorizar accidentalmente rutas de productos o colecciones, lo que las desindexa. Para la búsqueda de IA, permite explícitamente los rastreadores que deseas que te citen: GPTBot, ClaudeBot, PerplexityBot y Google-Extended.

Tu robots.txt indica a los motores de búsqueda y rastreadores de IA qué pueden rastrear en tu tienda. En Shopify es mayormente automático, lo cual es bueno, pero los valores predeterminados causan dos problemas recurrentes, y la advertencia de Google "Indexado, aunque bloqueado por robots.txt" confunde a muchos comerciantes que luego empeoran la situación bloqueando más. Aquí te explicamos cómo funciona el archivo en Shopify, cómo editarlo de manera segura y cómo corregir los errores que causa.

Cómo funciona el robots.txt de Shopify

Shopify genera el archivo en yourstore.com/robots.txt automáticamente y ofrece un valor predeterminado sensato. Ese valor predeterminado ya desautoriza las rutas internas que nunca deseas indexar — /cart, /checkout, /orders, /account, y las URLs internas de búsqueda y filtrado de Shopify — y dirige a los rastreadores a tu sitemap. Para muchas tiendas, nunca necesitas tocarlo.

Desde 2021 puedes personalizarlo agregando un archivo templates/robots.txt.liquid a tu tema. Lo creas en el editor de código del tema: desde tu administrador ve a Tienda Online → Temas → [tu tema] → ⋯ → Editar código, luego en la carpeta de Plantillas haz clic en "Agregar una nueva plantilla" y elige robots.txt del menú desplegable de tipo de plantilla. Shopify estructura las reglas predeterminadas como Liquid, y tú editas desde allí. El archivo es Liquid, no texto plano, por lo que estás modificando una plantilla que genera las reglas en lugar de escribir directivas en bruto, lo que te permite agregar o eliminar reglas específicas mientras mantienes intactos los valores predeterminados sensatos de Shopify.

Dos advertencias antes de editar. Primero, este archivo es poderoso en la dirección equivocada: un Disallow: / errante indicaría a todos los rastreadores que ignoren toda tu tienda, así que cámbialo deliberadamente y verifica el resultado renderizado en yourstore.com/robots.txt después. Segundo, robots.txt controla el rastreo, no la indexación. Son cosas diferentes, y confundirlas es la raíz del error más común de robots en Shopify.

Rastrear no es indexar

Una regla Disallow en robots.txt le dice a un rastreador "no busques esta URL." No le dice a Google "no indexes esta URL." Si Google descubre una URL bloqueada a través de un enlace en algún lugar, aún puede agregar la URL desnuda a su índice, solo que no puede leer la página para ver qué hay en ella. El resultado es una lista sin título o descripción útil, lo cual es peor que indexar la página correctamente o mantenerla fuera por completo.

Esa única distinción explica la advertencia a continuación, y es por eso que "simplemente bloquearlo en robots.txt" es la solución incorrecta para las páginas que deseas mantener fuera de la búsqueda.

Corregir "Indexado, aunque bloqueado por robots.txt"

Esta advertencia de Search Console significa que Google encontró una URL, generalmente a través de un enlace, pero no pudo rastrearla porque robots.txt bloquea la ruta, por lo que indexó la URL sin contenido. La solución depende de lo que quieras que suceda con esa URL:

Si quieres... Entonces... Porque...
Mantener la URL indexada y corregir la lista Elimina o reduce la regla Disallow; solicita la indexación en Search Console Google necesita rastrear la página para ver su contenido y actualizar la lista
Eliminar la URL de los resultados de búsqueda por completo Desbloquea la página, luego agrega una metaetiqueta noindex o un encabezado X-Robots-Tag Un rastreador no puede leer una instrucción noindex en una página bloqueada
  • Identifica la URL bloqueada exacta en el informe de Páginas de Search Console bajo este estado, y compárala con tu robots.txt para encontrar la regla Disallow coincidente.
  • Si debe ser indexada — un producto real o colección que fue atrapado por una regla demasiado amplia — elimina o reduce la regla Disallow en robots.txt.liquid para que Google pueda rastrearla, luego solicita la indexación. Una vez que Google lea la página, la advertencia se despeja y la lista obtiene un título y descripción adecuados.
  • Si no debe ser indexada — una página de filtro delgada, un resultado de búsqueda interno, una página de inicio de sesión — no confíes en el bloqueo. El bloqueo por sí solo puede dejar la URL desnuda indexada para siempre. En su lugar, permite que Google rastree la página y dale una señal noindex que realmente pueda leer: una metaetiqueta robots noindex en el marcado de la página, o un encabezado X-Robots-Tag noindex. Contrariamente a la intuición, para eliminar una página del índice a menudo tienes que desbloquearla primero para que el rastreador pueda ver la instrucción noindex. Una página bloqueada es una página cuya etiqueta noindex Google nunca leerá.

Desautorizar páginas de búsqueda y etiquetas

Dos patrones de URL de Shopify generan páginas de bajo valor casi infinitas que pueden inflar tu índice: resultados de búsqueda internos (rutas bajo /search) y URLs de colecciones filtradas por etiquetas (largas cadenas de consulta con ?constraint= o parámetros de etiqueta). Los valores predeterminados de Shopify manejan gran parte de esto, pero en temas personalizados y catálogos con muchas etiquetas, estos pueden pasar desapercibidos y ser indexados como páginas delgadas y duplicadas.

Si las encuentras indexadas y quieres eliminarlas, aplica la lógica de rastreo versus indexación mencionada anteriormente. Bloquear /search en robots.txt detiene el rastreo nuevo pero no eliminará URLs ya indexadas; para esas, una señal noindex en las plantillas de búsqueda y filtro es la solución duradera. Las etiquetas canónicas también ayudan aquí: apuntar variantes de colecciones filtradas de regreso a la URL limpia de la colección a menudo es más limpio que bloquear, y está cubierto en la guía de etiquetas canónicas. La decisión es si quieres que la página no sea rastreable o no sea indexada; requieren herramientas opuestas.

Da la bienvenida a los rastreadores de IA, deliberadamente

Para ser citado por motores de respuesta de IA, tu robots.txt necesita permitir los rastreadores que esos motores usan, y muchas tiendas los bloquean por accidente, a menudo a través de un CDN o configuración de seguridad en lugar de la elección del propietario de la tienda. Los agentes que vale la pena conocer por nombre:

  • GPTBot y OAI-SearchBot — Los rastreadores de OpenAI, el segundo específicamente para las citas de búsqueda de ChatGPT.
  • ClaudeBot — El rastreador de Anthropic.
  • Google-Extended — El control de Google para entrenamiento y fundamentación de IA, separado de Googlebot.
  • PerplexityBot — El rastreador de Perplexity.
  • CCBot — Common Crawl, que alimenta a muchos modelos derivados.

Estos son distintos de Googlebot y cada uno busca en sus propios términos. La acción de AEO más rápida es confirmar que tu robots.txt no bloquea a los que deseas que te citen, y preferiblemente permitirlos por nombre con un bloque explícito User-agent y Allow en robots.txt.liquid. Bloquearlos silenciosamente excluye a tu tienda de la visibilidad de IA sin ningún error que te advierta. Esto es fundamental para la optimización de motores de respuesta y el trabajo más amplio de optimización de motores generativos y visibilidad de IA, y se combina naturalmente con un buen archivo llms.txt, que es la versión afirmativa de la misma idea. Si estás considerando qué agentes permitir, la guía de SEO de ChatGPT profundiza más en los rastreadores de OpenAI específicamente.

Una forma rápida de verificar tu robots.txt

Abre yourstore.com/robots.txt en un navegador: ese es el resultado renderizado que ve cada rastreador, y es el archivo que importa, no tu plantilla Liquid. Busca cualquier Disallow: / por sí solo (un bloqueo de todo el sitio), para agentes de usuario de rastreadores de IA bajo un Disallow, y para una línea Sitemap: que apunte a tu sitemap.xml real. En Search Console, el informe de Páginas te dice lo que realmente está sucediendo: cuántas URLs están bajo "Indexado, aunque bloqueado por robots.txt" y cuáles son. Entre el archivo en bruto y el informe de Páginas puedes ver tanto la política como sus consecuencias.

La higiene de robots.txt se encuentra junto a tu sitemap, redirecciones y marcado de esquema como la capa de rastreabilidad del SEO de Shopify; la lista de verificación de 2026 y la guía de SEO de Shopify las unen, y la visión general de herramientas de SEO de Shopify cubre lo que las automatiza.

RankEngine audita tu política de robots, señala URLs bloqueadas pero indexadas de tus datos de Search Console, y puede publicar un robots.txt.liquid con las reglas correctas para rastreadores de IA, luego lo verifica contra el archivo renderizado en vivo para que sepas que el cambio realmente se realizó en lugar de confiar en que la plantilla se guardó.