Respuesta rápida: realiza estas 20 comprobaciones en orden de capas: primero la indexabilidad (un noindex accidental pesa más que todo lo demás), luego la claridad de rastreo, renderizado, rendimiento, datos estructurados y la capa de rastreadores de IA. Cada verificación a continuación tiene una condición de aprobación que puedes verificar tú mismo, la mayoría con herramientas gratuitas. Pase completo trimestral; pase dirigido después de cada cambio de tema, cambio de plataforma o edición masiva.
El orden es el método: cada capa bloquea las que están debajo. Un esquema perfecto en una página no indexada es decoración. Trabaja de arriba hacia abajo y deja de pulir capas inferiores mientras una superior falla.
| Orden | Capa | Primera cosa a verificar |
|---|---|---|
| 1 | Indexabilidad | No hay noindex accidental (Verificación 1) |
| 2 | Claridad de rastreo | Canónico autorreferente (Verificación 5) |
| 3 | Renderizado | Contenido en HTML sin procesar (Verificación 10) |
| 4 | Rendimiento | Aprobación de Core Web Vitals (Verificación 12) |
| 5 | Datos estructurados | Validación de esquema (Verificación 15) |
| 6 | Capa de rastreadores de IA | Bots de IA permitidos en robots.txt (Verificación 17) |
Capa 1 — Indexabilidad (verificaciones 1–4)
- No hay noindex accidental. Verifica el código fuente (o simula como Googlebot) en tus páginas clave: sin meta robots o X-Robots-Tag que contengan noindex. El error técnico que termina carreras; se envía constantemente a través de actualizaciones de tema y envíos de staging. (Qué significan las directivas.)
- Páginas clave devuelven 200. No cadenas 302, no plantillas de soft-404. Redirecciones máximo un salto.
- robots.txt no bloquea nada que deba posicionarse. Una página bloqueada tampoco puede mostrar su noindex: bloquear y desindexar son trabajos diferentes (guía de robots; generador).
- Search Console muestra las páginas indexadas. Informe de páginas → tus URLs clave en "Indexadas", y cada razón de exclusión en ese informe explicada, no ignorada. (Configuración de GSC.)
Capa 2 — Claridad de rastreo (verificaciones 5–9)
- Un canónico autorreferente por página; variantes y parámetros se canonicen a la URL limpia (mecánica de contenido duplicado).
- Sitemap completo y limpio — cada página indexable dentro, cada redirección/404/página no indexada fuera, enviado en GSC (guía de sitemap).
- No hay páginas huérfanas — todo lo importante accesible mediante enlaces internos, idealmente a tres clics de la página de inicio.
- Higiene de redirección — no cadenas más allá de un salto, no bucles, y cada URL retirada con enlaces entrantes 301 a algún lugar relevante (reclamación).
- hreflang correcto si es multilingüe — pares bidireccionales, x-default, auto-inclusión (guía de hreflang).
Capa 3 — Renderizado (verificaciones 10–11)
- El contenido existe en HTML sin procesar. Obtén cualquier página clave como Googlebot: título, H1, texto del cuerpo e información del producto presentes sin JavaScript. Si la obtención sin procesar es un cascarón, Google te indexa lentamente y los rastreadores de IA no te indexan en absoluto (soluciones SPA).
- Un H1, árbol de encabezados sensato, enlaces HTML reales (etiquetas de anclaje, no controladores de clics JS) para cualquier cosa que los rastreadores deban seguir.
Capa 4 — Rendimiento (verificaciones 12–14)
- Aprobación de Core Web Vitals en datos de campo — LCP < 2.5s, INP < 200ms, CLS < 0.1, en la sección de usuarios reales de PageSpeed Insights, primero móvil.
- Imágenes dimensionadas y comprimidas — formatos modernos, dimensiones declaradas (eso es la mayoría del CLS), carga diferida solo por debajo del pliegue.
- HTTPS en todas partes — un esquema+host canónico, variantes http y www redirigiendo 301 hacia él.
Capa 5 — Datos estructurados (verificaciones 15–16)
- Esquema en cada plantilla que califique — Producto+Oferta en productos, Artículo en publicaciones, BreadcrumbList en todo el sitio, Organización una vez — y validación en la Prueba de Resultados Enriquecidos (guía de esquema).
- El esquema coincide con la página visible. Precios, disponibilidad, calificaciones en JSON-LD idénticos a lo que ven los humanos; la discrepancia genera acciones manuales.
Capa 6 — La capa de rastreadores de IA (verificaciones 17–20)
- Rastreadores de IA explícitamente permitidos en robots.txt — GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended — suponiendo que quieras existir en respuestas de IA (la decisión, argumentada).
- llms.txt publicado en la raíz, listando tus páginas citables (generador + guía).
- Respuestas extraíbles de HTML sin procesar — páginas clave abren con una respuesta directa de dos oraciones; bloques de FAQ llevan esquema FAQPage (la disciplina AEO).
- Verifica que los motores de IA realmente puedan obtenerte — una obtención de Googlebot-UA que devuelve una página de desafío CDN en lugar de contenido significa que tu protección contra bots también está afectando tu visibilidad de IA.
Ejecutándolo de verdad
Manual, el pase toma una tarde con el stack gratuito: GSC + el simulador + PSI + Prueba de Resultados Enriquecidos. A escala de catálogo, las comprobaciones son la mitad fácil y los cientos de correcciones por página son la pared — que es la mitad que RankEngine automatiza para Shopify: ejecuta estas comprobaciones en cada producto, colección y página continuamente, luego aplica y verifica las correcciones a través del API. De cualquier manera, la disciplina es la misma: auditar en el cambio, monitorear siempre, y nunca pulir la capa 5 mientras la capa 1 sangra.