Resposta rápida: execute estas 20 verificações na ordem das camadas — indexabilidade primeiro (um noindex acidental supera tudo o resto), depois clareza de rastreamento, renderização, desempenho, dados estruturados e a camada de rastreadores de IA. Cada verificação abaixo tem uma condição de aprovação que pode ser verificada por si mesmo, a maioria com ferramentas gratuitas. Passagem completa trimestral; passagem direcionada após cada alteração de tema, mudança de plataforma ou edição em massa.

A ordem é o método: cada camada bloqueia as que estão abaixo dela. Um esquema perfeito numa página com noindex é decoração. Trabalhe de cima para baixo e pare de polir camadas inferiores enquanto uma superior falha.

Ordem Camada Primeira coisa a verificar
1 Indexabilidade Nenhum noindex acidental (Verificação 1)
2 Clareza de rastreamento Canônico autorreferente (Verificação 5)
3 Renderização Conteúdo em HTML bruto (Verificação 10)
4 Desempenho Core Web Vitals aprovado (Verificação 12)
5 Dados estruturados Esquema validado (Verificação 15)
6 Camada de rastreadores de IA Bots de IA permitidos no robots.txt (Verificação 17)

Camada 1 — Indexabilidade (verificações 1–4)

  1. Nenhum noindex acidental. Veja o código-fonte (ou busque como Googlebot) nas suas páginas principais: sem meta robots ou X-Robots-Tag contendo noindex. O erro técnico que pode acabar com a carreira; ocorre constantemente através de atualizações de tema e envios de staging. (O que significam as diretivas.)
  2. Páginas principais retornam 200. Não cadeias de 302, não modelos de soft-404. Redirecionamentos no máximo um salto.
  3. robots.txt não bloqueia nada que deva classificar. Uma página bloqueada não pode mostrar seu noindex também — bloquear e desindexar são trabalhos diferentes (guia de robots; gerador).
  4. Search Console mostra as páginas indexadas. Relatório de páginas → seus URLs principais em "Indexadas", e cada razão de exclusão nesse relatório explicada, não ignorada. (Configuração do GSC.)

Camada 2 — Clareza de rastreamento (verificações 5–9)

  1. Um canônico autorreferente por página; variantes e parâmetros canônicos para o URL limpo (mecânica de conteúdo duplicado).
  2. Sitemap completo e limpo — cada página indexável incluída, cada página redirecionada/404/com noindex excluída, submetida no GSC (guia de sitemap).
  3. Sem páginas órfãs — tudo importante acessível por links internos, idealmente a três cliques da página inicial.
  4. Higiene de redirecionamento — sem cadeias além de um salto, sem loops, e cada URL aposentado com links de entrada 301 para algum lugar relevante (reclamação).
  5. hreflang correto se multilíngue — pares bidirecionais, x-default, auto-inclusão (guia de hreflang).

Camada 3 — Renderização (verificações 10–11)

  1. Conteúdo existe em HTML bruto. Busque qualquer página principal como Googlebot: título, H1, texto do corpo e informações do produto presentes sem JavaScript. Se a busca bruta for uma casca, o Google indexa você lentamente e os rastreadores de IA não o fazem de todo (correções de SPA).
  2. Um H1, árvore de cabeçalhos sensata, links HTML reais (tags de âncora, não manipuladores de clique JS) para qualquer coisa que os rastreadores devam seguir.

Camada 4 — Desempenho (verificações 12–14)

  1. Core Web Vitals aprovado em dados de campo — LCP < 2,5s, INP < 200ms, CLS < 0,1, na seção de usuários reais do PageSpeed Insights, primeiro no móvel.
  2. Imagens dimensionadas e comprimidas — formatos modernos, dimensões declaradas (isso é a maior parte do CLS), carregamento preguiçoso apenas abaixo da dobra.
  3. HTTPS em todo lugar — um esquema+host canônico, variantes http e www redirecionando 301 para ele.

Camada 5 — Dados estruturados (verificações 15–16)

  1. Esquema em cada modelo que qualifica — Product+Offer em produtos, Article em posts, BreadcrumbList em todo o site, Organization uma vez — e validando no Rich Results Test (guia de esquema).
  2. Esquema corresponde à página visível. Preços, disponibilidade, classificações em JSON-LD idênticos ao que os humanos veem; divergências resultam em ações manuais.

Camada 6 — A camada de rastreadores de IA (verificações 17–20)

  1. Rastreadores de IA explicitamente permitidos no robots.txt — GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended — assumindo que deseja existir em respostas de IA (a decisão, argumentada).
  2. llms.txt publicado na raiz, listando suas páginas citáveis (gerador + guia).
  3. Respostas extraíveis de HTML bruto — páginas principais abrem com uma resposta direta de duas frases; blocos de FAQ carregam esquema FAQPage (a disciplina AEO).
  4. Verifique se os motores de IA podem realmente buscá-lo — uma busca com Googlebot-UA retornando uma página de desafio CDN em vez de conteúdo significa que sua proteção contra bots está também a prejudicar sua visibilidade de IA.

Executando na prática

Manual, a passagem leva uma tarde com a pilha gratuita: GSC + o simulador + PSI + Rich Results Test. Em escala de catálogo, as verificações são a metade fácil e as centenas de correções por página são a barreira — que é a metade que RankEngine automatiza para Shopify: ele executa essas verificações em cada produto, coleção e página continuamente, depois aplica e verifica as correções através da API. De qualquer forma, a disciplina é a mesma: auditar em mudanças, monitorar sempre, e nunca polir a camada 5 enquanto a camada 1 está a sangrar.