Resposta rápida: execute estas 20 verificações na ordem das camadas — indexabilidade primeiro (um noindex acidental supera tudo o resto), depois clareza de rastreamento, renderização, desempenho, dados estruturados e a camada de rastreadores de IA. Cada verificação abaixo tem uma condição de aprovação que pode ser verificada por si mesmo, a maioria com ferramentas gratuitas. Passagem completa trimestral; passagem direcionada após cada alteração de tema, mudança de plataforma ou edição em massa.
A ordem é o método: cada camada bloqueia as que estão abaixo dela. Um esquema perfeito numa página com noindex é decoração. Trabalhe de cima para baixo e pare de polir camadas inferiores enquanto uma superior falha.
| Ordem | Camada | Primeira coisa a verificar |
|---|---|---|
| 1 | Indexabilidade | Nenhum noindex acidental (Verificação 1) |
| 2 | Clareza de rastreamento | Canônico autorreferente (Verificação 5) |
| 3 | Renderização | Conteúdo em HTML bruto (Verificação 10) |
| 4 | Desempenho | Core Web Vitals aprovado (Verificação 12) |
| 5 | Dados estruturados | Esquema validado (Verificação 15) |
| 6 | Camada de rastreadores de IA | Bots de IA permitidos no robots.txt (Verificação 17) |
Camada 1 — Indexabilidade (verificações 1–4)
- Nenhum noindex acidental. Veja o código-fonte (ou busque como Googlebot) nas suas páginas principais: sem meta robots ou X-Robots-Tag contendo noindex. O erro técnico que pode acabar com a carreira; ocorre constantemente através de atualizações de tema e envios de staging. (O que significam as diretivas.)
- Páginas principais retornam 200. Não cadeias de 302, não modelos de soft-404. Redirecionamentos no máximo um salto.
- robots.txt não bloqueia nada que deva classificar. Uma página bloqueada não pode mostrar seu noindex também — bloquear e desindexar são trabalhos diferentes (guia de robots; gerador).
- Search Console mostra as páginas indexadas. Relatório de páginas → seus URLs principais em "Indexadas", e cada razão de exclusão nesse relatório explicada, não ignorada. (Configuração do GSC.)
Camada 2 — Clareza de rastreamento (verificações 5–9)
- Um canônico autorreferente por página; variantes e parâmetros canônicos para o URL limpo (mecânica de conteúdo duplicado).
- Sitemap completo e limpo — cada página indexável incluída, cada página redirecionada/404/com noindex excluída, submetida no GSC (guia de sitemap).
- Sem páginas órfãs — tudo importante acessível por links internos, idealmente a três cliques da página inicial.
- Higiene de redirecionamento — sem cadeias além de um salto, sem loops, e cada URL aposentado com links de entrada 301 para algum lugar relevante (reclamação).
- hreflang correto se multilíngue — pares bidirecionais, x-default, auto-inclusão (guia de hreflang).
Camada 3 — Renderização (verificações 10–11)
- Conteúdo existe em HTML bruto. Busque qualquer página principal como Googlebot: título, H1, texto do corpo e informações do produto presentes sem JavaScript. Se a busca bruta for uma casca, o Google indexa você lentamente e os rastreadores de IA não o fazem de todo (correções de SPA).
- Um H1, árvore de cabeçalhos sensata, links HTML reais (tags de âncora, não manipuladores de clique JS) para qualquer coisa que os rastreadores devam seguir.
Camada 4 — Desempenho (verificações 12–14)
- Core Web Vitals aprovado em dados de campo — LCP < 2,5s, INP < 200ms, CLS < 0,1, na seção de usuários reais do PageSpeed Insights, primeiro no móvel.
- Imagens dimensionadas e comprimidas — formatos modernos, dimensões declaradas (isso é a maior parte do CLS), carregamento preguiçoso apenas abaixo da dobra.
- HTTPS em todo lugar — um esquema+host canônico, variantes http e www redirecionando 301 para ele.
Camada 5 — Dados estruturados (verificações 15–16)
- Esquema em cada modelo que qualifica — Product+Offer em produtos, Article em posts, BreadcrumbList em todo o site, Organization uma vez — e validando no Rich Results Test (guia de esquema).
- Esquema corresponde à página visível. Preços, disponibilidade, classificações em JSON-LD idênticos ao que os humanos veem; divergências resultam em ações manuais.
Camada 6 — A camada de rastreadores de IA (verificações 17–20)
- Rastreadores de IA explicitamente permitidos no robots.txt — GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended — assumindo que deseja existir em respostas de IA (a decisão, argumentada).
- llms.txt publicado na raiz, listando suas páginas citáveis (gerador + guia).
- Respostas extraíveis de HTML bruto — páginas principais abrem com uma resposta direta de duas frases; blocos de FAQ carregam esquema FAQPage (a disciplina AEO).
- Verifique se os motores de IA podem realmente buscá-lo — uma busca com Googlebot-UA retornando uma página de desafio CDN em vez de conteúdo significa que sua proteção contra bots está também a prejudicar sua visibilidade de IA.
Executando na prática
Manual, a passagem leva uma tarde com a pilha gratuita: GSC + o simulador + PSI + Rich Results Test. Em escala de catálogo, as verificações são a metade fácil e as centenas de correções por página são a barreira — que é a metade que RankEngine automatiza para Shopify: ele executa essas verificações em cada produto, coleção e página continuamente, depois aplica e verifica as correções através da API. De qualquer forma, a disciplina é a mesma: auditar em mudanças, monitorar sempre, e nunca polir a camada 5 enquanto a camada 1 está a sangrar.