Auditoria de GEO com critério de medição por item

Uma auditoria de GEO confere se um site pode ser lido, entendido e usado como fonte pelas superfícies de IA, e cada item só vale quando tem um critério de aprovação que outra pessoa consiga repetir. O checklist cobre acesso por robô, render do HTML, llms.txt, camada Markdown, schema, entidade, velocidade e sinais de confiança. O Google afirma que AI Overviews e AI Mode não têm requisito técnico além de indexação e elegibilidade a trecho, então a auditoria mede prontidão e deixa a citação para rodadas datadas nas próprias IAs.

Principais pontos

  • O Google Search Central diz que, para aparecer como link de apoio em AI Overviews ou AI Mode, a página precisa estar indexada e elegível a exibir trecho, sem requisito técnico adicional.
  • Na análise da Vercel com a MERJ, de dezembro de 2024, nenhum dos principais crawlers de IA executava JavaScript, com exceção do Gemini, pela infraestrutura do Googlebot, e do Applebot.
  • No benchmark de agências de GEO de setembro de 2026, 11 de 19 agências brasileiras tinham llms.txt e só 8 mantinham o arquivo curado.
  • No mesmo benchmark, apenas 1 das 19 agências mantinha uma via dedicada para agentes de IA lerem o site de forma estruturada.
  • Os limites de Core Web Vitals publicados no web.dev são LCP de até 2,5 segundos, INP de até 200 milissegundos e CLS de até 0,1, no percentil 75.

O que a auditoria de GEO mede e o que fica fora

A auditoria de GEO verifica a prontidão técnica de um site para servir de fonte às IAs, e deixa a citação para outra medição. O guia de recursos de IA do Google Search Central, atualizado em dezembro de 2025, diz que uma página só precisa estar indexada e elegível a exibir trecho para aparecer como link de apoio em AI Overviews ou AI Mode, sem requisito técnico extra. A mesma página dispensa arquivos novos legíveis por máquina e marcação especial. Do lado do Google, a auditoria de GEO começa pela auditoria de SEO de sempre.

As outras superfícies pedem mais. ChatGPT, Claude e Perplexity usam robôs próprios, cada um com regra própria no robots.txt, e a maioria deles não renderiza JavaScript. É nessa diferença que a auditoria de GEO ganha itens próprios. Trato cada item com um critério de aprovação que outra pessoa consiga repetir de fora do servidor, o mesmo princípio da Parte A do benchmark de agências de GEO, em que o sinal lido só em parte ficou fora da conta.

Acesso por robô e render do HTML

O acesso por robô é o primeiro item porque todos os outros dependem dele. O critério tem duas partes. No robots.txt, o robô precisa aparecer liberado pelo nome, como GPTBot, OAI-SearchBot, ClaudeBot ou PerplexityBot. Na resposta do servidor, a mesma URL precisa devolver 200 quando pedida com o user agent de cada robô. O Google lembra no mesmo guia que o rastreio tem de ser permitido pelo robots.txt e também pela CDN e pela hospedagem.

for ua in GPTBot OAI-SearchBot ClaudeBot PerplexityBot; do
  printf "%s " "$ua"
  curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (compatible; $ua)" https://exemplo.com.br/
done

O teste pega bloqueio por user agent. Bloqueio por faixa de IP só aparece no log do servidor, com o método de identificar crawlers de IA no log.

O render vem logo depois. Na análise que a Vercel publicou com a MERJ em dezembro de 2024, nenhum dos principais crawlers de IA executava JavaScript, entre eles OAI-SearchBot, ChatGPT-User, GPTBot, ClaudeBot e PerplexityBot. As exceções eram o Gemini, que usa a infraestrutura do Googlebot, e o Applebot. O critério que uso é o texto principal, o título e os links de navegação estarem no HTML da primeira resposta, conferidos com curl ou com o JavaScript desligado.

llms.txt e camada Markdown

O llms.txt entra na auditoria de GEO como item de agente, sem peso de ranking. O critério é o arquivo responder 200 na raiz, em texto, com fatos da própria empresa em vez do modelo automático de plugin. No benchmark de agências, 11 de 19 agências brasileiras tinham o arquivo, 57,9% do grupo, mas só 8 o mantinham curado, e pelo menos 3 serviam o modelo gerado pela plataforma. O que os dados de uso mostram sobre o arquivo está em o llms.txt funciona.

A camada Markdown tem critério mais objetivo. A mesma URL deve devolver Markdown quando o pedido chega com o cabeçalho Accept: text/markdown, ou deve existir uma rota paralela com a versão em texto. No benchmark, só 1 das 19 agências mantinha uma via dedicada para agentes. No site da agência e neste, cada página tem versão em Markdown pelas duas vias, e a implementação está em Markdown para agentes de IA.

curl -s -o /dev/null -D - -H "Accept: text/markdown" https://exemplo.com.br/pagina/ | grep -i content-type

Schema e entidade

O schema passa na auditoria quando descreve a entidade de forma estável e coerente com o texto visível. O Google pede que os dados estruturados correspondam ao que está na página e diz que não existe marcação especial para os recursos de IA. Por isso o critério que aplico olha consistência em vez de quantidade: JSON-LD no HTML inicial, sem depender de JavaScript, um grafo por página, um @id fixo para a organização e para a pessoa, e sameAs apontando para perfis que existem e que apontam de volta. Os dois domínios que mantenho compartilham o mesmo @id de entidade, e o raciocínio está em @id no JSON-LD entre domínios.

A entidade também se audita fora do código. Nome, datas e descrição precisam bater entre site, perfis e fontes de terceiros, e a pessoa ou a empresa precisa ser identificável sem confusão com homônimos.

Velocidade e sinais de confiança

A velocidade entra na auditoria com os limites de Core Web Vitals que o web.dev publica, medidos em dados de campo. A página passa quando o LCP fica em até 2,5 segundos, o INP em até 200 milissegundos e o CLS em até 0,1, no percentil 75 das visitas. O Lighthouse não mede INP, porque não há interação real no laboratório, então o dado vem do CrUX, do PageSpeed Insights ou do relatório do Search Console.

Os sinais de confiança fecham a lista: autor nomeado com página própria, contato com dados verificáveis, datas de publicação e de atualização visíveis, e ausência de travas de trecho, como nosnippet ou max-snippet zerado, nas páginas que devem servir de fonte.

A régua que uso para cada item

Cada linha da auditoria de GEO só entra no relatório com método e critério escritos, porque sem isso duas pessoas chegam a notas diferentes para o mesmo site.

ItemCritério de aprovaçãoComo medir
Robôs de IALiberados pelo nome e com resposta 200robots.txt e curl por user agent
RenderTexto principal no HTML inicialcurl ou JavaScript desligado
Travas de trechoSem nosnippet nas páginas-alvoHTML e cabeçalho X-Robots-Tag
llms.txtResposta 200 com fatos curadosLeitura do arquivo
Camada MarkdownMarkdown por Accept ou por rota própriacurl com cabeçalho
SchemaJSON-LD no HTML inicial e coerente com o textoCódigo-fonte e teste de resultados
Entidade@id estável e sameAs recíprocoLeitura do grafo e dos perfis
VelocidadeLCP, INP e CLS dentro do limite no p75CrUX ou Search Console
ConfiançaAutor, contato e datas visíveisLeitura da página

A citação fica em outra planilha, com rodadas datadas por superfície, como descrevo em prompts para medir visibilidade em IA. No benchmark de agências, a preparação técnica, baixa em quase todo o grupo, não explicava sozinha quais marcas as IAs recomendavam, e é por isso que as duas medições nunca se misturam no mesmo número.

Nota de método

O que foi medido
Presença de llms.txt e de via em Markdown para agentes nos sites de 19 agências brasileiras que vendem GEO, na Parte A do benchmark de agências de GEO.
Quando
28 de agosto a 14 de setembro de 2026.
Como
Leitura pública de cada site, sinal por sinal, contando só o que pôde ser confirmado de fora do servidor. Os limites de Core Web Vitals e as regras de cada plataforma vêm das fontes citadas.
Limitação
As 19 agências não formam um censo do mercado, e os sinais técnicos medem o site da agência, não a qualidade do trabalho entregue aos clientes.

Os termos de medição estão definidos no vocabulário de medição, e o protocolo das rodadas na política editorial.

O que a IA desdobra desta pergunta

Quando alguém faz esta busca em uma IA, o sistema abre subperguntas antes de responder. Estas são as que apareceram na medição, e onde cada uma é respondida.

Perguntas frequentes

Qual a diferença entre auditoria de GEO e auditoria de SEO?

A base técnica é a mesma, com indexação, rastreio e HTML legível. A auditoria de GEO acrescenta o acesso de cada robô de IA pelo nome, o texto disponível sem JavaScript, as camadas para agentes, como llms.txt e Markdown, e a consistência da entidade entre domínios. Nenhum desses itens mede citação, que exige rodadas nas próprias IAs.

A auditoria de GEO prova que o site será citado pelas IAs?

Não prova. A auditoria mede prontidão técnica, ou seja, se os robôs entram, se o texto chega no HTML e se a entidade é identificável. A citação depende também de reputação e da concorrência pela mesma pergunta. No benchmark de agências de GEO, a preparação técnica baixa não explicava sozinha quais marcas as IAs recomendavam.

Por que testar cada robô de IA separadamente?

Porque liberar um robô no robots.txt não garante o acesso. CDN, firewall e regras de proteção contra bots podem devolver erro 403 a um robô liberado no arquivo, e o próprio Google lembra que o rastreio precisa ser permitido também pela CDN e pela hospedagem. Uma requisição com cada user agent mostra o código que o robô recebe.

Fontes citadas

  1. Google Search Central, recursos de IA e o seu site (2025). Atualizado em 10 de dezembro de 2025.
  2. Vercel e MERJ, o crescimento dos crawlers de IA (2024)
  3. web.dev, Web Vitals e os limites de LCP, INP e CLS (2024)
  4. OpenAI, busca na web com o ChatGPT e liberação do OAI-SearchBot (2026)
  5. Prontidão para IA das agências de GEO no Brasil (benchmark, dados abertos) (2026)