Auditoria de GEO com critério de medição por item
Uma auditoria de GEO confere se um site pode ser lido, entendido e usado como fonte pelas superfícies de IA, e cada item só vale quando tem um critério de aprovação que outra pessoa consiga repetir. O checklist cobre acesso por robô, render do HTML, llms.txt, camada Markdown, schema, entidade, velocidade e sinais de confiança. O Google afirma que AI Overviews e AI Mode não têm requisito técnico além de indexação e elegibilidade a trecho, então a auditoria mede prontidão e deixa a citação para rodadas datadas nas próprias IAs.
Principais pontos
- O Google Search Central diz que, para aparecer como link de apoio em AI Overviews ou AI Mode, a página precisa estar indexada e elegível a exibir trecho, sem requisito técnico adicional.
- Na análise da Vercel com a MERJ, de dezembro de 2024, nenhum dos principais crawlers de IA executava JavaScript, com exceção do Gemini, pela infraestrutura do Googlebot, e do Applebot.
- No benchmark de agências de GEO de setembro de 2026, 11 de 19 agências brasileiras tinham llms.txt e só 8 mantinham o arquivo curado.
- No mesmo benchmark, apenas 1 das 19 agências mantinha uma via dedicada para agentes de IA lerem o site de forma estruturada.
- Os limites de Core Web Vitals publicados no web.dev são LCP de até 2,5 segundos, INP de até 200 milissegundos e CLS de até 0,1, no percentil 75.
O que a auditoria de GEO mede e o que fica fora
A auditoria de GEO verifica a prontidão técnica de um site para servir de fonte às IAs, e deixa a citação para outra medição. O guia de recursos de IA do Google Search Central, atualizado em dezembro de 2025, diz que uma página só precisa estar indexada e elegível a exibir trecho para aparecer como link de apoio em AI Overviews ou AI Mode, sem requisito técnico extra. A mesma página dispensa arquivos novos legíveis por máquina e marcação especial. Do lado do Google, a auditoria de GEO começa pela auditoria de SEO de sempre.
As outras superfícies pedem mais. ChatGPT, Claude e Perplexity usam robôs próprios, cada um com regra própria no robots.txt, e a maioria deles não renderiza JavaScript. É nessa diferença que a auditoria de GEO ganha itens próprios. Trato cada item com um critério de aprovação que outra pessoa consiga repetir de fora do servidor, o mesmo princípio da Parte A do benchmark de agências de GEO, em que o sinal lido só em parte ficou fora da conta.
Acesso por robô e render do HTML
O acesso por robô é o primeiro item porque todos os outros dependem dele. O critério tem duas partes. No robots.txt, o robô precisa aparecer liberado pelo nome, como GPTBot, OAI-SearchBot, ClaudeBot ou PerplexityBot. Na resposta do servidor, a mesma URL precisa devolver 200 quando pedida com o user agent de cada robô. O Google lembra no mesmo guia que o rastreio tem de ser permitido pelo robots.txt e também pela CDN e pela hospedagem.
for ua in GPTBot OAI-SearchBot ClaudeBot PerplexityBot; do
printf "%s " "$ua"
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (compatible; $ua)" https://exemplo.com.br/
done
O teste pega bloqueio por user agent. Bloqueio por faixa de IP só aparece no log do servidor, com o método de identificar crawlers de IA no log.
O render vem logo depois. Na análise que a Vercel publicou com a MERJ em dezembro de 2024, nenhum dos principais crawlers de IA executava JavaScript, entre eles OAI-SearchBot, ChatGPT-User, GPTBot, ClaudeBot e PerplexityBot. As exceções eram o Gemini, que usa a infraestrutura do Googlebot, e o Applebot. O critério que uso é o texto principal, o título e os links de navegação estarem no HTML da primeira resposta, conferidos com curl ou com o JavaScript desligado.
llms.txt e camada Markdown
O llms.txt entra na auditoria de GEO como item de agente, sem peso de ranking. O critério é o arquivo responder 200 na raiz, em texto, com fatos da própria empresa em vez do modelo automático de plugin. No benchmark de agências, 11 de 19 agências brasileiras tinham o arquivo, 57,9% do grupo, mas só 8 o mantinham curado, e pelo menos 3 serviam o modelo gerado pela plataforma. O que os dados de uso mostram sobre o arquivo está em o llms.txt funciona.
A camada Markdown tem critério mais objetivo. A mesma URL deve devolver Markdown quando o pedido chega com o cabeçalho Accept: text/markdown, ou deve existir uma rota paralela com a versão em texto. No benchmark, só 1 das 19 agências mantinha uma via dedicada para agentes. No site da agência e neste, cada página tem versão em Markdown pelas duas vias, e a implementação está em Markdown para agentes de IA.
curl -s -o /dev/null -D - -H "Accept: text/markdown" https://exemplo.com.br/pagina/ | grep -i content-type
Schema e entidade
O schema passa na auditoria quando descreve a entidade de forma estável e coerente com o texto visível. O Google pede que os dados estruturados correspondam ao que está na página e diz que não existe marcação especial para os recursos de IA. Por isso o critério que aplico olha consistência em vez de quantidade: JSON-LD no HTML inicial, sem depender de JavaScript, um grafo por página, um @id fixo para a organização e para a pessoa, e sameAs apontando para perfis que existem e que apontam de volta. Os dois domínios que mantenho compartilham o mesmo @id de entidade, e o raciocínio está em @id no JSON-LD entre domínios.
A entidade também se audita fora do código. Nome, datas e descrição precisam bater entre site, perfis e fontes de terceiros, e a pessoa ou a empresa precisa ser identificável sem confusão com homônimos.
Velocidade e sinais de confiança
A velocidade entra na auditoria com os limites de Core Web Vitals que o web.dev publica, medidos em dados de campo. A página passa quando o LCP fica em até 2,5 segundos, o INP em até 200 milissegundos e o CLS em até 0,1, no percentil 75 das visitas. O Lighthouse não mede INP, porque não há interação real no laboratório, então o dado vem do CrUX, do PageSpeed Insights ou do relatório do Search Console.
Os sinais de confiança fecham a lista: autor nomeado com página própria, contato com dados verificáveis, datas de publicação e de atualização visíveis, e ausência de travas de trecho, como nosnippet ou max-snippet zerado, nas páginas que devem servir de fonte.
A régua que uso para cada item
Cada linha da auditoria de GEO só entra no relatório com método e critério escritos, porque sem isso duas pessoas chegam a notas diferentes para o mesmo site.
| Item | Critério de aprovação | Como medir |
|---|---|---|
| Robôs de IA | Liberados pelo nome e com resposta 200 | robots.txt e curl por user agent |
| Render | Texto principal no HTML inicial | curl ou JavaScript desligado |
| Travas de trecho | Sem nosnippet nas páginas-alvo | HTML e cabeçalho X-Robots-Tag |
| llms.txt | Resposta 200 com fatos curados | Leitura do arquivo |
| Camada Markdown | Markdown por Accept ou por rota própria | curl com cabeçalho |
| Schema | JSON-LD no HTML inicial e coerente com o texto | Código-fonte e teste de resultados |
| Entidade | @id estável e sameAs recíproco | Leitura do grafo e dos perfis |
| Velocidade | LCP, INP e CLS dentro do limite no p75 | CrUX ou Search Console |
| Confiança | Autor, contato e datas visíveis | Leitura da página |
A citação fica em outra planilha, com rodadas datadas por superfície, como descrevo em prompts para medir visibilidade em IA. No benchmark de agências, a preparação técnica, baixa em quase todo o grupo, não explicava sozinha quais marcas as IAs recomendavam, e é por isso que as duas medições nunca se misturam no mesmo número.
Nota de método
- O que foi medido
- Presença de llms.txt e de via em Markdown para agentes nos sites de 19 agências brasileiras que vendem GEO, na Parte A do benchmark de agências de GEO.
- Quando
- 28 de agosto a 14 de setembro de 2026.
- Como
- Leitura pública de cada site, sinal por sinal, contando só o que pôde ser confirmado de fora do servidor. Os limites de Core Web Vitals e as regras de cada plataforma vêm das fontes citadas.
- Limitação
- As 19 agências não formam um censo do mercado, e os sinais técnicos medem o site da agência, não a qualidade do trabalho entregue aos clientes.
Os termos de medição estão definidos no vocabulário de medição, e o protocolo das rodadas na política editorial.
O que a IA desdobra desta pergunta
Quando alguém faz esta busca em uma IA, o sistema abre subperguntas antes de responder. Estas são as que apareceram na medição, e onde cada uma é respondida.
Perguntas frequentes
Qual a diferença entre auditoria de GEO e auditoria de SEO?
A base técnica é a mesma, com indexação, rastreio e HTML legível. A auditoria de GEO acrescenta o acesso de cada robô de IA pelo nome, o texto disponível sem JavaScript, as camadas para agentes, como llms.txt e Markdown, e a consistência da entidade entre domínios. Nenhum desses itens mede citação, que exige rodadas nas próprias IAs.
A auditoria de GEO prova que o site será citado pelas IAs?
Não prova. A auditoria mede prontidão técnica, ou seja, se os robôs entram, se o texto chega no HTML e se a entidade é identificável. A citação depende também de reputação e da concorrência pela mesma pergunta. No benchmark de agências de GEO, a preparação técnica baixa não explicava sozinha quais marcas as IAs recomendavam.
Por que testar cada robô de IA separadamente?
Porque liberar um robô no robots.txt não garante o acesso. CDN, firewall e regras de proteção contra bots podem devolver erro 403 a um robô liberado no arquivo, e o próprio Google lembra que o rastreio precisa ser permitido também pela CDN e pela hospedagem. Uma requisição com cada user agent mostra o código que o robô recebe.
Fontes citadas
- Google Search Central, recursos de IA e o seu site (2025). Atualizado em 10 de dezembro de 2025.
- Vercel e MERJ, o crescimento dos crawlers de IA (2024)
- web.dev, Web Vitals e os limites de LCP, INP e CLS (2024)
- OpenAI, busca na web com o ChatGPT e liberação do OAI-SearchBot (2026)
- Prontidão para IA das agências de GEO no Brasil (benchmark, dados abertos) (2026)
Versão em texto para agentes de IA: https://lucasferraz.com/blog/auditoria-tecnica-de-geo/md/