RAG e SEO na prática da recuperação por passagem
RAG e SEO se encontram na etapa de recuperação: antes de gerar a resposta, o sistema busca passagens em um índice e só pode citar o que recuperou. O Google documenta que AI Overviews e AI Mode recuperam com os sistemas centrais de ranking sobre o índice da Busca. O SEO segue dono da indexação e da recuperação.
Principais pontos
- O termo RAG vem do artigo de Patrick Lewis e coautores submetido ao arXiv em maio de 2020 e aceito no NeurIPS 2020.
- O guia de IA generativa do Google Search Central, atualizado em julho de 2026, descreve o RAG das AI Overviews e do AI Mode como recuperação feita pelos sistemas centrais de ranking sobre o índice da Busca.
- Pelo mesmo guia, só é elegível a esses recursos a página indexada e apta a aparecer na Busca com snippet.
- No teste de Contextual Retrieval da Anthropic, de setembro de 2024, contexto adicionado a cada trecho reduziu em 49% as falhas de recuperação, e em 67% com reranking.
- O artigo GEO, aceito no KDD 2024, mediu ganho de até 40% de visibilidade em respostas de motores generativos com otimizações de conteúdo.
Onde o RAG encontra o SEO?
O RAG, descrito por Patrick Lewis e coautores em 2020, gera texto a partir de passagens recuperadas de um índice externo. No artigo original, o índice era um conjunto vetorial da Wikipédia consultado por um recuperador neural. Nas superfícies de busca com IA, o índice é a web, ou uma fatia dela. A definição curta do mecanismo está no verbete de RAG da agência; aqui interessa o encaixe com o trabalho de SEO.
O encaixe ficou documentado. O guia de IA generativa do Google Search Central, atualizado em julho de 2026, descreve o RAG das AI Overviews e do AI Mode como grounding. Os sistemas centrais de ranking recuperam páginas do índice da Busca, e o modelo escreve a resposta a partir delas, com links para as fontes. O mesmo guia diz que, na visão do Google, otimizar para busca generativa continua sendo SEO.
As etapas do pipeline e o que o SEO controla
O pipeline de RAG em busca tem quatro etapas, e o SEO pesa mais nas duas primeiras. A tabela resume onde cada decisão técnica entra.
| Etapa | O que acontece | O que o SEO controla |
|---|---|---|
| Indexação | A página é rastreada, processada e guardada no índice | Rastreabilidade, render, canonical, elegibilidade a snippet |
| Recuperação | Consultas, inclusive as do fan-out, buscam candidatos por termo e por significado | Termo exato em título e heading, cobertura das subintenções |
| Reranking | Um modelo relê pergunta e trecho juntos e reordena | Passagem autossuficiente, entidade nomeada, número com data |
| Geração | O modelo escreve e anexa as fontes usadas | Fato verificável e fácil de atribuir |
O guia do Google fixa a porta de entrada. Para aparecer em AI Overviews e AI Mode, a página precisa estar indexada e apta a ser exibida na Busca com snippet. Uma diretiva nosnippet ou uma página fora do índice encerra o assunto antes de qualquer discussão sobre conteúdo.
O que a Anthropic mediu sobre contexto no trecho?
A Anthropic publicou em setembro de 2024 um teste que mostra bem por que um trecho sem contexto se perde na recuperação. Em RAG tradicional, o documento é quebrado em pedaços de algumas centenas de tokens, e cada pedaço vira um vetor. O exemplo do próprio texto é uma frase sobre receita que cresceu 3% no trimestre sem dizer qual empresa nem qual período. Isolada, ela não casa com a pergunta certa.
A técnica testada, Contextual Retrieval, acrescenta a cada trecho de 50 a 100 tokens de contexto antes de gerar o vetor e o índice BM25. O resultado, medido como falha de recuperação entre os 20 primeiros trechos:
O resultado, medido como falha de recuperação entre os 20 primeiros trechos:
Lucas Ferraz, especialista em SEO
- Só embeddings contextuais: falhas caíram 35%, de 5,7% para 3,7%.
- Embeddings e BM25 contextuais: queda de 49%, para 2,9%.
- Com reranking somado: queda de 67%, para 1,9%.
O teste roda sobre bases de conhecimento, e não sobre a busca aberta. A leitura que levo para o texto de site é de direção. O trecho que já traz a entidade, o período e o número dispensa o contexto que o sistema teria de adivinhar.
Por que o Google diz para não fatiar o texto?
O mesmo guia do Google que documenta o RAG diz que não é preciso quebrar o conteúdo em pedaços pequenos para a IA. Os sistemas entendem uma página com vários tópicos e mostram a parte relevante. As duas ideias convivem. O corte em trechos é feito pelo sistema, e o trabalho de quem escreve é garantir que cada bloco continue verdadeiro e completo depois do corte, em prosa normal, sem versão paralela para máquina. Detalhei esse ponto em chunking de conteúdo para IA.
O guia também afasta a ideia de escrever uma página para cada variação de pergunta ou de subconsulta do fan-out. Produzir páginas em escala para manipular respostas geradas entra na política de abuso de conteúdo em escala. A cobertura das subintenções cabe melhor em seções de uma página forte do que em dezenas de páginas rasas.
Como eu testo a recuperação de uma página?
A recuperação só se prova quando a URL aparece entre as fontes da resposta, e por isso meço em rodadas datadas. Repito as mesmas perguntas em cada superfície, em conversa isolada, e anoto quais URLs foram citadas. Uma execução só engana, porque o query fan-out muda a cada execução, e as superfícies discordam entre si sobre quem citar.
No lado do Google, cruzo as rodadas com o relatório de desempenho de IA generativa do Search Console. No estudo com DOI sobre quatro sites de pequenas empresas, a IA do Google expôs sobretudo páginas informacionais, de 74% a 94% das impressões conforme o site. Esse tipo de achado só aparece quando a medição separa superfície e tipo de página.
Nos dois sites que mantenho, a camada de leitura para agentes inclui uma versão em Markdown de cada página, em /md/ e por Accept: text/markdown. O Google diz que a Busca não usa arquivos ou Markdown especiais, então trato essa camada como conveniência para agentes e ferramentas, sem expectativa de efeito no ranking nem na recuperação do AI Mode.
Minha posição sobre o tema
A recuperação só se prova quando a URL aparece entre as fontes da resposta, por isso meço em rodadas datadas: uma execução só engana, porque o fan-out muda a cada execução e as superfícies discordam entre si sobre quem citar. Do teste da Anthropic sobre contexto no trecho, a leitura que levo para o texto do site é de direção: o trecho que já traz a entidade, o período e o número dispensa o contexto que o sistema teria de adivinhar.
O que a IA desdobra desta pergunta?
Quando alguém faz esta busca em uma IA, o sistema abre subperguntas antes de responder. Estas são as que apareceram na medição, e onde cada uma é respondida.
Perguntas frequentes
O RAG das IAs de busca usa o mesmo índice do Google?
No caso do Google, sim. O guia do Search Central afirma que AI Overviews e AI Mode recuperam páginas do índice da Busca usando os sistemas centrais de ranking. As outras superfícies não dependem necessariamente desse índice, então a mesma página pode ser recuperada em uma IA e ignorada em outra.
Dá para otimizar a etapa de reranking?
Dá para influenciar, sem controle direto. O reranker lê a pergunta e o trecho juntos e reordena os candidatos por relevância fina. Passagem que nomeia a entidade, traz o número com data e responde logo na primeira frase tende a ganhar essa leitura, enquanto trecho vago fica parecido com dezenas de concorrentes.
Como saber se uma página foi recuperada pela IA?
A prova mais direta é a URL aparecer entre as fontes citadas na resposta. Eu repito as mesmas perguntas em rodadas datadas, por superfície, e anoto quais URLs aparecem. No Google, o relatório de desempenho de IA generativa do Search Console complementa essa leitura com dados da própria propriedade.
Fontes citadas
- Lewis e coautores, Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (arXiv 2005.11401) (2020)
- Google Search Central, guia de otimização para recursos de IA generativa (2026). Página atualizada em 10 de julho de 2026.
- Anthropic, Introducing Contextual Retrieval (2024)
- Aggarwal e coautores, GEO, Generative Engine Optimization (arXiv 2311.09735, KDD 2024) (2024)
Versão em markdown para agentes de IA: https://lucasferraz.com/blog/rag-e-seo/md/