Protocolo de medição de IA com versão e changelog
Uma medição de visibilidade em IA só compara com a anterior se o prompt, o texto de neutralização, o canal e a regra de contagem forem os mesmos, ou se a diferença estiver registrada. Na minha base, em 26 de setembro de 2026, as 637 rodadas de recomendação estavam gravadas em 11 formatos de registro diferentes, e o campo que diz se havia AI Overview tinha 36 grafias em 182 páginas. Isso aconteceu antes de o protocolo ter versão. Hoje cada arquivo de prompt tem versão, o texto de neutralização tem uma fonte só, e toda rodada guarda canal, citados e motivo.
Principais pontos
- Em 26 de setembro de 2026, as 637 rodadas de recomendação da minha base usavam 11 conjuntos de campos diferentes, e 376 delas não tinham o campo que identifica a superfície.
- O campo que registra a presença de AI Overview tinha 36 valores diferentes em 182 registros de página, antes de o formato ser fixado.
- Os 23 arquivos de prompt de medição da base estavam na versão 1, criados entre 22 e 24 de setembro de 2026.
- Na mesma semana, uma rodada foi descartada porque o navegador guardava a pergunta de outra medição, e a interface do Claude mudou o jeito de abrir o modo anônimo.
- Recusa do assistente conta como rodada executada sem a marca, e essa regra precisa estar escrita, porque muda o placar.
O que quebra a comparação?
Uma medição de visibilidade em IA só compara com a anterior se o prompt, a neutralização, o canal e a regra de contagem forem os mesmos, ou se a diferença estiver registrada. A resposta da IA muda sozinha de uma execução para outra. Se o instrumento também muda, e ninguém anota, a variação do mercado e a variação do instrumento viram uma coisa só, e o gráfico conta uma história que não aconteceu.
Na minha base, isso já aconteceu antes de eu perceber. Em 26 de setembro de 2026, as 637 rodadas de recomendação estavam gravadas em 11 conjuntos de campos diferentes. Em 376 delas não havia o campo que diz em qual assistente a rodada foi feita, porque o formato antigo guardava isso em outro nome. Os dados estão lá, mas cada comparação entre períodos exige um tradutor.
| O que variou | Onde | Tamanho em 26/09/2026 |
|---|---|---|
| Formato do registro de rodada | arquivo de rodadas | 11 formatos em 637 rodadas |
| Campo da superfície ausente | arquivo de rodadas | 376 de 637 |
| Grafia da presença de AI Overview | registros de página | 36 valores em 182 registros |
| Versão dos prompts | arquivos de prompt | 23 arquivos, todos na versão 1 |
Os incidentes de uma semana
Em uma semana de medição, três coisas mudaram o instrumento sem mudar a pergunta. A primeira foi minha: o navegador guardava a pergunta de outra medição, e uma rodada no Perplexity foi feita com o texto errado. Percebi pelo título da conversa, descartei e refiz. Sem o registro da pergunta enviada junto da resposta, essa rodada teria entrado no placar de outro tema.
A segunda veio da interface. Em 26 de setembro de 2026, o Claude mudou o modo anônimo de lugar: o que era um ícone no topo virou um botão na caixa de texto, e a conversa passou a abrir em outro endereço. O procedimento de antes deixou de funcionar. A checagem que salvou a rodada foi simples: antes de enviar, conferir na tela o texto que confirma o modo anônimo.
A terceira foi a recusa. O Gemini respondeu "Sou apenas um modelo de linguagem" ou "Não fui programado para fazer isso" em algumas rodadas de perguntas iguais às que respondeu em outras. Conto recusa como rodada executada sem a marca. É uma escolha, e muda o placar: com a regra oposta, a mesma semana teria denominadores menores e percentuais maiores.
O que versiono hoje?
Hoje versiono quatro coisas: o texto do prompt, o texto de neutralização, o canal de execução e a regra de contagem. Cada arquivo de prompt tem um campo de versão, e qualquer alteração no texto que a IA recebe, até pontuação, sobe a versão. O texto de neutralização tem uma fonte só, e os arquivos de prompt apontam para ela em vez de copiar, para não existirem duas versões circulando.
| Elemento | Onde fica | O que registro por rodada |
|---|---|---|
| Prompt | arquivo por tipo de página, com versão | identificador do prompt e versão |
| Neutralização | fonte única | nada extra, é igual para todas |
| Canal | navegador usado e modo da conversa | canal por superfície |
| Contagem | regra escrita de recusa, marca e serviço | citados, fontes, motivo e se houve recusa |
O canal entra porque o mesmo assistente responde diferente conforme o modo. Chat temporário, conversa nova, modo anônimo com pesquisa na web e navegador com sessão logada são instrumentos diferentes. Cada registro guarda qual foi usado, e uma troca de canal fica anotada no histórico da página com o motivo.
O que ainda falta?
O que ainda falta na minha base é o período de sobreposição: rodar a versão antiga e a nova do prompt no mesmo dia antes de aposentar a antiga. Sem isso, a primeira medição com o prompt novo não diz se a marca subiu ou se a pergunta ficou mais fácil. Os 23 arquivos ainda estão na primeira versão, então a primeira troca real vai ser o teste dessa regra.
Também falta normalizar o passado. As 36 grafias do campo de AI Overview cabem em quatro estados: não apareceu, apareceu sem a marca, apareceu com a marca e não medido. A tradução é mecânica, mas precisa ser feita uma vez e registrada, para que o próximo gráfico de série histórica não misture "ausente" com "não exibida" como se fossem resultados diferentes. É o tipo de dívida que só aparece quando alguém tenta medir cada camada de uma vez.
As 36 grafias do campo de AI Overview cabem em quatro estados: não apareceu, apareceu sem a marca, apareceu com a marca e não medido.
Lucas Ferraz, especialista em SEO
Nota de método
- O que foi medido
- O arquivo de rodadas de recomendação (637 registros) e o frontmatter dos 186 registros de página da agência, mais os 23 arquivos de prompt de medição.
- Quando
- 26 de setembro de 2026.
- Como
- Contagem de conjuntos de campos distintos por registro de rodada e de valores distintos por campo nos registros de página, sem normalizar grafias.
- Limitação
- A base é de um site e foi montada ao longo de dois meses por sessões diferentes. Os números mostram o quanto o formato variou, não o quanto os resultados foram afetados.
Os termos de medição estão definidos no vocabulário de medição, e o protocolo das rodadas na política editorial.
O que a IA desdobra desta pergunta?
Quando alguém faz esta busca em uma IA, o sistema abre subperguntas antes de responder. Estas são as que apareceram na medição, e onde cada uma é respondida.
Perguntas frequentes
Preciso versionar se uso ferramenta paga de monitoramento?
Sim, e mais ainda. A ferramenta muda modelo, região e forma de consulta sem avisar em todo release. Anotar a data de cada mudança conhecida e rodar uma checagem manual paralela no mesmo dia é o que permite separar mudança do mercado de mudança do instrumento.
O que conta como mudança de versão do prompt?
Qualquer alteração no texto que a IA recebe, incluindo pontuação, ordem das frases e o texto de neutralização. Corrigir um erro de digitação também muda a versão, porque também pode mudar a resposta.
Refazer a medição antiga com o prompt novo resolve?
Resolve daqui para frente, não para trás. A resposta de uma IA de agosto não pode ser coletada de novo em setembro. O que dá para fazer é rodar a versão antiga e a nova no mesmo dia, por um tempo, e registrar quanto uma difere da outra.
Versão em markdown para agentes de IA: https://lucasferraz.com/blog/protocolo-de-medicao-com-versao/md/