A Validade das Métricas de GEO
Opacidade algorítmica, alta variabilidade estocástica e evidências frágeis: uma análise crítica do estado da arte da mensuração em Generative Engine Optimization — o que os dashboards mostram, o que escondem, e o que ainda não sabemos medir.
O campo que ainda não sabe o que está medindo
Em três anos de existência como disciplina formal, GEO desenvolveu dashboards, ferramentas de monitoramento, métricas proprietárias e um vocabulário específico de visibilidade, share of voice e citation rate. O que não desenvolveu com a mesma velocidade é um corpus de evidências robustas sobre a validade dessas métricas — se elas medem o que afirmam medir, se são reproduzíveis, e se as intervenções que afirmam produzir ganhos realmente os produzem.
Este livro não é uma refutação do GEO como prática. É uma análise crítica de seus instrumentos de medição. A distinção importa: podemos acreditar que influenciar a percepção de marca em motores generativos é um objetivo válido — e simultaneamente reconhecer que as métricas atuais são inadequadas para confirmar quando esse objetivo está sendo atingido, por quanto, e por quê.
Os problemas são estruturais. A natureza estocástica dos LLMs significa que a mesma query produz resultados diferentes em execuções distintas. A opacidade dos sistemas de recuperação significa que não sabemos por que um modelo cita uma fonte e não outra. A ausência de padronização significa que “visibility score” de uma ferramenta é incomparável com “mention rate” de outra. E o estudo seminal de Princeton — que afirma ganhos de “até 40%” — contém limitações metodológicas graves que raramente são discutidas nas coberturas do campo.
Um campo que não questiona seus instrumentos de medição não é uma ciência — é uma ideologia. GEO está em risco de se tornar o segundo caso de uma prática de marketing digital que prometeu resultados antes de ter os meios de verificá-los. A distinção entre “contagem de menções” e “audit de visibilidade com validade estatística” é a diferença entre saber que algo aconteceu e saber que você causou que acontecesse.
O Problema da Medição em Motores Generativos
1.1 Por que SEO e GEO são problemas de medição fundamentalmente diferentes
Em SEO, a unidade de medição é determinística: uma query específica, feita a partir de uma localização específica em anonimato, retorna uma lista de links ordenada. Essa lista é observável, registrável e reproduzível. Variações existem (personalização, localização, hora do dia) mas são controláveis. O objeto de medição — posição no SERP — é estável o suficiente para que qualquer ferramenta possa rastreá-lo com alta confiabilidade.
Em GEO, a unidade de medição é probabilística. O mesmo prompt submetido ao mesmo modelo em momentos diferentes pode produzir respostas distintas — não por erro, mas por design. A temperatura de amostragem dos transformers introduz aleatoriedade intencional. Isso transforma a medição de uma observação em uma estimativa estatística, com todas as implicações metodológicas que isso implica: tamanho de amostra, intervalos de confiança, poder estatístico, e a distinção entre efeito verdadeiro e ruído.
p(1−p)/n = variância amostral binomial: reduz com n (número de execuções de prompt)
σ²_model = variância intrínseca do modelo — estochasticidade do LLM mesmo para o mesmo prompt
σ²_temporal= variância temporal — mudanças no modelo, no índice RAG e no corpus entre medições
σ²_temporal= não é reduzível por n — é o “piso” de incerteza irredutível de qualquer medição de GEO
1.2 A taxonomia de erros de medição em GEO
Os erros de medição em GEO não são aleatórios — eles têm padrões identificáveis. A literatura emergente identifica cinco categorias principais, com implicações distintas para a validade das métricas.
Single-shot measurement: medir visibilidade com uma única execução de cada prompt. A stochasticidade do LLM significa que uma única observação não é representativa. Schulte (arXiv:2604.07585) demonstrou que observações de ponto único em GEO são não-confiáveis — o Gini médio de 0.715 implica que uma única resposta pode capturar a marca dominante ou uma marca minoritária, sem forma de distinguir.
Mudanças externas não controladas: medir visibilidade em t₁ e t₂ sem controlar para atualizações de modelo, mudanças de índice RAG e sazonalidade de corpus. Uma variação observada pode ser efeito de uma intervenção de GEO ou de uma atualização silenciosa do modelo — impossível distinguir sem grupo de controle.
Cherry-picking de queries: medir com prompts onde a marca tem vantagem estrutural. Um benchmark de 5 queries que mencionam a categoria exata onde a marca é líder não é representativo do universo real de queries de usuários.
Agregação cross-engine inválida: calcular uma métrica única de “visibilidade em IA” agregando ChatGPT, Gemini, Perplexity e Claude como se fossem equivalentes. Cada motor tem mecanismos de recuperação, fontes de treinamento e distribuições de citação distintas — um índice agregado mescla populações heterogêneas.
Tratar presença como endorsement: contar toda menção da marca como positiva, sem distinguir menção positiva, negativa, neutra ou com fato incorreto. Uma marca mencionada como “empresa criticada por práticas antiéticas” conta como visibilidade positiva em métricas ingênuas de mention rate.
Variabilidade Estocástica: O Problema de Medir o Inestável
2.1 O estudo Schulte — dados empíricos sobre variabilidade
O trabalho mais rigoroso publicado sobre variabilidade de métricas de GEO até agosto de 2026 é o de Julius Schulte (arXiv:2604.07585, “Don’t Measure Once”), que coletou dados de janeiro a março de 2026 com 1.726 séries binárias por-marca, 40–46 dias de observação por campanha, 4 motores, 8 prompts por campanha. O estudo é o primeiro a separar empiricamente variância estocástica intrínseca (mesmo prompt, mesmo dia, múltiplas execuções) de variância temporal (mesmo prompt, dias diferentes).
2.2 Formalização — tamanho mínimo de amostra para estimativa confiável
Lior et al. (2025) derivaram de primeiros princípios os requisitos de tamanho de amostra mínimo para avaliação confiável de LLMs. Para GEO, isso se traduz em: dado um nível de confiança desejado e uma margem de erro aceitável, quantas execuções de prompt são necessárias para que a estimativa de visibilidade seja estatisticamente confiável?
p̂ = estimativa prévia de visibilidade (usar 0.5 sem estimativa — maximiza n_min)
ε = margem de erro aceitável: ε=0.05 (±5 pontos percentuais de visibilidade)
Para p̂=0.5, ε=0.05, α=0.05: n_min = 1.96² × 0.25 / 0.0025 = 384 execuções por prompt
Para ε=0.10 (±10%): n_min = 96 execuções — ainda muito acima do que a maioria das ferramentas usa
2.3 O modelo polling — a solução que o campo está adotando
A abordagem que emerge como melhor prática é inspirada em previsão eleitoral — o polling model: definir uma amostra representativa de 250–500 queries de alta intenção, executá-las com frequência regular (diária ou semanal), e calcular métricas de visibilidade sobre o agregado. Isso transforma cada execução de prompt em uma observação de uma distribuição, e a estimativa de visibilidade em uma média amostral com intervalos de confiança calculáveis.
SE = erro padrão da estimativa — decresce com √n_total
n_total = número de prompts × execuções por prompt × períodos de observação
Exemplo: n_total = 300 prompts × 5 execuções × 4 semanas = 6.000 observações → SE ≈ 0.006 → IC ±1.2%
Mesmo com n_total alto, a variância temporal σ²_temporal não é reduzida por aumentar n. Atualizações silenciosas de modelo, mudanças de índice RAG e evolução do corpus ocorrem continuamente — e são indistinguíveis, a partir de dados de output, de variação estocástica normal. A única mitigação parcial é executar prompts de controle para os quais a resposta esperada é conhecida e estável, e monitorar desvios para detectar mudanças de sistema.
Crítica ao PAWC: O Que a Métrica do Estudo de Princeton Realmente Mede
3.1 O que é o PAWC e como foi construído
Position-Adjusted Word Count (PAWC) é a métrica de visibilidade proposta pelo estudo seminal de Aggarwal et al. (KDD 2024). A intuição é que palavras atribuídas a uma fonte aparecem em diferentes posições dentro da resposta gerada pelo LLM — palavras citadas no início têm mais peso do que palavras citadas no final, porque usuários tendem a prestar mais atenção ao início das respostas.
rank(w) = posição da palavra w na resposta gerada (1 = primeira palavra)
𝟙[·] = função indicadora: 1 se a palavra w é atribuída à fonte s, 0 caso contrário
Visibility= share normalizado da fonte s — soma das visibilities de todas as fontes = 1
Propriedade= PAWC é relativo e redistributivo: ganho de uma fonte implica perda de outra
3.2 Seis limitações críticas do PAWC que raramente são discutidas
O estudo de Princeton mede visibilidade dentro de um documento já recuperado. O problema de GEO mais relevante para marcas é um nível anterior: a probabilidade de que um documento seja recuperado e incluído no contexto do gerador. PAWC nada diz sobre esse estágio. Uma melhoria de 40% em PAWC de um documento que raramente é recuperado vale menos do que uma melhoria de 5% em PAWC de um documento recuperado em todas as queries da categoria.
3.3 O problema da Subjective Impression — o juiz que julga a si mesmo
O terceiro componente do benchmark de Princeton — Subjective Impression — é um score de 1 a 5 gerado por um LLM da mesma família de modelos que produz as respostas sendo avaliadas. A literature de avaliação de LLMs documenta extensivamente o problema de self-preference bias: modelos tendem a avaliar mais positivamente outputs de modelos similares a si mesmos. O estudo de Aggarwal renormaliza esse score para a distribuição de PAWC — uma operação que mascara o problema sem resolvê-lo.
B = juiz LLM da mesma família que A (ex: GPT-4 avaliando outputs de GPT-4o)
C = juiz LLM de família diferente
Viés = diferença sistemática de score quando juiz e avaliado são do mesmo modelo
Implicação= Subjective Impression do GEO-Bench é inflado para documentos que favorecem o estilo de geração da família de modelos usada como juiz
Opacidade Algorítmica: O Problema do Porquê
4.1 O abismo entre Academia e Indústria nas métricas de GEO
A pesquisa acadêmica e a prática industrial de GEO usam métricas fundamentalmente diferentes — com origens, objetivos e problemas distintos. O Position Paper de Governança de GEO (arXiv:2606.12439) mapeou esse fosso sistematicamente:
| Dimensão | Academia (GEO-Bench, Aggarwal et al.) | Indústria (Profound, Rankprompt, etc.) |
|---|---|---|
| Métrica primária | PAWC, nDCG@k, Recall@k, ranking position | Citation frequency, mention rate, answer visibility, SoM |
| Métodos de otimização | GCG, TAP, LLM-based rewriting explícita | LLM-guided content generation, multi-platform distribution |
| O que capturam | Movimento dentro de lista intermediária de recuperação | Se a fonte sobrevive recuperação + síntese na resposta final |
| Relevância comercial | Indireta — rankeamento não é resultado de negócio | Direta — visibilidade na resposta final é o que o usuário vê |
| Limitação principal | Testbeds artificiais, fontes pré-fornecidas, motor único | Opacidade total — sabe o QUE aconteceu, não o POR QUÊ |
Tabela 4.1 — Mapeamento do fosso entre métricas acadêmicas e industriais de GEO. Adaptado de arXiv:2606.12439 com análise própria.
4.2 O que os LLMs não revelam sobre suas decisões de citação
A opacidade algorítmica de GEO tem três dimensões: não sabemos quais fontes foram recuperadas mas não citadas (o índice de recuperação não é público), não sabemos o peso relativo de cada fator de decisão (relevância topical, autoridade de domínio, freshness, formato, densidade de fatos), e não sabemos como esses fatores interagem para produzir uma resposta específica.
Isso tem consequência direta para a validade de qualquer atribuição causal em GEO: se uma marca passou de 20% para 35% de mention rate após publicar um artigo longo com estatísticas, não há como confirmar que foi o artigo que causou o aumento, versus uma atualização de modelo, uma queda de concorrente, ou variância estocástica normal acima do threshold de detecção.
ΔV_tratamento = efeito real da intervenção de GEO — o que queremos estimar
ΔV_modelo = efeito de atualizações silenciosas do modelo (não observável)
ΔV_concorrentes= efeito de mudanças nas menções de marcas concorrentes (parcialmente observável)
ε_estocástico = ruído estocástico — reduzível com n, mas irredutível abaixo de σ²_model
Solução parcial= Difference-in-Differences com marcas de controle no mesmo setor
4.3 Entre 50% e 90% das citações não são suportadas pelas fontes que citam
Um estudo publicado em Nature Communications, avaliando sete LLMs principais em domínios de saúde, encontrou que entre 50% e 90% das respostas de LLM não são completamente suportadas pelas fontes que citam. Em uma fração substancial dos casos, as fontes citadas contradizem ativamente as afirmações para as quais são referenciadas.
Para métricas de GEO, isso significa que uma citação não é evidência de que o conteúdo da marca foi usado — pode ser evidência de que o nome da fonte apareceu em algum ponto do processo de recuperação enquanto o modelo gerava texto de sua memória paramétrica. A distinção entre citation-as-retrieval e citation-as-confabulation é um problema aberto sem solução metodológica estabelecida.
Se entre 50% e 90% das citações não são genuinamente suportadas pelas fontes citadas, então uma parcela significativa do que as ferramentas de GEO contam como “sua fonte foi citada” pode ser o modelo usando a marca como rótulo de credibilidade enquanto gera texto de sua memória paramétrica. Isso não é sem valor — a citação ainda expõe o nome da marca — mas é radicalmente diferente de “seu conteúdo influenciou a resposta”, que é a promessa implícita de toda estratégia de GEO baseada em produção de conteúdo.
Concentração Gini: Por que Menos de 10 Domínios Capturam Tudo
5.1 O coeficiente de Gini aplicado à distribuição de citações em GEO
O coeficiente de Gini, originalmente desenvolvido para medir desigualdade de renda, é uma medida natural de concentração de citações em GEO. Schulte (arXiv:2604.07585) aplicou o Gini à distribuição de citações por domínio, encontrando um valor médio de 0.715 — semelhante à concentração de renda de países com alta desigualdade.
f_i = proporção de citações do domínio i (domínios ordenados do menos ao mais citado)
F_i = proporção cumulativa de citações até o domínio i (curva de Lorenz)
G = 0.715= domínio top-10% captura ~82% das citações — análogo a “10 domínios capturam 80% das respostas”
G = 0.782= Google AI Mode — maior concentração: resultado ainda mais dominado por poucos domínios
5.2 Os 82% de respostas sem citação externa — implicação para métricas de GEO
Um achado particularmente perturbador para o campo de GEO: em alguns sistemas, 82% das respostas não contêm nenhum website externo citado. O modelo responde inteiramente a partir da memória paramétrica. Isso não é uma falha — é comportamento documentado e consistente com a arquitetura dos modelos.
Para métricas de GEO, isso significa que todas as estratégias focadas em “fazer meu conteúdo ser citado” são irrelevantes para 82% das interações nesses sistemas. A citação URL é um evento relativamente raro — e as ferramentas de GEO que medem citation rate estão medindo a cauda da distribuição de comportamento, não o comportamento central.
A literatura distingue citação (referência explícita com link ou nome de fonte) de menção (aparição do nome da marca no texto sem atribuição de fonte). Ferramentas diferentes medem objetos diferentes — algunas contam citações, outras contam menções, outras contam ambas. Uma marca pode ter alta taxa de menção e zero citações (o modelo conhece a marca pela memória paramétrica mas não a atribui a uma fonte recuperada). Comparar mention rate de uma ferramenta com citation rate de outra é comparar maçãs com laranjas.
Validade Cross-Engine: Por que Engines Diferentes São Populações Diferentes
6.1 O sobreposição de citações entre motores — dados empíricos
O estudo de Wellows, que analisou 22,7 milhões de citações em cinco motores, encontrou que Perplexity nunca cita 89% do que o ChatGPT cita na mesma questão. Os motores concordam sobre as marcas que nomeiam 4,5 vezes mais frequentemente do que sobre as páginas exatas que citam. Isso revela uma estrutura importante: o conhecimento paramétrico sobre marcas (quem existe no domínio) é mais consistente cross-engine do que o conhecimento de recuperação (qual página citar).
6.2 A invalidade estatística do índice agregado cross-engine
A prática comum de agregar visibilidade across engines — “sua marca tem 42% de visibilidade em IA” — é estatisticamente inválida quando os motores representam distribuições com parâmetros significativamente diferentes. Um índice agregado de ChatGPT + Gemini + Perplexity + Claude mescla populações heterogêneas como se fossem a mesma.
p̄ = média ponderada de visibilidade across engines
n_m = número de observações no motor m
χ² = estatística de teste; rejeitar H₀ se χ² > χ²_{α, |M|-1}
Se H₀ rejeitada= engines são heterogêneos — agregar em índice único é estatisticamente inválido
Na prática= H₀ será quase sempre rejeitada dados os dados de Wellows (89% de divergência de citação)
Métricas de GEO devem ser reportadas por motor separadamente, com intervalos de confiança por motor. Um índice agregado pode ser útil como summary statistic, mas deve ser acompanhado de um teste de homogeneidade e, se H₀ é rejeitada, uma advertência explícita de que os motores têm comportamentos divergentes. A prática atual de apresentar um único número “visibilidade em IA” mascara heterogeneidade estrutural que tem implicações diretas para estratégia de alocação de esforço de GEO.
Um Framework de Mensuração com Validade Defensável
7.1 Os quatro critérios de validade para métricas de GEO
A partir das críticas dos capítulos anteriores, derivamos quatro critérios que uma métrica de GEO deve satisfazer para ser considerada válida para fins de tomada de decisão estratégica.
| Critério | Definição | Violado por | Status Atual do Campo |
|---|---|---|---|
| Reprodutibilidade | Resultados consistentes entre execuções com n suficiente | Medição única (single-shot) | Frequentemente violado |
| Validade de Construto | A métrica mede o que afirma medir | PAWC dentro de fonte pré-fornecida vs. probabilidade de recuperação | Parcialmente válido |
| Validade Causal | Variação na métrica é atribuível à intervenção, não a confundidores | Ausência de grupo de controle e design experimental | Quase nunca válido |
| Equivalência Cross-Engine | Mesma métrica é comparável entre motores | Agregação de engines heterogêneos sem teste de homogeneidade | Frequentemente violado |
| Relevância de Negócio | Variação na métrica correlaciona com outcomes de negócio | Métricas puramente de visibilidade sem validação de impacto downstream | Não estabelecida |
7.2 O protocolo mínimo de medição defensável
IC₉₅ = intervalo de confiança de 95% — deve ser reportado em todo relatório de GEO
n_total = número total de observações — deve ser reportado para avaliar a precisão
motor_m = motor específico — nunca agregar sem teste de homogeneidade (Eq. 6.1)
período_obs= janela temporal de coleta — 14 dias mínimo recomendado (Schulte 2026)
z_{α/2}= 1.96 para α=0.05 (probabilidade de falso positivo)
z_β = 0.84 para poder=80%; 1.28 para poder=90%
p̄ = visibilidade média esperada = (p₁+p₂)/2
Exemplo= com n=500 obs. e p̄=0.30: MDD ≈ 0.08 — só variações acima de 8 pontos percentuais são detectáveis
Implicação= a maioria dos “ganhos” de GEO reportados são abaixo do MDD das medições que os detectaram
Síntese Crítica: O Que GEO Pode e Não Pode Afirmar
8.1 O que a evidência atual suporta
8.2 O caminho para métricas de GEO com validade defensável
O campo de GEO tem o problema habitual de disciplinas nascentes orientadas a mercado: a demanda por resultados imediatos pressiona por afirmações antes que a metodologia de medição seja madura. Isso cria um ciclo onde ferramentas oferecem números com aparência de precisão, clientes pagam por esses números, e a pressão por justificar o investimento produz interpretações causais de dados observacionais.
A saída não é abandonar a mensuração — é elevar seus padrões. Três mudanças são necessárias: (1) relatórios que incluam IC 95% e n_total explicitamente, tornando a incerteza visível; (2) designs quasi-experimentais com grupos de controle de marcas, permitindo separar efeito de tratamento de variância temporal; e (3) validação de métricas de GEO contra outcomes de negócio downstream — tráfego de referência, pesquisa de marca, share of voice, para estabelecer a cadeia causal que hoje é assumida mas não verificada.
O maior risco do GEO como campo não é que as estratégias não funcionem. É que o campo desenvolva um ecossistema de métricas que parecem precisas, geram dashboards coloridos, e não têm validade estatística suficiente para distinguir sinal de ruído. Quando as métricas de um campo não conseguem detectar o efeito das próprias intervenções que o campo recomenda, o campo está vendendo convicção, não evidência. O padrão mínimo é: reportar incerteza, exigir grupos de controle, validar contra negócio.