A Validade das Métricas de GEO — Raphael Sousa Pereira · Negócio no Mapa
Negócio no Mapa · Série GEO Acadêmica · Vol. 4 · 2026

A Validade das Métricas de GEO

Opacidade algorítmica, alta variabilidade estocástica e evidências frágeis: uma análise crítica do estado da arte da mensuração em Generative Engine Optimization — o que os dashboards mostram, o que escondem, e o que ainda não sabemos medir.

Análise Crítica · 2026
RS
Raphael Sousa Pereira
Gerente Nacional de Inteligência de Dados · Negócio no Mapa
8
Capítulos
28
Referências
12
Equações
0.715
Gini médio
Prefácio

O campo que ainda não sabe o que está medindo

“We can see when a generative engine cites content, but not why. Was it a specific phrase, a unique data point, or the combination of structured data and overall authority? Because LLMs are opaque neural networks, their decision-making is hard to reverse-engineer.” — Search Engine Land, Measuring GEO: What’s Trackable Now and What’s Still Missing (2025)

Em três anos de existência como disciplina formal, GEO desenvolveu dashboards, ferramentas de monitoramento, métricas proprietárias e um vocabulário específico de visibilidade, share of voice e citation rate. O que não desenvolveu com a mesma velocidade é um corpus de evidências robustas sobre a validade dessas métricas — se elas medem o que afirmam medir, se são reproduzíveis, e se as intervenções que afirmam produzir ganhos realmente os produzem.

Este livro não é uma refutação do GEO como prática. É uma análise crítica de seus instrumentos de medição. A distinção importa: podemos acreditar que influenciar a percepção de marca em motores generativos é um objetivo válido — e simultaneamente reconhecer que as métricas atuais são inadequadas para confirmar quando esse objetivo está sendo atingido, por quanto, e por quê.

Os problemas são estruturais. A natureza estocástica dos LLMs significa que a mesma query produz resultados diferentes em execuções distintas. A opacidade dos sistemas de recuperação significa que não sabemos por que um modelo cita uma fonte e não outra. A ausência de padronização significa que “visibility score” de uma ferramenta é incomparável com “mention rate” de outra. E o estudo seminal de Princeton — que afirma ganhos de “até 40%” — contém limitações metodológicas graves que raramente são discutidas nas coberturas do campo.

“

Um campo que não questiona seus instrumentos de medição não é uma ciência — é uma ideologia. GEO está em risco de se tornar o segundo caso de uma prática de marketing digital que prometeu resultados antes de ter os meios de verificá-los. A distinção entre “contagem de menções” e “audit de visibilidade com validade estatística” é a diferença entre saber que algo aconteceu e saber que você causou que acontecesse.

RS
Raphael Sousa Pereira
Gerente Nacional de Inteligência de Dados · Negócio no Mapa
Capítulo 1

O Problema da Medição em Motores Generativos

“Traditional search behavior is repetitive — millions of identical phrases drive stable volume metrics. LLM interactions are conversational and variable. That makes pattern recognition harder with small datasets but feasible at scale. These structural differences explain why LLM visibility demands a different measurement model.” — Search Engine Land, LLM Optimization in 2026 (2025)

1.1 Por que SEO e GEO são problemas de medição fundamentalmente diferentes

Em SEO, a unidade de medição é determinística: uma query específica, feita a partir de uma localização específica em anonimato, retorna uma lista de links ordenada. Essa lista é observável, registrável e reproduzível. Variações existem (personalização, localização, hora do dia) mas são controláveis. O objeto de medição — posição no SERP — é estável o suficiente para que qualquer ferramenta possa rastreá-lo com alta confiabilidade.

Em GEO, a unidade de medição é probabilística. O mesmo prompt submetido ao mesmo modelo em momentos diferentes pode produzir respostas distintas — não por erro, mas por design. A temperatura de amostragem dos transformers introduz aleatoriedade intencional. Isso transforma a medição de uma observação em uma estimativa estatística, com todas as implicações metodológicas que isso implica: tamanho de amostra, intervalos de confiança, poder estatístico, e a distinção entre efeito verdadeiro e ruído.

Equação 1.1 — Variância de Estimativa de Visibilidade em LLMEq. 1.1
Var(V̂_marca) = p(1−p)/n + σ²_model/n + σ²_temporal
V̂_marca = estimativa de visibilidade da marca — proporção de prompts em que a marca é mencionada
p(1−p)/n = variância amostral binomial: reduz com n (número de execuções de prompt)
σ²_model = variância intrínseca do modelo — estochasticidade do LLM mesmo para o mesmo prompt
σ²_temporal= variância temporal — mudanças no modelo, no índice RAG e no corpus entre medições
σ²_temporal= não é reduzível por n — é o “piso” de incerteza irredutível de qualquer medição de GEO

1.2 A taxonomia de erros de medição em GEO

Os erros de medição em GEO não são aleatórios — eles têm padrões identificáveis. A literatura emergente identifica cinco categorias principais, com implicações distintas para a validade das métricas.

Erro Tipo 1 — Submedição

Single-shot measurement: medir visibilidade com uma única execução de cada prompt. A stochasticidade do LLM significa que uma única observação não é representativa. Schulte (arXiv:2604.07585) demonstrou que observações de ponto único em GEO são não-confiáveis — o Gini médio de 0.715 implica que uma única resposta pode capturar a marca dominante ou uma marca minoritária, sem forma de distinguir.

Erro Tipo 2 — Confundimento Temporal

Mudanças externas não controladas: medir visibilidade em t₁ e t₂ sem controlar para atualizações de modelo, mudanças de índice RAG e sazonalidade de corpus. Uma variação observada pode ser efeito de uma intervenção de GEO ou de uma atualização silenciosa do modelo — impossível distinguir sem grupo de controle.

Erro Tipo 3 — Viés de Seleção de Prompt

Cherry-picking de queries: medir com prompts onde a marca tem vantagem estrutural. Um benchmark de 5 queries que mencionam a categoria exata onde a marca é líder não é representativo do universo real de queries de usuários.

Erro Tipo 4 — Não-Equivalência entre Motores

Agregação cross-engine inválida: calcular uma métrica única de “visibilidade em IA” agregando ChatGPT, Gemini, Perplexity e Claude como se fossem equivalentes. Cada motor tem mecanismos de recuperação, fontes de treinamento e distribuições de citação distintas — um índice agregado mescla populações heterogêneas.

Erro Tipo 5 — Conflação Menção/Citação

Tratar presença como endorsement: contar toda menção da marca como positiva, sem distinguir menção positiva, negativa, neutra ou com fato incorreto. Uma marca mencionada como “empresa criticada por práticas antiéticas” conta como visibilidade positiva em métricas ingênuas de mention rate.

Capítulo 2

Variabilidade Estocástica: O Problema de Medir o Inestável

“The stochastic nature of LLM outputs means that a single query yields only a noisy estimate of the underlying brand recommendation probability. Repeated-measures designs are necessary — single-shot queries cannot reliably characterise a brand’s AI recommendation presence.” — arXiv:2606.23057, Who Owns the AI Recommendation? (2026)

2.1 O estudo Schulte — dados empíricos sobre variabilidade

O trabalho mais rigoroso publicado sobre variabilidade de métricas de GEO até agosto de 2026 é o de Julius Schulte (arXiv:2604.07585, “Don’t Measure Once”), que coletou dados de janeiro a março de 2026 com 1.726 séries binárias por-marca, 40–46 dias de observação por campanha, 4 motores, 8 prompts por campanha. O estudo é o primeiro a separar empiricamente variância estocástica intrínseca (mesmo prompt, mesmo dia, múltiplas execuções) de variância temporal (mesmo prompt, dias diferentes).

Dados Empíricos — Schulte, arXiv:2604.07585 (Jan–Mar 2026)
1.726
Séries por-marca
3 campanhas × 4 motores × 8 prompts
40–46
Dias por campanha
Observação longitudinal controlada
0.715
Gini médio
Concentração de citações — altíssima desigualdade
0.782
Gini Google AI Mode
Maior concentração entre os 4 motores
0.671
Gini Perplexity
Menor concentração — distribuição menos desigual
0.750
Gini Telecom
Setor de maior concentração

2.2 Formalização — tamanho mínimo de amostra para estimativa confiável

Lior et al. (2025) derivaram de primeiros princípios os requisitos de tamanho de amostra mínimo para avaliação confiável de LLMs. Para GEO, isso se traduz em: dado um nível de confiança desejado e uma margem de erro aceitável, quantas execuções de prompt são necessárias para que a estimativa de visibilidade seja estatisticamente confiável?

Equação 2.1 — Tamanho Mínimo de Amostra para Estimativa de VisibilidadeEq. 2.1
n_min = z²_{α/2} · p̂(1−p̂) / ε²
z_{α/2}= quantil da normal padrão: z=1.96 (α=0.05, 95% de confiança); z=2.576 (99%)
p̂ = estimativa prévia de visibilidade (usar 0.5 sem estimativa — maximiza n_min)
ε = margem de erro aceitável: ε=0.05 (±5 pontos percentuais de visibilidade)
Para p̂=0.5, ε=0.05, α=0.05: n_min = 1.96² × 0.25 / 0.0025 = 384 execuções por prompt
Para ε=0.10 (±10%): n_min = 96 execuções — ainda muito acima do que a maioria das ferramentas usa
O gap entre o necessário e o praticado
1Para p̂=0.3, ε=0.05, IC 95%: n_min = 1.96²·0.21/0.0025 = 323 execuçõesbrand de visibilidade moderada
2Ferramentas típicas de GEO: 1–10 execuções por prompt na maioria dos casosprática de mercado observada
3Gap: 30x a 300x abaixo do mínimo necessário para ε=0.05consequência: estimativas com enorme incerteza
4Com n=10: IC 95% real é ±31% (não ±5%) — praticamente qualquer valor é possívelcalculado via fórmula inversa de IC binomial
5Conclusão: relatórios baseados em n<50 por prompt devem apresentar ICs explícitosrecomendação metodológica para o campo

2.3 O modelo polling — a solução que o campo está adotando

A abordagem que emerge como melhor prática é inspirada em previsão eleitoral — o polling model: definir uma amostra representativa de 250–500 queries de alta intenção, executá-las com frequência regular (diária ou semanal), e calcular métricas de visibilidade sobre o agregado. Isso transforma cada execução de prompt em uma observação de uma distribuição, e a estimativa de visibilidade em uma média amostral com intervalos de confiança calculáveis.

Equação 2.2 — Intervalo de Confiança para Share of Model via PollingEq. 2.2
IC₉₅(SoM) = [p̂ − 1.96·SE, p̂ + 1.96·SE] onde SE = √(p̂(1−p̂) / n_total)
p̂ = proporção de respostas que mencionam a marca no conjunto total de execuções
SE = erro padrão da estimativa — decresce com √n_total
n_total = número de prompts × execuções por prompt × períodos de observação
Exemplo: n_total = 300 prompts × 5 execuções × 4 semanas = 6.000 observações → SE ≈ 0.006 → IC ±1.2%
⚠
Problema Irredutível — σ²_temporal

Mesmo com n_total alto, a variância temporal σ²_temporal não é reduzida por aumentar n. Atualizações silenciosas de modelo, mudanças de índice RAG e evolução do corpus ocorrem continuamente — e são indistinguíveis, a partir de dados de output, de variação estocástica normal. A única mitigação parcial é executar prompts de controle para os quais a resposta esperada é conhecida e estável, e monitorar desvios para detectar mudanças de sistema.

Capítulo 3

Crítica ao PAWC: O Que a Métrica do Estudo de Princeton Realmente Mede

“The up-to-40% figure derives primarily from the increase in PAWC from 19.3 to 27.2 for Quotation Addition, or approximately 41% in relative terms. This result does not mean that 40% more readers will click, nor that a page will gain 40% in retrieval probability. It means that, in this testbed, a source already provided to the generator receives a larger position-weighted share of attributed text.” — arXiv:2607.14035, Optimizing Visibility in Generative Engines: A Critical Survey (2026)

3.1 O que é o PAWC e como foi construído

Position-Adjusted Word Count (PAWC) é a métrica de visibilidade proposta pelo estudo seminal de Aggarwal et al. (KDD 2024). A intuição é que palavras atribuídas a uma fonte aparecem em diferentes posições dentro da resposta gerada pelo LLM — palavras citadas no início têm mais peso do que palavras citadas no final, porque usuários tendem a prestar mais atenção ao início das respostas.

Equação 3.1 — Position-Adjusted Word Count (PAWC)Eq. 3.1
PAWC(s) = ∑w ∈ words(s) (1 / rank(w)) · 𝟙[w atribuída a s] Visibility(s) = PAWC(s) / ∑s’ PAWC(s’)
s = fonte (source) cujo PAWC está sendo calculado
rank(w) = posição da palavra w na resposta gerada (1 = primeira palavra)
𝟙[·] = função indicadora: 1 se a palavra w é atribuída à fonte s, 0 caso contrário
Visibility= share normalizado da fonte s — soma das visibilities de todas as fontes = 1
Propriedade= PAWC é relativo e redistributivo: ganho de uma fonte implica perda de outra

3.2 Seis limitações críticas do PAWC que raramente são discutidas

O que o PAWC afirma / implica
Ganhos de 30–40% em visibilidade por estratégias de otimização
Correlação com atenção do usuário via desconto posicional
Aplicável a fontes em produção, rastreadas organicamente
Juiz subjetivo (LLM) calibrado independentemente
Generalizável para diferentes motores e domínios
Representativo de ganhos de tráfego ou recall de marca
O que os dados realmente mostram
Ganho relativo dentro de um conjunto fechado de 5 fontes pré-fornecidas ao gerador
Desconto posicional assume modelo linear não empiricamente validado
Testbed usa textos carregados como arquivos, não páginas rastreadas organicamente
Juiz LLM é da mesma família de modelos — viés circular; renormalizado para PAWC
200 exemplos no Perplexity; testado num único motor; domínio não especificado
Nenhuma evidência de correlação com CTR, tráfego ou qualquer métrica de negócio
◈
A confusão semântica central do PAWC

O estudo de Princeton mede visibilidade dentro de um documento já recuperado. O problema de GEO mais relevante para marcas é um nível anterior: a probabilidade de que um documento seja recuperado e incluído no contexto do gerador. PAWC nada diz sobre esse estágio. Uma melhoria de 40% em PAWC de um documento que raramente é recuperado vale menos do que uma melhoria de 5% em PAWC de um documento recuperado em todas as queries da categoria.

3.3 O problema da Subjective Impression — o juiz que julga a si mesmo

O terceiro componente do benchmark de Princeton — Subjective Impression — é um score de 1 a 5 gerado por um LLM da mesma família de modelos que produz as respostas sendo avaliadas. A literature de avaliação de LLMs documenta extensivamente o problema de self-preference bias: modelos tendem a avaliar mais positivamente outputs de modelos similares a si mesmos. O estudo de Aggarwal renormaliza esse score para a distribuição de PAWC — uma operação que mascara o problema sem resolvê-lo.

Equação 3.2 — Viés Circular na Avaliação LLM-as-JudgeEq. 3.2
E[Score_juiz(output_A, juiz_B)] ≠ E[Score_juiz(output_A, juiz_C)] Viés = E[Score(A,B)] − E[Score(A,C)] quando B ≈ A e C ≇ A
A = output do modelo sendo avaliado
B = juiz LLM da mesma família que A (ex: GPT-4 avaliando outputs de GPT-4o)
C = juiz LLM de família diferente
Viés = diferença sistemática de score quando juiz e avaliado são do mesmo modelo
Implicação= Subjective Impression do GEO-Bench é inflado para documentos que favorecem o estilo de geração da família de modelos usada como juiz
Capítulo 4

Opacidade Algorítmica: O Problema do Porquê

“Without that visibility into the ‘why’, it’s difficult to replicate success. Generative engines often blend information from multiple sources into one answer. It’s nearly impossible to measure each source’s weight or contribution.” — Search Engine Land, Measuring GEO (2025)

4.1 O abismo entre Academia e Indústria nas métricas de GEO

A pesquisa acadêmica e a prática industrial de GEO usam métricas fundamentalmente diferentes — com origens, objetivos e problemas distintos. O Position Paper de Governança de GEO (arXiv:2606.12439) mapeou esse fosso sistematicamente:

DimensãoAcademia (GEO-Bench, Aggarwal et al.)Indústria (Profound, Rankprompt, etc.)
Métrica primáriaPAWC, nDCG@k, Recall@k, ranking positionCitation frequency, mention rate, answer visibility, SoM
Métodos de otimizaçãoGCG, TAP, LLM-based rewriting explícitaLLM-guided content generation, multi-platform distribution
O que capturamMovimento dentro de lista intermediária de recuperaçãoSe a fonte sobrevive recuperação + síntese na resposta final
Relevância comercialIndireta — rankeamento não é resultado de negócioDireta — visibilidade na resposta final é o que o usuário vê
Limitação principalTestbeds artificiais, fontes pré-fornecidas, motor únicoOpacidade total — sabe o QUE aconteceu, não o POR QUÊ

Tabela 4.1 — Mapeamento do fosso entre métricas acadêmicas e industriais de GEO. Adaptado de arXiv:2606.12439 com análise própria.

4.2 O que os LLMs não revelam sobre suas decisões de citação

A opacidade algorítmica de GEO tem três dimensões: não sabemos quais fontes foram recuperadas mas não citadas (o índice de recuperação não é público), não sabemos o peso relativo de cada fator de decisão (relevância topical, autoridade de domínio, freshness, formato, densidade de fatos), e não sabemos como esses fatores interagem para produzir uma resposta específica.

Isso tem consequência direta para a validade de qualquer atribuição causal em GEO: se uma marca passou de 20% para 35% de mention rate após publicar um artigo longo com estatísticas, não há como confirmar que foi o artigo que causou o aumento, versus uma atualização de modelo, uma queda de concorrente, ou variância estocástica normal acima do threshold de detecção.

Equação 4.1 — O Problema de Identificação Causal em GEOEq. 4.1
ΔV_observado = ΔV_tratamento + ΔV_modelo + ΔV_concorrentes + ε_estocástico Problema: os 4 termos são observacionalmente indistinguíveis sem grupo de controle
ΔV_observado = variação de visibilidade medida entre t₁ e t₂
ΔV_tratamento = efeito real da intervenção de GEO — o que queremos estimar
ΔV_modelo = efeito de atualizações silenciosas do modelo (não observável)
ΔV_concorrentes= efeito de mudanças nas menções de marcas concorrentes (parcialmente observável)
ε_estocástico = ruído estocástico — reduzível com n, mas irredutível abaixo de σ²_model
Solução parcial= Difference-in-Differences com marcas de controle no mesmo setor

4.3 Entre 50% e 90% das citações não são suportadas pelas fontes que citam

Um estudo publicado em Nature Communications, avaliando sete LLMs principais em domínios de saúde, encontrou que entre 50% e 90% das respostas de LLM não são completamente suportadas pelas fontes que citam. Em uma fração substancial dos casos, as fontes citadas contradizem ativamente as afirmações para as quais são referenciadas.

Para métricas de GEO, isso significa que uma citação não é evidência de que o conteúdo da marca foi usado — pode ser evidência de que o nome da fonte apareceu em algum ponto do processo de recuperação enquanto o modelo gerava texto de sua memória paramétrica. A distinção entre citation-as-retrieval e citation-as-confabulation é um problema aberto sem solução metodológica estabelecida.

⚠
Implicação Crítica para ROI de GEO

Se entre 50% e 90% das citações não são genuinamente suportadas pelas fontes citadas, então uma parcela significativa do que as ferramentas de GEO contam como “sua fonte foi citada” pode ser o modelo usando a marca como rótulo de credibilidade enquanto gera texto de sua memória paramétrica. Isso não é sem valor — a citação ainda expõe o nome da marca — mas é radicalmente diferente de “seu conteúdo influenciou a resposta”, que é a promessa implícita de toda estratégia de GEO baseada em produção de conteúdo.

Capítulo 5

Concentração Gini: Por que Menos de 10 Domínios Capturam Tudo

“Fewer than ten distinct URLs appear in eighty percent of responses across all systems analyzed. Some systems display strong reliance on parametric knowledge, with 82% of responses containing no cited external websites at all.” — DailyGEOInsights, How LLMs Decide Whom to Cite (2026)

5.1 O coeficiente de Gini aplicado à distribuição de citações em GEO

O coeficiente de Gini, originalmente desenvolvido para medir desigualdade de renda, é uma medida natural de concentração de citações em GEO. Schulte (arXiv:2604.07585) aplicou o Gini à distribuição de citações por domínio, encontrando um valor médio de 0.715 — semelhante à concentração de renda de países com alta desigualdade.

Equação 5.1 — Coeficiente de Gini de Citações em GEOEq. 5.1
G = 1 − 2 · ∑i=1n f_i · (F_i − F_{i-1})
G ∈ [0,1]= 0 = distribuição perfeitamente igual; 1 = um único domínio captura todas as citações
f_i = proporção de citações do domínio i (domínios ordenados do menos ao mais citado)
F_i = proporção cumulativa de citações até o domínio i (curva de Lorenz)
G = 0.715= domínio top-10% captura ~82% das citações — análogo a “10 domínios capturam 80% das respostas”
G = 0.782= Google AI Mode — maior concentração: resultado ainda mais dominado por poucos domínios
Interpretação do Gini = 0.715 para estratégia de marca
1G=0.715 implica que a curva de Lorenz passa por aprox. (0.9, 0.18)90% dos domínios capturam apenas 18% das citações
2Os top 10% de domínios capturam ~82% de todas as citações nos 4 motoresconcentração extrema — mercado de citações é “winner-takes-most”
3Para uma nova marca: probabilidade de entrada no top-10% de citações é muito baixa a prioriefeito de entrincheiramento dos domínios já estabelecidos
440–60% de drift mensal de citações (DailyGEOInsights 2026) mesmo com Gini altoparadoxo: concentração estrutural + alta variabilidade temporal
5Estratégia: entrar em domínios do top-10% (Wikipedia, Reddit, G2) > criar conteúdo próprioimplicação prática do Gini para alocação de esforço de GEO

5.2 Os 82% de respostas sem citação externa — implicação para métricas de GEO

Um achado particularmente perturbador para o campo de GEO: em alguns sistemas, 82% das respostas não contêm nenhum website externo citado. O modelo responde inteiramente a partir da memória paramétrica. Isso não é uma falha — é comportamento documentado e consistente com a arquitetura dos modelos.

Para métricas de GEO, isso significa que todas as estratégias focadas em “fazer meu conteúdo ser citado” são irrelevantes para 82% das interações nesses sistemas. A citação URL é um evento relativamente raro — e as ferramentas de GEO que medem citation rate estão medindo a cauda da distribuição de comportamento, não o comportamento central.

◈
Distinção Crítica: Citation vs. Mention

A literatura distingue citação (referência explícita com link ou nome de fonte) de menção (aparição do nome da marca no texto sem atribuição de fonte). Ferramentas diferentes medem objetos diferentes — algunas contam citações, outras contam menções, outras contam ambas. Uma marca pode ter alta taxa de menção e zero citações (o modelo conhece a marca pela memória paramétrica mas não a atribui a uma fonte recuperada). Comparar mention rate de uma ferramenta com citation rate de outra é comparar maçãs com laranjas.

Capítulo 6

Validade Cross-Engine: Por que Engines Diferentes São Populações Diferentes

“Perplexity never cites 89% of what ChatGPT cites on the same question. The engines agree on the brands they name about 4.5x more often than on exact pages. Visibility in one engine does not transfer to another.” — Wellows, LLM Citation Trends for AI Search (2025)

6.1 O sobreposição de citações entre motores — dados empíricos

O estudo de Wellows, que analisou 22,7 milhões de citações em cinco motores, encontrou que Perplexity nunca cita 89% do que o ChatGPT cita na mesma questão. Os motores concordam sobre as marcas que nomeiam 4,5 vezes mais frequentemente do que sobre as páginas exatas que citam. Isso revela uma estrutura importante: o conhecimento paramétrico sobre marcas (quem existe no domínio) é mais consistente cross-engine do que o conhecimento de recuperação (qual página citar).

Dados Wellows — 22,7 milhões de citações, 5 motores (Dez 2025–Mar 2026)
89%
Citações do ChatGPT
nunca citadas pelo Perplexity na mesma query
4.5×
Maior concordância
em marcas (vs. em páginas específicas)
2.8×
Maior probabilidade
de citação: marcas em Wikipedia + Reddit + G2 simultaneamente

6.2 A invalidade estatística do índice agregado cross-engine

A prática comum de agregar visibilidade across engines — “sua marca tem 42% de visibilidade em IA” — é estatisticamente inválida quando os motores representam distribuições com parâmetros significativamente diferentes. Um índice agregado de ChatGPT + Gemini + Perplexity + Claude mescla populações heterogêneas como se fossem a mesma.

Equação 6.1 — Teste de Homogeneidade para Validade de Agregação Cross-EngineEq. 6.1
H₀: p_ChatGPT = p_Gemini = p_Perplexity = p_Claude χ² = ∑m∈M n_m · (p̂_m − p̄)² / (p̄(1−p̄)) ~ χ²(|M|−1)
p_m = probabilidade de menção da marca no motor m
p̄ = média ponderada de visibilidade across engines
n_m = número de observações no motor m
χ² = estatística de teste; rejeitar H₀ se χ² > χ²_{α, |M|-1}
Se H₀ rejeitada= engines são heterogêneos — agregar em índice único é estatisticamente inválido
Na prática= H₀ será quase sempre rejeitada dados os dados de Wellows (89% de divergência de citação)
◈
Recomendação Metodológica

Métricas de GEO devem ser reportadas por motor separadamente, com intervalos de confiança por motor. Um índice agregado pode ser útil como summary statistic, mas deve ser acompanhado de um teste de homogeneidade e, se H₀ é rejeitada, uma advertência explícita de que os motores têm comportamentos divergentes. A prática atual de apresentar um único número “visibilidade em IA” mascara heterogeneidade estrutural que tem implicações diretas para estratégia de alocação de esforço de GEO.

Capítulo 7

Um Framework de Mensuração com Validade Defensável

“A disciplined capture system turns each prompt run into a reproducible observation with traceable source context — the minimum standard for any serious LLM visibility audit.” — Algomizer, How to Audit Brand Visibility on LLMs (2026)

7.1 Os quatro critérios de validade para métricas de GEO

A partir das críticas dos capítulos anteriores, derivamos quatro critérios que uma métrica de GEO deve satisfazer para ser considerada válida para fins de tomada de decisão estratégica.

CritérioDefiniçãoViolado porStatus Atual do Campo
ReprodutibilidadeResultados consistentes entre execuções com n suficienteMedição única (single-shot)Frequentemente violado
Validade de ConstrutoA métrica mede o que afirma medirPAWC dentro de fonte pré-fornecida vs. probabilidade de recuperaçãoParcialmente válido
Validade CausalVariação na métrica é atribuível à intervenção, não a confundidoresAusência de grupo de controle e design experimentalQuase nunca válido
Equivalência Cross-EngineMesma métrica é comparável entre motoresAgregação de engines heterogêneos sem teste de homogeneidadeFrequentemente violado
Relevância de NegócioVariação na métrica correlaciona com outcomes de negócioMétricas puramente de visibilidade sem validação de impacto downstreamNão estabelecida

7.2 O protocolo mínimo de medição defensável

Equação 7.1 — Estimativa de Visibilidade com Incerteza ExplícitaEq. 7.1
Report(V_marca) = (p̂, IC₉₅, n_total, motor_m, período_obs) onde IC₉₅ = [p̂ − z·SE, p̂ + z·SE] e SE = √(p̂(1−p̂)/n_total)
p̂ = estimativa pontual de visibilidade — proporção de prompts com menção da marca
IC₉₅ = intervalo de confiança de 95% — deve ser reportado em todo relatório de GEO
n_total = número total de observações — deve ser reportado para avaliar a precisão
motor_m = motor específico — nunca agregar sem teste de homogeneidade (Eq. 6.1)
período_obs= janela temporal de coleta — 14 dias mínimo recomendado (Schulte 2026)
Equação 7.2 — Diferença Mínima Detectável (MDD) para Atribuição de EfeitoEq. 7.2
MDD = z_{α/2} · √(2·p̄(1−p̄)/n) + z_β · √(p₁(1−p₁)/n + p₂(1−p₂)/n)
MDD = variação mínima em p̂ que é detectável com poder estatístico β e nível α
z_{α/2}= 1.96 para α=0.05 (probabilidade de falso positivo)
z_β = 0.84 para poder=80%; 1.28 para poder=90%
p̄ = visibilidade média esperada = (p₁+p₂)/2
Exemplo= com n=500 obs. e p̄=0.30: MDD ≈ 0.08 — só variações acima de 8 pontos percentuais são detectáveis
Implicação= a maioria dos “ganhos” de GEO reportados são abaixo do MDD das medições que os detectaram
Capítulo 8

Síntese Crítica: O Que GEO Pode e Não Pode Afirmar

“Brand stature is the dominant determinant of day-1 AI visibility. The five engines diverge on sources, position, and sentiment. Unbranded visibility mostly holds when a brand does nothing, drifting down only slowly. A quarterly cadence is too slow for a medium that re-trains on its own outputs.” — arXiv:2606.20065, Generative Engine Optimization at Scale (2026)

8.1 O que a evidência atual suporta

O que GEO pode afirmar com evidência
Visibilidade de marca em LLMs é mensurável com metodologia correta (polling, n suficiente, IC explícito)
Citações se concentram massivamente em poucos domínios (Gini = 0.715 — documentado empiricamente)
Engines divergem radicalmente em comportamento de citação (89% de não-sobreposição Perplexity/ChatGPT)
Brand stature (autoridade de marca) é o preditor dominante de visibilidade — não otimização técnica isolada
Mensuração longitudinal (14+ dias, múltiplas execuções por prompt) é melhor que medição única
Conteúdo com estatísticas, citações e dados verificáveis tem maior PAWC dentro de conjuntos pré-fornecidos
O que GEO ainda não pode afirmar
“Estratégia X causou aumento Y%” — ausência de grupo de controle invalida causalidade
Que ganhos de PAWC no testbed de Princeton traduzem para ganhos de tráfego, recall ou conversão
Por que um modelo cita ou não cita uma fonte específica — opacidade do mecanismo de decisão
Que “visibilidade em IA” é uma métrica homogênea comparável entre engines e ferramentas
Que otimizações de conteúdo têm efeito duradouro (vs. efeito temporário dentro de janela de RAG)
Que entre 50–90% das citações genuinamente refletem uso do conteúdo (vs. confabulation com rótulo de fonte)

8.2 O caminho para métricas de GEO com validade defensável

O campo de GEO tem o problema habitual de disciplinas nascentes orientadas a mercado: a demanda por resultados imediatos pressiona por afirmações antes que a metodologia de medição seja madura. Isso cria um ciclo onde ferramentas oferecem números com aparência de precisão, clientes pagam por esses números, e a pressão por justificar o investimento produz interpretações causais de dados observacionais.

A saída não é abandonar a mensuração — é elevar seus padrões. Três mudanças são necessárias: (1) relatórios que incluam IC 95% e n_total explicitamente, tornando a incerteza visível; (2) designs quasi-experimentais com grupos de controle de marcas, permitindo separar efeito de tratamento de variância temporal; e (3) validação de métricas de GEO contra outcomes de negócio downstream — tráfego de referência, pesquisa de marca, share of voice, para estabelecer a cadeia causal que hoje é assumida mas não verificada.

“

O maior risco do GEO como campo não é que as estratégias não funcionem. É que o campo desenvolva um ecossistema de métricas que parecem precisas, geram dashboards coloridos, e não têm validade estatística suficiente para distinguir sinal de ruído. Quando as métricas de um campo não conseguem detectar o efeito das próprias intervenções que o campo recomenda, o campo está vendendo convicção, não evidência. O padrão mínimo é: reportar incerteza, exigir grupos de controle, validar contra negócio.

RS
Raphael Sousa Pereira
Gerente Nacional de Inteligência de Dados · Negócio no Mapa
Referências Bibliográficas

Fontes e Bibliografia

Artigos Acadêmicos e Preprints

[1]Aggarwal, P. et al. (2024). GEO: Generative Engine Optimization. ACM SIGKDD 2024. arXiv:2311.09735. Fonte do PAWC e dos ganhos de 30–40%; críticas às limitações metodológicas ao longo do Cap. 3.
[2]Schulte, J. (2026). Don’t Measure Once: Measuring Visibility in AI Search (GEO). arXiv:2604.07585. Fonte primária do Gini=0.715, dados de 1.726 séries de marca, jan–mar 2026. Cap. 2 e 5.
[3]Position: GEO Creates Underexamined Risks, Governance Must Target Concentration, Disclosure, and Academic Blind Spots. arXiv:2606.12439. Mapeamento do fosso academia vs. indústria em métricas. Cap. 4.
[4]Who Owns the AI Recommendation? Multi-Industry Empirical Map of Brand Category Ownership Across LLMs. arXiv:2606.23057. Dice roll methodology; single-shot queries não confiáveis. Cap. 2.
[5]Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines. arXiv:2606.20065 (Kumar, 2026). Brand stature como preditor dominante; 5 engines divergem; quarterly cadence lenta. Cap. 8.
[6]Per-Entity Bias Mapping for AI Visibility: Why Brand Mentions Require Entity-Specific Calibration. arXiv:2606.21595. Revisão da literatura de medição de GEO e limitações. Cap. 1.
[7]Optimizing Visibility in Generative Engines: A Critical Survey of GEO (2023–2026). arXiv:2607.14035, julho 2026. Análise crítica do PAWC; “não significa 40% mais cliques”. Cap. 3.
[8]Model Variability and Polarization in LLM Sentiment Analysis. Frontiers in AI, 2025. DOI:10.3389/frai.2025.1609097. Doze causas de variabilidade de modelo; temperatura como driver. Cap. 2.
[9]GhostCite: A Large-Scale Analysis of Citation Validity in the Age of LLMs. arXiv:2602.06718. 14.23–94.93% de hallucination rates de citação; 80.9% de aumento em 2025. Cap. 4.
[10]Geographic Variation in LLM DOI Fabrication. Publications 2025, 13(4), 49. DOI:10.3390/publications13040049. Hallucination de DOI acima de 80% em países de baixa renda. Cap. 4.
[11]Evaluating LLM Metrics Through Real-World Capabilities. arXiv:2505.08253. Lacunas de benchmarks em eficiência e interpretabilidade. Cap. 4.
[12]LLM-Metrics: Measuring Research Impact Through LLM Memory. arXiv:2605.22176. Correlações de ρ=0.1880 (2024) vs ρ=0.0559 (2023) — instabilidade de métricas de impacto via LLM. Cap. 7.
[13]Lior, A. et al. (2025). Minimum sample requirements for reliable LLM evaluation derived from first principles. Derivação formal de n_min. Equação 2.1.

Relatórios e Análises de Mercado

[14]Wellows. (2025/2026). LLM Citation Trends for AI Search. wellows.com. 22,7 milhões de citações; 89% de divergência Perplexity/ChatGPT; 4.5x mais concordância em marcas. Cap. 6.
[15]Wellows. (julho 2026). Brand Visibility in LLMs: How to Audit & Improve It. 11,1 milhões de citações, 363 marcas, 35 regiões. Cap. 1.
[16]Search Engine Land. (2025). Measuring GEO: What’s Trackable Now and What’s Still Missing. Opacidade algorítmica; impossibilidade de atribuição granular. Cap. 4.
[17]Search Engine Land. (2025). LLM Optimization in 2026: Tracking, Visibility, and What’s Next. Polling model 250–500 queries; variabilidade conversacional. Cap. 2.
[18]DailyGEOInsights. (2026). How LLMs Decide Whom to Cite: 2026 Research Analysis. Menos de 10 URLs em 80% das respostas; 82% sem citação externa; 50–90% não suportadas. Cap. 4, 5.
[19]Algomizer. (maio 2026). How to Audit Brand Visibility on LLMs: A GEO Playbook. Variância não controlada; capture layer failures. Cap. 7.
[20]Incremys. (março 2026). LLM Audit and SEO: Managing Citations, Sources and ROI. CTR posição 1: 7.3%→2.6% com AI Overviews (março 2024–2025). Cap. 1.
[21]ThedigitalBloom. (2026). 2025 AI Visibility Report: How LLMs Choose What Sources to Mention. 40–60% de drift mensal de citações. Cap. 5.
[22]Trackmyvisibility. (2026). How to Get LLM Citations: The Complete Guide to AI Visibility. Recency bias; cosmetic refresh detectado por modelos. Cap. 2.
Footer — Negócio no Mapa