Auditoria de peso: o GEO Score Checker é a ferramenta mais rigorosa já auditada — mas os pesos têm falhas reais

Auditoria de Peso · Ciência de Mercado em GEO · Negócio no Mapa

A ferramenta mais bem fundamentada que já auditei nesta série — e onde os pesos ainda falham

Três benchmarks acadêmicos reais, arquitetura correta, e a primeira medição real de citação por LLM que encontrei em ferramenta de mercado. Mesmo assim, a distribuição de peso tem um erro de soma, um viés estrutural que penaliza site pequeno como se fosse falha, e um critério desalinhado com o próprio caso de uso mais comum de GEO local. Auditoria completa, sem meio-termo.

Tipo de página e objetivo

Esta é a auditoria mais extensa desta série até agora, deliberadamente — porque a ferramenta auditada é a mais séria já encontrada, e é justamente com a fonte mais forte que o rigor mais importa. Auditar superficialmente uma ferramenta fraca não prova nada; auditar com profundidade uma ferramenta forte, e ainda assim encontrar falha real, é o que diferencia ciência de mercado de opinião de mercado.

Pra mim e pra Negócio no Mapa: esta página é registro público de metodologia — aplicar o mesmo padrão de verificação técnica ao trabalho mais forte que existe no setor, não só ao mais fraco, é o que sustenta a posição de auditor técnico independente em GEO, não de comentarista.

evidência · pontos fortes

Por que essa ferramenta está num patamar diferente

Verifiquei os três benchmarks citados como base teórica das dimensões principais. Os três são papers acadêmicos reais, recentes, corretamente mapeados para a dimensão certa do produto:

CC-GSEO-Benchconfirmado

arXiv 2509.05607, Zhejiang University, dez/2025. Framework de 5 dimensões (Exposure, Faithful Credit, Causal Impact, Readability, Trustworthiness) — mapeia direto para “Generation Exposure” e “Faithful Credit” do relatório.

SAGEO Arenaconfirmado

arXiv 2602.12187, Universidade Yonsei (Coreia do Sul), fev/2026. Ambiente de avaliação end-to-end testando retrieval + reranking + geração juntos — base de “Retrieval Fitness” e “Reranking Fitness”.

Answer Bubblesconfirmado

arXiv 2603.16138, citado em survey crítico recente sobre GEO. Base de “Answer Bubble Divergence”.

O diferencial real: mede citação, não só estrutura

É a primeira ferramenta desta série a consultar ao vivo ChatGPT, Claude, Gemini e Perplexity (dimensão Generation Exposure) em vez de só avaliar estrutura técnica. Isso responde exatamente à limitação que identificamos na auditoria anterior — score estrutural alto não implica citação real. Esta ferramenta mede as duas coisas, separadamente.

falha 1 · aritmética

A soma dos pesos não fecha em 100

Somando os pesos máximos declarados por dimensão (excluindo Comércio Agêntico, que é condicional e vale 0 para este site): 12 + 10 + 18 + 13 + 8 + 9 + 8 + 9 + 6 = 93 pontos, não 100.

56,4/93
soma real dos pontos obtidos sobre o total real disponível
60,6% ≈ 60
percentual resultante — o score final está matematicamente correto

O cálculo do score em si não está errado — 60,6% arredonda para o 60 exibido corretamente. O problema é de comunicação: a interface sugere uma escala de “100 pontos possíveis” sem deixar claro que o teto real declarado nas dimensões soma 93, não 100. É falha de precisão na exibição, não de matemática interna.

falha 2 · viés estrutural

“Não testado” e “reprovado” recebem a mesma nota: zero

Duas dimensões, somando 17 dos 93 pontos possíveis — cerca de 18% do score total — zeraram por ausência de dado, não por desempenho medido:

DimensãoPesoMotivo do zero
Geo-Personalization Robustness9 pts“Fase 4 — requer análise assíncrona, solicite relatório completo” — não testado
Answer Bubble Divergence8 pts“Dados insuficientes para medir divergência” — não testado

Por que isso é um viés estrutural, não um bug isolado

Sites com menor volume de reconhecimento por LLM — tipicamente negócio regional ou de porte médio, não marca global — têm mais chance de gerar “dados insuficientes” nessas duas dimensões, por definição: menos menção, menos dado pra medir consistência entre engines. O resultado é que o site menor é penalizado como se tivesse falhado num teste que, na prática, nunca rodou completo pra ele. Isso também cria um incentivo estrutural — ainda que não necessariamente intencional — para o usuário pagar pelo relatório completo pra “destravar” pontuação que tecnicamente nunca foi reprovada.

falha 3 · peso desalinhado com caso de uso

Entity Authority exige Wikidata — barra alta demais pra maioria dos casos reais

A dimensão Entity Authority (9 pts) exige match no Wikidata e no Google Knowledge Graph. Não ter entrada no Wikidata é normal para negócio local ou regional — não é, por si, sinal de baixa autoridade de entidade relevante para IA nesse contexto.

Conflito com achado já estabelecido nesta série

Já documentamos, na análise de GEO Local vs. Nacional, que para negócio local o que mais importa é presença consistente em Bing Places, Foursquare e Google Business Profile — não Wikidata, que é sinal mais relevante para marca de porte nacional ou global. Aplicar 9 pontos de peso a um critério mais adequado a outro tipo de entidade, de forma igual para qualquer site testado, é desproporcional ao caso de uso mais comum de quem usa esse tipo de ferramenta.

ponto menor · crédito generoso

llms.txt recebe nota cheia só por existir

Dentro de Retrieval Fitness, a presença de llms.txt vale nota máxima (2,4/2,4) apenas por estar presente e ter conteúdo substantivo — sem nenhuma verificação de uso real. Já documentamos que 97% desses arquivos não recebem nenhuma requisição de bot de IA. O peso individual dentro da dimensão é pequeno, mas é crédito automático concedido a um sinal cuja eficácia prática ainca não tem evidência forte.

ponto bem calibrado

O que está certo, e por que

Generation Exposure recebe o maior peso individual (18 pts) entre as dimensões medidas — e isso está correto. É a única dimensão medindo citação real por LLM, não estrutura ou elegibilidade técnica, e é exatamente o fator que a auditoria anterior desta série identificou como o de maior correlação real com visibilidade em IA. Dar a ele o maior peso é decisão de engenharia de score bem fundamentada.

síntese técnica

Conclusão da auditoria

  • 01 É a ferramenta de score de GEO mais rigorosa já auditada nesta série — base acadêmica real e verificável, arquitetura correta, e a única a medir citação real, não só estrutura.
  • 02 Mesmo assim, tem três falhas concretas: soma de peso que não fecha em 100 (comunicação, não cálculo), duas dimensões que penalizam ausência de dado como se fosse falha (~18% do score), e um critério (Entity Authority/Wikidata) desalinhado com o caso de uso mais comum.
  • 03 Recomendo o uso, com essas três ressalvas declaradas ao cliente — nenhuma delas invalida a ferramenta, mas todas mudam como o número final deve ser lido e comunicado.
  • 04 O padrão que esta auditoria estabelece: rigor técnico não se aplica só à fonte fraca — aplica-se com mais força ainda à fonte forte, porque é aí que erro passa despercebido com mais facilidade.

Essa é a distinção que sustenta auditoria técnica de verdade, em vez de comentário de mercado: elogiar o que é forte sem deixar de encontrar o que ainda falha, e vice-versa. Nenhuma ferramenta — nem a minha — deveria ficar de fora desse padrão.

RS

Raphael Sousa Pereira

CEO & fundador, Negócio no Mapa

Raphael Sousa Pereira é CEO e fundador da Negócio no Mapa, agência de inteligência de dados e marketing digital com sede em Porto Alegre, Brasil, com unidades em Brasília, Blumenau e São Paulo. É pesquisador independente em Generative Engine Optimization e criador do GBFA (Generative Brand Fidelity Engineering), motor de auditoria de fidelidade de marca em respostas de sistemas de IA generativa, fundamentado no protocolo epistêmico EVIDÊNCIA / INFERÊNCIA / HIPÓTESE aplicado também nesta auditoria.

Fontes: relatório “GEO Score” para seonegocionomapa.com.br, alexandrecaramaschi.com/ferramentas/geo-score, 20/08/2026; Chen, Q. et al., “CC-GSEO-Bench” (arXiv 2509.05607, dez/2025); Kim, S. et al., “SAGEO Arena” (arXiv 2602.12187, fev/2026); Huang, M. et al., “Answer Bubbles: Information Exposure in AI-Mediated Search” (arXiv 2603.16138, 2026); dado sobre llms.txt (Ahrefs, mai/2026) já referenciado em página anterior desta série. Consultado e verificado em 20 de agosto de 2026.

Footer — Negócio no Mapa