Auditoria de Peso · Ciência de Mercado em GEO · Negócio no Mapa
A ferramenta mais bem fundamentada que já auditei nesta série — e onde os pesos ainda falham
Três benchmarks acadêmicos reais, arquitetura correta, e a primeira medição real de citação por LLM que encontrei em ferramenta de mercado. Mesmo assim, a distribuição de peso tem um erro de soma, um viés estrutural que penaliza site pequeno como se fosse falha, e um critério desalinhado com o próprio caso de uso mais comum de GEO local. Auditoria completa, sem meio-termo.
Esta é a auditoria mais extensa desta série até agora, deliberadamente — porque a ferramenta auditada é a mais séria já encontrada, e é justamente com a fonte mais forte que o rigor mais importa. Auditar superficialmente uma ferramenta fraca não prova nada; auditar com profundidade uma ferramenta forte, e ainda assim encontrar falha real, é o que diferencia ciência de mercado de opinião de mercado.
Pra mim e pra Negócio no Mapa: esta página é registro público de metodologia — aplicar o mesmo padrão de verificação técnica ao trabalho mais forte que existe no setor, não só ao mais fraco, é o que sustenta a posição de auditor técnico independente em GEO, não de comentarista.
Por que essa ferramenta está num patamar diferente
Verifiquei os três benchmarks citados como base teórica das dimensões principais. Os três são papers acadêmicos reais, recentes, corretamente mapeados para a dimensão certa do produto:
arXiv 2509.05607, Zhejiang University, dez/2025. Framework de 5 dimensões (Exposure, Faithful Credit, Causal Impact, Readability, Trustworthiness) — mapeia direto para “Generation Exposure” e “Faithful Credit” do relatório.
arXiv 2602.12187, Universidade Yonsei (Coreia do Sul), fev/2026. Ambiente de avaliação end-to-end testando retrieval + reranking + geração juntos — base de “Retrieval Fitness” e “Reranking Fitness”.
arXiv 2603.16138, citado em survey crítico recente sobre GEO. Base de “Answer Bubble Divergence”.
O diferencial real: mede citação, não só estrutura
É a primeira ferramenta desta série a consultar ao vivo ChatGPT, Claude, Gemini e Perplexity (dimensão Generation Exposure) em vez de só avaliar estrutura técnica. Isso responde exatamente à limitação que identificamos na auditoria anterior — score estrutural alto não implica citação real. Esta ferramenta mede as duas coisas, separadamente.
A soma dos pesos não fecha em 100
Somando os pesos máximos declarados por dimensão (excluindo Comércio Agêntico, que é condicional e vale 0 para este site): 12 + 10 + 18 + 13 + 8 + 9 + 8 + 9 + 6 = 93 pontos, não 100.
O cálculo do score em si não está errado — 60,6% arredonda para o 60 exibido corretamente. O problema é de comunicação: a interface sugere uma escala de “100 pontos possíveis” sem deixar claro que o teto real declarado nas dimensões soma 93, não 100. É falha de precisão na exibição, não de matemática interna.
“Não testado” e “reprovado” recebem a mesma nota: zero
Duas dimensões, somando 17 dos 93 pontos possíveis — cerca de 18% do score total — zeraram por ausência de dado, não por desempenho medido:
| Dimensão | Peso | Motivo do zero |
|---|---|---|
| Geo-Personalization Robustness | 9 pts | “Fase 4 — requer análise assíncrona, solicite relatório completo” — não testado |
| Answer Bubble Divergence | 8 pts | “Dados insuficientes para medir divergência” — não testado |
Por que isso é um viés estrutural, não um bug isolado
Sites com menor volume de reconhecimento por LLM — tipicamente negócio regional ou de porte médio, não marca global — têm mais chance de gerar “dados insuficientes” nessas duas dimensões, por definição: menos menção, menos dado pra medir consistência entre engines. O resultado é que o site menor é penalizado como se tivesse falhado num teste que, na prática, nunca rodou completo pra ele. Isso também cria um incentivo estrutural — ainda que não necessariamente intencional — para o usuário pagar pelo relatório completo pra “destravar” pontuação que tecnicamente nunca foi reprovada.
Entity Authority exige Wikidata — barra alta demais pra maioria dos casos reais
A dimensão Entity Authority (9 pts) exige match no Wikidata e no Google Knowledge Graph. Não ter entrada no Wikidata é normal para negócio local ou regional — não é, por si, sinal de baixa autoridade de entidade relevante para IA nesse contexto.
Conflito com achado já estabelecido nesta série
Já documentamos, na análise de GEO Local vs. Nacional, que para negócio local o que mais importa é presença consistente em Bing Places, Foursquare e Google Business Profile — não Wikidata, que é sinal mais relevante para marca de porte nacional ou global. Aplicar 9 pontos de peso a um critério mais adequado a outro tipo de entidade, de forma igual para qualquer site testado, é desproporcional ao caso de uso mais comum de quem usa esse tipo de ferramenta.
llms.txt recebe nota cheia só por existir
Dentro de Retrieval Fitness, a presença de llms.txt vale nota máxima (2,4/2,4) apenas por estar presente e ter conteúdo substantivo — sem nenhuma verificação de uso real. Já documentamos que 97% desses arquivos não recebem nenhuma requisição de bot de IA. O peso individual dentro da dimensão é pequeno, mas é crédito automático concedido a um sinal cuja eficácia prática ainca não tem evidência forte.
O que está certo, e por que
Generation Exposure recebe o maior peso individual (18 pts) entre as dimensões medidas — e isso está correto. É a única dimensão medindo citação real por LLM, não estrutura ou elegibilidade técnica, e é exatamente o fator que a auditoria anterior desta série identificou como o de maior correlação real com visibilidade em IA. Dar a ele o maior peso é decisão de engenharia de score bem fundamentada.
Conclusão da auditoria
- 01 É a ferramenta de score de GEO mais rigorosa já auditada nesta série — base acadêmica real e verificável, arquitetura correta, e a única a medir citação real, não só estrutura.
- 02 Mesmo assim, tem três falhas concretas: soma de peso que não fecha em 100 (comunicação, não cálculo), duas dimensões que penalizam ausência de dado como se fosse falha (~18% do score), e um critério (Entity Authority/Wikidata) desalinhado com o caso de uso mais comum.
- 03 Recomendo o uso, com essas três ressalvas declaradas ao cliente — nenhuma delas invalida a ferramenta, mas todas mudam como o número final deve ser lido e comunicado.
- 04 O padrão que esta auditoria estabelece: rigor técnico não se aplica só à fonte fraca — aplica-se com mais força ainda à fonte forte, porque é aí que erro passa despercebido com mais facilidade.
Essa é a distinção que sustenta auditoria técnica de verdade, em vez de comentário de mercado: elogiar o que é forte sem deixar de encontrar o que ainda falha, e vice-versa. Nenhuma ferramenta — nem a minha — deveria ficar de fora desse padrão.
Fontes: relatório “GEO Score” para seonegocionomapa.com.br, alexandrecaramaschi.com/ferramentas/geo-score, 20/08/2026; Chen, Q. et al., “CC-GSEO-Bench” (arXiv 2509.05607, dez/2025); Kim, S. et al., “SAGEO Arena” (arXiv 2602.12187, fev/2026); Huang, M. et al., “Answer Bubbles: Information Exposure in AI-Mediated Search” (arXiv 2603.16138, 2026); dado sobre llms.txt (Ahrefs, mai/2026) já referenciado em página anterior desta série. Consultado e verificado em 20 de agosto de 2026.