Workshop ao vivo · Online
Indexação para LLMs: como fazer conteúdo ser citado por IA generativa
Um recorte prático, ao vivo, do livro técnico de Raphael Sousa Pereira sobre GEO (Generative Engine Optimization) para desenvolvedores — direto do motor ADVERUM ENGINE v2.0 e da apresentação do seu último lançamento.
Quem conduz o workshop
Por que este livro é único
Não é SEO com nomes novos — é a reescrita da fundação
A maior parte do que circula como “estratégia de GEO (Generative Engine Optimization)” hoje é especulação sem base empírica. Este livro nasceu de uma observação concreta feita durante uma auditoria de tráfego em 2024: um cliente com conteúdo tecnicamente irrepreensível — rápido, estruturado, semanticamente denso — estava sistematicamente ausente das respostas do ChatGPT, do Gemini e do Perplexity para perguntas centrais do seu mercado. O site ranqueava bem no Google Search. Para a IA generativa, ele simplesmente não existia.
O workshop parte exatamente dessa lacuna: a diferença entre ser encontrado por um motor de busca e ser citado por um modelo de linguagem — dois paradigmas de recuperação de informação que operam segundo lógicas radicalmente distintas.
Cada capítulo do livro-base segue o protocolo epistêmico do ADVERUM ENGINE: toda afirmação técnica central é classificada explicitamente como [VERIFICADO], [INFERIDO] ou [HIPÓTESE], com fonte quando disponível. É esse mesmo rigor que estrutura o workshop — nada é apresentado como certeza quando ainda é experimento.
Para quem é — e para quem não é
Este workshop é técnico. Isso é proposital.
É indicado para
- Desenvolvedores web que já dominam HTML, HTTP e SEO tradicional
- Arquitetos de conteúdo e especialistas técnicos de SEO/GEO (Generative Engine Optimization)
- Times internos de tecnologia em agências e empresas de mídia
- CTOs e tech leads responsáveis pela infraestrutura de sites e conteúdo
- Profissionais de marketing técnico dispostos a implementar JSON-LD, robots.txt e llms.txt na prática
Não é indicado para
- Quem busca “truques rápidos” de GEO (Generative Engine Optimization) sem nenhuma implementação técnica
- Profissionais sem qualquer familiaridade com HTML ou estrutura básica de um site
- Quem procura promessa de citação garantida por IA — o workshop não vende isso
- Gestores que querem apenas delegar a leitura para a equipe técnica sem entender o racional por trás
O que sustenta este material
Dados, não opinião de LinkedIn
O conteúdo do workshop é construído sobre pesquisa documentada, não sobre tendência de feed. Alguns exemplos do que sustenta o material:
- →
Aggarwal et al., 2024 — “GEO: Generative Engine Optimization” (arXiv:2311.09735), estudo que analisou 10.000 queries em 9 motores generativos, incluindo Bing Chat, Perplexity e YouChat — a base empírica mais citada do campo.
- →
Datas de corte de treinamento verificadas — GPT-4 (setembro/2021, corte original), Gemini 1.5 Pro (novembro/2023), Claude 3.5 Sonnet (abril/2024), conforme documentação técnica oficial de cada laboratório.
- →
Raffel et al., 2020 — filtros de qualidade documentados do pipeline C4, usado no treinamento do T5 e derivados, que definem o que sobrevive à curadoria de um corpus de treinamento.
- →
OpenAI, 2023 — documentação oficial do GPTBot confirmando que ele não executa JavaScript, com implicação direta para arquitetura de renderização (SSR/SSG).
- →
38 pontos de auditoria técnica organizados em 6 blocos — crawlability, dados estruturados, renderização, densidade semântica, autoridade epistêmica e monitoramento.
Nem tudo no campo de GEO (Generative Engine Optimization) tem validação empírica direta — e o material é explícito sobre isso. Métricas como Share of Model e Citation Rate, por exemplo, ainda não têm metodologia de coleta padronizada na literatura; são tratadas como indicadores direcionais, não como KPIs auditáveis.
Base bibliográfica
Referências centrais do material
- →
Aggarwal et al. (2024). GEO: Generative Engine Optimization. arXiv:2311.09735.
- →
Vaswani et al. (2017). Attention Is All You Need. NeurIPS 30.
- →
Lewis et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 33.
- →
Raffel et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. JMLR 21(140).
- →
Brown et al. (2020). Language Models are Few-Shot Learners (GPT-3). NeurIPS 33.
- →
Small (1973); Salton (1963) — fundamentos de co-citação e recuperação de informação aplicados à autoridade epistêmica em LLMs.
- →
Documentações técnicas oficiais: OpenAI (GPTBot), OpenAI (GPT-4), Google (Structured Data), Google (Google-Extended), Anthropic (Claude), Perplexity AI, Schema.org, W3C (JSON-LD 1.1).
De onde este material vem
Parte de um acervo de mais de 100 livros técnicos
Este workshop foi extraído de uma apresentação preparada para o último lançamento de Raphael Sousa Pereira, e se conecta diretamente ao acervo técnico da Verbo Vivo Publicações — mais de 100 títulos entre livros e papers, dos quais estes estão entre os mais conhecidos:
O Código do Ranqueamento
GEO de Conteúdo
SEO Luxo
LLM Para Quem Audita — Livro I
ML Para Quem Audita — Livro II
Indexação para LLMs (este workshop)
Governança de IA — série técnica
ROBO-GENESIS ENGINE — série completa (8 volumes)
Este workshop não é um resumo genérico — é um recorte vivo do mesmo motor de produção editorial (ADVERUM ENGINE v2.0) que sustenta toda essa coleção, com o protocolo epistêmico aplicado desde a primeira frase.
Panorama técnico 2026
Quantas LLMs existem — e por que a indexação muda de uma para outra
A pergunta “quantas LLMs existem” tem duas respostas bem diferentes. Se você contar todo modelo registrado em repositórios como o Hugging Face — incluindo variantes e ajustes finos (fine-tunes) de modelos abertos — a estimativa passa de 16 mil modelos. Mas o número que importa para GEO (Generative Engine Optimization) é outro: apenas uma dúzia de sistemas de IA generativa concentra a imensa maioria das consultas e citações de usuários finais em 2026.
E mesmo dentro dessa dúzia, a forma como cada empresa indexa, treina e cita conteúdo da web é diferente — o que muda diretamente a estratégia de robots.txt e crawlers descrita no Capítulo 05 do livro.
| Empresa | Produto / modelo principal (2026) | Crawler de treinamento | Crawler de citação em tempo real |
|---|---|---|---|
| OpenAI | GPT-5 / GPT-5.4 | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | Claude Opus 4.6 / Sonnet 4.6 | ClaudeBot, anthropic-ai | Claude-SearchBot, Claude-User |
| Gemini 3 Pro | Google-Extended* | Googlebot (busca padrão) | |
| Perplexity AI | Perplexity (multi-modelo) | — | PerplexityBot, Perplexity-User |
| Microsoft | Copilot | — | Bingbot |
| Meta | Llama 3 / Meta AI | Meta-ExternalAgent | — |
| Amazon | Amazon Q / Rufus | Amazonbot | — |
| Apple | Apple Intelligence | Applebot-Extended* | Applebot |
| Mistral AI | Le Chat | — | — |
| DeepSeek | DeepSeek V3.2 | — | — |
| Common Crawl Foundation | dataset usado por GPT, Llama, Mistral e outros | CCBot | — |
*Google-Extended e Applebot-Extended não são crawlers de fato — são tokens de robots.txt que permitem recusar uso do conteúdo em treinamento de IA sem afetar a indexação normal de busca. Campos marcados com “—” indicam que a empresa não documenta publicamente um crawler distinto para essa função até o momento desta pesquisa.
Implicação prática: bloquear um crawler de treinamento (GPTBot, ClaudeBot, CCBot) é uma decisão sobre direitos de conteúdo, com baixo custo de visibilidade. Bloquear um crawler de citação em tempo real (OAI-SearchBot, PerplexityBot, Claude-SearchBot) remove o site das respostas citadas por aquele sistema — são decisões diferentes, e tratá-las como uma só é o erro mais comum de configuração de robots.txt observado em 2026.
Programa do workshop
O que será abordado ao vivo
- 01
Como LLMs “leem” a web — crawlers, corpora, janelas de treinamento e a diferença entre indexação e citação.
- 02
GEO (Generative Engine Optimization) vs. SEO — métricas, sinais e o que mudou estruturalmente entre os dois paradigmas.
- 03
Anatomia de uma citação de IA — o pipeline de RAG (recuperação, ranking de contexto, geração) e por que alguns conteúdos são escolhidos.
- 04
Schema.org e JSON-LD para LLMs — entity graph, sameAs e marcação semântica além do Google Search.
- 05
Robots.txt e llms.txt na era dos AI crawlers — política explícita para GPTBot, PerplexityBot, Google-Extended e outros.
- 06
Renderização — por que a maioria dos crawlers de IA não executa JavaScript, e o que isso muda na arquitetura do site.
- 07
Densidade de entidades e chunking para RAG — como estruturar conteúdo para recuperação semântica.
- 08
Autoridade epistêmica — o framework VERIFICADO / INFERIDO / HIPÓTESE aplicado como estratégia de citabilidade.
- 09
Formato de resposta direta — as estruturas de conteúdo com maior taxa de extração por sistemas de IA.
- 10
Auditoria de indexação para LLMs — visão geral dos 38 pontos de verificação técnica em 6 blocos.
- 11
Métricas de visibilidade em IA — Share of Model, Citation Rate e como montar um dashboard honesto para stakeholders.
Workshop das 18h às 19h. O link de acesso ao vivo é enviado após a confirmação da inscrição pelo WhatsApp.
Perguntas frequentes
Dúvidas comuns sobre GEO (Generative Engine Optimization) e o workshop
O que é GEO (Generative Engine Optimization)?
É o conjunto de práticas técnicas e editoriais que aumentam a probabilidade de um conteúdo ser citado, parafraseado ou referenciado por sistemas de IA generativa em resposta a queries de usuários. O termo foi cunhado em 2023 e formalizado em paper acadêmico em 2024 (Aggarwal et al.).
Qual a diferença entre GEO e SEO tradicional?
SEO otimiza para um ranqueamento — uma lista ordenada de documentos. GEO otimiza para uma citação — a inclusão de informação de um documento na síntese gerada pelo modelo. O mecanismo de recuperação, os sinais e as métricas de sucesso são diferentes.
Para quem é este workshop?
Para desenvolvedores web, arquitetos de conteúdo, especialistas técnicos de SEO/GEO e times técnicos que já dominam HTML, HTTP e SEO tradicional e precisam de um framework rigoroso para citabilidade por LLMs.
Quando e onde acontece o workshop?
18 de setembro, das 18h às 19h, ao vivo e online, com até 100 vagas. O link de acesso é enviado após a confirmação da inscrição pelo WhatsApp.
Todos os crawlers de IA indexam da mesma forma?
Não. Cada empresa usa crawlers distintos para treinamento e para citação em tempo real — por exemplo, GPTBot (treinamento OpenAI) é diferente de OAI-SearchBot (citação em tempo real do ChatGPT). Bloquear um ou outro tem consequências práticas diferentes.
Conheça mais
Onde acompanhar o trabalho por trás deste workshop
Vagas limitadas
R$ 299Garanta sua vaga no workshop ao vivo
Até 100 participantes online, 18 de setembro. Pagamento e confirmação diretamente pelo WhatsApp.
WhatsApp: (51) 98034-4818