GEO

Como aparecer no ChatGPT e nas respostas com IA: o lado técnico

Antes de qualquer truque de conteúdo, as IAs precisam conseguir entrar e ler o seu site. As cinco checagens que decidem se ele pode ser citado.

Equipe VarridaAtualizado em 8 min de leitura
Duas lupas cruzadas, uma azul-noite e uma âmbar, cada uma mostrando uma versão da página
Neste artigo
  1. O que é GEO, sem enrolação
  2. Os dois jeitos de uma IA usar o seu site
  3. Os robôs que importam
  4. Checagem 1: o robots.txt
  5. Checagem 2: o firewall e a CDN
  6. Checagem 3: o conteúdo está no HTML?
  7. Checagem 4: no Google, é SEO normal
  8. Checagem 5: facilite a citação
  9. E o llms.txt?
  10. Como saber se está funcionando
  11. Checklist
  12. Perguntas frequentes

Resposta curta

Antes de qualquer truque de conteúdo, as IAs precisam conseguir ler o seu site. Confira três coisas: o robots.txt não pode bloquear os robôs de busca (como OAI-SearchBot, Claude-SearchBot e PerplexityBot), o firewall ou a CDN não pode barrar esses robôs, e o conteúdo tem que estar no HTML, porque a maioria deles não roda JavaScript. No Google, as respostas com IA usam o índice normal: se a página está indexada e pode ter snippet, ela já pode ser citada.

O que é GEO, sem enrolação

GEO (de generative engine optimization) é o nome que pegou pra otimizar um site pra aparecer nas respostas de ferramentas com IA: ChatGPT, Perplexity, Claude, Gemini, Copilot e os resumos com IA do próprio Google. Muita coisa vendida como GEO é especulação. A parte que não é especulação é técnica e parecida com SEO: o robô precisa ter permissão pra entrar, conseguir baixar a página e encontrar o conteúdo no HTML. Se uma dessas falha, nenhuma estratégia de conteúdo resolve.

Os dois jeitos de uma IA usar o seu site

  1. Treinamento. Robôs coletam páginas pra treinar os próximos modelos. O que entra ali vira conhecimento do modelo, sem link e sem atribuição.
  2. Busca em tempo real. Quando alguém pergunta algo, a ferramenta busca páginas na hora (ou num índice próprio) e cita as fontes com link. É daqui que vem tráfego.

As empresas usam robôs diferentes pra cada coisa. Isso permite, por exemplo, ficar fora do treinamento e continuar aparecendo nas buscas. Mas também permite o erro inverso: bloquear tudo achando que está bloqueando só o treinamento.

Os robôs que importam

Robô (user agent)EmpresaPra que serveSe bloquear
OAI-SearchBotOpenAIBusca do ChatGPTVocê some das respostas com link do ChatGPT
GPTBotOpenAITreinamentoFica fora dos próximos modelos; a busca não muda
ChatGPT-UserOpenAIPágina aberta a pedido de quem usa o ChatGPTA OpenAI avisa que o robots.txt pode não valer pra ele
Claude-SearchBotAnthropicBusca do ClaudeMenos chance de ser citado nas respostas do Claude
ClaudeBotAnthropicTreinamentoFica fora do treinamento
Claude-UserAnthropicPágina aberta a pedido de quem usa o ClaudeO Claude não consegue abrir o site quando alguém pede
PerplexityBotPerplexityÍndice de busca do PerplexityVocê some das fontes do Perplexity
GooglebotGoogleBusca, inclusive os resumos com IA e o Modo IASome do Google inteiro
Google-ExtendedGoogleNão é um robô, é uma permissão: uso no treinamento e nas respostas do GeminiNão muda nada na Pesquisa Google
CCBotCommon CrawlBase pública usada no treinamento de muitos modelosFica fora dessa base

A lista muda com frequência. Confira sempre a documentação de cada empresa, nas fontes no fim do artigo.

Checagem 1: o robots.txt

Abra seusite.com.br/robots.txt e procure esses nomes. Se o objetivo é aparecer nas respostas, mas ficar fora do treinamento, a configuração fica assim:

# fora do treinamento
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
Disallow: /

# dentro das buscas (e do resto)
User-agent: *
Allow: /

Sitemap: https://seusite.com.br/sitemap.xml

Dois cuidados. Um Disallow: / no grupo * bloqueia também os robôs de busca de IA, além do Google. E se você criar um grupo pra um robô específico, ele passa a ignorar o grupo * por completo. Os detalhes estão no artigo sobre robots.txt bloqueando o Google.

Checagem 2: o firewall e a CDN

O robots.txt pode estar liberado e o robô ser barrado antes de chegar nele. Proteções anti-bot, regras de WAF e bloqueios por país derrubam robôs de IA com frequência, porque eles se parecem com os scrapers que essas ferramentas existem pra conter.

Se o site está atrás da Cloudflare, olhe a seção de robôs de IA no painel (AI Crawl Control). Desde 2025 a Cloudflare oferece bloquear esses robôs com um clique, e em domínios novos o bloqueio pode já vir ligado. Ela também pode gerenciar o robots.txt por você e adicionar regras pros robôs de IA, então o arquivo no ar pode ser diferente do que está no seu código. Em outros provedores, procure regras de "bot management" ou listas de user agents bloqueados.

Um teste rápido, imitando o user agent de busca da OpenAI:

curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot" https://seusite.com.br/

Se voltar 403, 429 ou uma página de desafio, alguém está barrando. O teste não é perfeito, porque alguns firewalls também conferem o IP de origem, mas pega os bloqueios por user agent, que são os mais comuns.

Checagem 3: o conteúdo está no HTML?

O Google renderiza JavaScript. A maioria dos robôs de IA, não. Um estudo da Vercel com a MERJ, publicado no fim de 2024, mostrou que os robôs da OpenAI e da Anthropic baixam os arquivos JavaScript, mas não executam. Na prática, eles só enxergam o que vem no HTML da primeira resposta.

Se o site é uma SPA que monta tudo no navegador, o robô de IA vê uma casca vazia. Teste:

curl -s https://seusite.com.br/pagina-importante | grep -c "uma frase do seu conteúdo"

Zero significa que o texto não está no HTML. A saída é renderizar no servidor ou gerar as páginas no build (SSR ou SSG). Preços, especificações e respostas que você quer ver citadas têm que estar no HTML, não carregados depois por uma chamada de API.

Checagem 4: no Google, é SEO normal

Os resumos com IA e o Modo IA do Google usam o mesmo índice e os mesmos robôs da Pesquisa. Segundo o próprio Google, não existe requisito extra: a página precisa estar indexada e poder aparecer com snippet. Na prática, isso significa:

  • Nada de noindex, de bloqueio no robots.txt ou de canonical apontando pra outro lugar. Os três tiram a página da busca normal e, junto, das respostas com IA.
  • As regras nosnippet, max-snippet e o atributo data-nosnippet também limitam o que aparece nos resumos com IA. Use só onde fizer sentido.
  • Bloquear o Google-Extended não tira você dos resumos com IA da Pesquisa. Ele vale pro Gemini e pros modelos do Google, não pro buscador.

Checagem 5: facilite a citação

Com a parte técnica resolvida, o conteúdo decide. Ninguém sabe a fórmula exata de nenhuma dessas ferramentas, mas alguns padrões ajudam qualquer leitor, humano ou máquina:

  • Resposta primeiro. Um parágrafo no topo que responde a pergunta inteira, como a "resposta curta" deste artigo. Trechos curtos e autossuficientes são mais fáceis de citar.
  • Títulos que são perguntas ou afirmações claras. Um <h2> por assunto, na ordem em que a dúvida aparece.
  • Tabelas e listas pra dados comparáveis. Preços, prazos, compatibilidade, passo a passo.
  • Data e responsável visíveis. Quem escreveu, quando foi atualizado, de onde vêm os números.
  • Dados estruturados (JSON-LD) que batem com a página. Article, Product, FAQPage, Organization. Não há prova de que melhoram a citação em IA, mas ajudam o Google e deixam a página sem ambiguidade.
  • Informação própria. Um número que só você mediu ou um caso que só você viveu é o que faz uma IA precisar citar você, e não o concorrente.

E o llms.txt?

O llms.txt é uma proposta de arquivo na raiz do site com um resumo em Markdown pra modelos de linguagem. Até agora, nenhuma das grandes empresas confirmou que usa esse arquivo pra decidir o que citar, e o Google já disse que não usa. É barato de fazer e não atrapalha, mas não substitui nenhuma das checagens acima.

Como saber se está funcionando

  • Tráfego de referência. No seu analytics, filtre visitas vindas de chatgpt.com, perplexity.ai, claude.ai, gemini.google.com e copilot.microsoft.com. O ChatGPT costuma adicionar utm_source=chatgpt.com nos links.
  • Logs do servidor. Procure os user agents da tabela. Se o OAI-SearchBot nunca aparece, ou só recebe 403, algo está barrando.
  • Teste manual. Pergunte nas próprias ferramentas o que o seu site responde, com a busca ligada, e veja se ele aparece como fonte.

Checklist

  1. O robots.txt libera os robôs de busca de IA, e você decidiu conscientemente sobre os de treinamento.
  2. Firewall, CDN e proteção anti-bot não barram esses robôs.
  3. O conteúdo principal está no HTML da primeira resposta, sem depender de JavaScript.
  4. As páginas estão indexadas no Google, sem noindex e com canonical certo.
  5. Cada página responde a pergunta logo no começo, com títulos claros, data e dados estruturados.
  6. Você acompanha visitas vindas das ferramentas de IA no analytics.

As três primeiras são as que mais quebram sem ninguém perceber. A varredura grátis da Varrida confere as três em menos de um minuto: diz se ChatGPT, Perplexity e Claude conseguem ler o site, tanto pelo robots.txt quanto pelo firewall, e avisa quando o HTML chega vazio.

Perguntas frequentes

Bloquear o GPTBot tira meu site do ChatGPT?

Não das buscas. O GPTBot coleta páginas pra treinamento. As respostas com link do ChatGPT usam o OAI-SearchBot. Dá pra bloquear o primeiro e liberar o segundo.

Preciso de um llms.txt?

Não é necessário. Nenhuma das grandes empresas confirmou que usa o arquivo pra decidir o que citar. É barato de fazer, mas as checagens de robots.txt, firewall e HTML pesam muito mais.

Os resumos com IA do Google exigem alguma tag especial?

Não. Segundo o Google, a página precisa estar indexada e poder aparecer com snippet. Não existe marcação extra. Regras como nosnippet e max-snippet limitam o que aparece.

Os robôs de IA executam JavaScript?

A maioria não. Um estudo da Vercel com a MERJ mostrou que os robôs da OpenAI e da Anthropic baixam os arquivos JavaScript, mas não executam. O conteúdo precisa estar no HTML da primeira resposta.

Fontes

Publicado em 8 de outubro de 2026. Viu algo desatualizado? Escreve pra contato@varrida.com.

Varredura grátis

Veja o que o Google enxerga no seu site.

Cole o endereço e, em menos de 1 minuto, veja a nota e os problemas mais graves, cada um com a correção. Sem cadastro.

  • Grátis
  • Sem cadastro
  • Menos de 1 minuto
Continue lendo

Outros guias do blog