Resposta curta
Antes de qualquer truque de conteúdo, as IAs precisam conseguir ler o seu site. Confira três coisas: o robots.txt não pode bloquear os robôs de busca (como OAI-SearchBot, Claude-SearchBot e PerplexityBot), o firewall ou a CDN não pode barrar esses robôs, e o conteúdo tem que estar no HTML, porque a maioria deles não roda JavaScript. No Google, as respostas com IA usam o índice normal: se a página está indexada e pode ter snippet, ela já pode ser citada.
O que é GEO, sem enrolação
GEO (de generative engine optimization) é o nome que pegou pra otimizar um site pra aparecer nas respostas de ferramentas com IA: ChatGPT, Perplexity, Claude, Gemini, Copilot e os resumos com IA do próprio Google. Muita coisa vendida como GEO é especulação. A parte que não é especulação é técnica e parecida com SEO: o robô precisa ter permissão pra entrar, conseguir baixar a página e encontrar o conteúdo no HTML. Se uma dessas falha, nenhuma estratégia de conteúdo resolve.
Os dois jeitos de uma IA usar o seu site
- Treinamento. Robôs coletam páginas pra treinar os próximos modelos. O que entra ali vira conhecimento do modelo, sem link e sem atribuição.
- Busca em tempo real. Quando alguém pergunta algo, a ferramenta busca páginas na hora (ou num índice próprio) e cita as fontes com link. É daqui que vem tráfego.
As empresas usam robôs diferentes pra cada coisa. Isso permite, por exemplo, ficar fora do treinamento e continuar aparecendo nas buscas. Mas também permite o erro inverso: bloquear tudo achando que está bloqueando só o treinamento.
Os robôs que importam
| Robô (user agent) | Empresa | Pra que serve | Se bloquear |
|---|---|---|---|
OAI-SearchBot | OpenAI | Busca do ChatGPT | Você some das respostas com link do ChatGPT |
GPTBot | OpenAI | Treinamento | Fica fora dos próximos modelos; a busca não muda |
ChatGPT-User | OpenAI | Página aberta a pedido de quem usa o ChatGPT | A OpenAI avisa que o robots.txt pode não valer pra ele |
Claude-SearchBot | Anthropic | Busca do Claude | Menos chance de ser citado nas respostas do Claude |
ClaudeBot | Anthropic | Treinamento | Fica fora do treinamento |
Claude-User | Anthropic | Página aberta a pedido de quem usa o Claude | O Claude não consegue abrir o site quando alguém pede |
PerplexityBot | Perplexity | Índice de busca do Perplexity | Você some das fontes do Perplexity |
Googlebot | Busca, inclusive os resumos com IA e o Modo IA | Some do Google inteiro | |
Google-Extended | Não é um robô, é uma permissão: uso no treinamento e nas respostas do Gemini | Não muda nada na Pesquisa Google | |
CCBot | Common Crawl | Base pública usada no treinamento de muitos modelos | Fica fora dessa base |
A lista muda com frequência. Confira sempre a documentação de cada empresa, nas fontes no fim do artigo.
Checagem 1: o robots.txt
Abra seusite.com.br/robots.txt e procure esses nomes. Se o objetivo é aparecer nas respostas, mas ficar fora do treinamento, a configuração fica assim:
# fora do treinamento
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
Disallow: /
# dentro das buscas (e do resto)
User-agent: *
Allow: /
Sitemap: https://seusite.com.br/sitemap.xml
Dois cuidados. Um Disallow: / no grupo * bloqueia também os robôs de busca de IA, além do Google. E se você criar um grupo pra um robô específico, ele passa a ignorar o grupo * por completo. Os detalhes estão no artigo sobre robots.txt bloqueando o Google.
Checagem 2: o firewall e a CDN
O robots.txt pode estar liberado e o robô ser barrado antes de chegar nele. Proteções anti-bot, regras de WAF e bloqueios por país derrubam robôs de IA com frequência, porque eles se parecem com os scrapers que essas ferramentas existem pra conter.
Se o site está atrás da Cloudflare, olhe a seção de robôs de IA no painel (AI Crawl Control). Desde 2025 a Cloudflare oferece bloquear esses robôs com um clique, e em domínios novos o bloqueio pode já vir ligado. Ela também pode gerenciar o robots.txt por você e adicionar regras pros robôs de IA, então o arquivo no ar pode ser diferente do que está no seu código. Em outros provedores, procure regras de "bot management" ou listas de user agents bloqueados.
Um teste rápido, imitando o user agent de busca da OpenAI:
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot" https://seusite.com.br/
Se voltar 403, 429 ou uma página de desafio, alguém está barrando. O teste não é perfeito, porque alguns firewalls também conferem o IP de origem, mas pega os bloqueios por user agent, que são os mais comuns.
Checagem 3: o conteúdo está no HTML?
O Google renderiza JavaScript. A maioria dos robôs de IA, não. Um estudo da Vercel com a MERJ, publicado no fim de 2024, mostrou que os robôs da OpenAI e da Anthropic baixam os arquivos JavaScript, mas não executam. Na prática, eles só enxergam o que vem no HTML da primeira resposta.
Se o site é uma SPA que monta tudo no navegador, o robô de IA vê uma casca vazia. Teste:
curl -s https://seusite.com.br/pagina-importante | grep -c "uma frase do seu conteúdo"
Zero significa que o texto não está no HTML. A saída é renderizar no servidor ou gerar as páginas no build (SSR ou SSG). Preços, especificações e respostas que você quer ver citadas têm que estar no HTML, não carregados depois por uma chamada de API.
Checagem 4: no Google, é SEO normal
Os resumos com IA e o Modo IA do Google usam o mesmo índice e os mesmos robôs da Pesquisa. Segundo o próprio Google, não existe requisito extra: a página precisa estar indexada e poder aparecer com snippet. Na prática, isso significa:
- Nada de noindex, de bloqueio no robots.txt ou de canonical apontando pra outro lugar. Os três tiram a página da busca normal e, junto, das respostas com IA.
- As regras
nosnippet,max-snippete o atributodata-nosnippettambém limitam o que aparece nos resumos com IA. Use só onde fizer sentido. - Bloquear o
Google-Extendednão tira você dos resumos com IA da Pesquisa. Ele vale pro Gemini e pros modelos do Google, não pro buscador.
Checagem 5: facilite a citação
Com a parte técnica resolvida, o conteúdo decide. Ninguém sabe a fórmula exata de nenhuma dessas ferramentas, mas alguns padrões ajudam qualquer leitor, humano ou máquina:
- Resposta primeiro. Um parágrafo no topo que responde a pergunta inteira, como a "resposta curta" deste artigo. Trechos curtos e autossuficientes são mais fáceis de citar.
- Títulos que são perguntas ou afirmações claras. Um
<h2>por assunto, na ordem em que a dúvida aparece. - Tabelas e listas pra dados comparáveis. Preços, prazos, compatibilidade, passo a passo.
- Data e responsável visíveis. Quem escreveu, quando foi atualizado, de onde vêm os números.
- Dados estruturados (JSON-LD) que batem com a página.
Article,Product,FAQPage,Organization. Não há prova de que melhoram a citação em IA, mas ajudam o Google e deixam a página sem ambiguidade. - Informação própria. Um número que só você mediu ou um caso que só você viveu é o que faz uma IA precisar citar você, e não o concorrente.
E o llms.txt?
O llms.txt é uma proposta de arquivo na raiz do site com um resumo em Markdown pra modelos de linguagem. Até agora, nenhuma das grandes empresas confirmou que usa esse arquivo pra decidir o que citar, e o Google já disse que não usa. É barato de fazer e não atrapalha, mas não substitui nenhuma das checagens acima.
Como saber se está funcionando
- Tráfego de referência. No seu analytics, filtre visitas vindas de
chatgpt.com,perplexity.ai,claude.ai,gemini.google.comecopilot.microsoft.com. O ChatGPT costuma adicionarutm_source=chatgpt.comnos links. - Logs do servidor. Procure os user agents da tabela. Se o
OAI-SearchBotnunca aparece, ou só recebe 403, algo está barrando. - Teste manual. Pergunte nas próprias ferramentas o que o seu site responde, com a busca ligada, e veja se ele aparece como fonte.
Checklist
- O robots.txt libera os robôs de busca de IA, e você decidiu conscientemente sobre os de treinamento.
- Firewall, CDN e proteção anti-bot não barram esses robôs.
- O conteúdo principal está no HTML da primeira resposta, sem depender de JavaScript.
- As páginas estão indexadas no Google, sem noindex e com canonical certo.
- Cada página responde a pergunta logo no começo, com títulos claros, data e dados estruturados.
- Você acompanha visitas vindas das ferramentas de IA no analytics.
As três primeiras são as que mais quebram sem ninguém perceber. A varredura grátis da Varrida confere as três em menos de um minuto: diz se ChatGPT, Perplexity e Claude conseguem ler o site, tanto pelo robots.txt quanto pelo firewall, e avisa quando o HTML chega vazio.


