Resposta curta
Abra seusite.com.br/robots.txt. Se tiver Disallow: / no grupo do * ou do Googlebot, o Google não pode rastrear nada. Apague a linha, confira no relatório do robots.txt do Search Console e peça um novo rastreamento. Cuidado com três pegadinhas: um grupo específico do Googlebot faz ele ignorar o grupo *, um robots.txt com erro 5xx faz o Google parar de rastrear, e bloquear CSS e JavaScript atrapalha a renderização.
O que o robots.txt faz e o que não faz
O robots.txt é um arquivo de texto na raiz do domínio que diz aos robôs quais caminhos eles podem rastrear. Ele não decide o que é indexado. A diferença importa:
- Uma página bloqueada pode continuar no Google se outros sites apontarem pra ela. Ela aparece sem descrição, com algo como "Não há informações disponíveis sobre esta página", e no Search Console vira "Indexada, mas bloqueada pelo robots.txt".
- Como o Google não abre a página bloqueada, ele também não lê o noindex que estiver lá dentro. Pra tirar uma página do índice, use noindex e deixe ela rastreável, como explicado no artigo sobre noindex sem querer.
O robots.txt também não é segurança. Qualquer pessoa lê o arquivo, e robôs mal-intencionados ignoram. Pra esconder algo de verdade, use senha.
Como ler um robots.txt em 2 minutos
User-agent: *
Disallow: /admin/
Disallow: /carrinho
Allow: /admin/ajuda/
User-agent: Googlebot-Image
Disallow: /fotos-privadas/
Sitemap: https://seusite.com.br/sitemap.xml
- Grupos. Cada bloco começa com
User-agente vale pros robôs com aquele nome.*é todo mundo. - O robô segue só o grupo mais específico. Se existe um grupo
User-agent: Googlebot, o Googlebot ignora o grupo*inteiro. Muita gente cria um grupo do Googlebot pra liberar uma pasta e, sem querer, libera tudo o que o*bloqueava, ou o contrário. - A regra mais longa vence. No exemplo,
/admin/ajuda/está liberado porqueAllow: /admin/ajuda/é mais específico queDisallow: /admin/. No empate, o Google fica com a regra menos restritiva. - Os caminhos diferenciam maiúscula de minúscula.
Disallow: /Adminnão bloqueia/admin. - Curingas.
*vale qualquer sequência e$marca o fim.Disallow: /*.pdf$bloqueia todos os PDFs. Disallow:vazio libera tudo. É bem diferente deDisallow: /, que bloqueia tudo. Uma barra separa um site saudável de um site invisível.
Os erros que mais tiram sites do Google
1. O Disallow: / que veio do staging
O ambiente de teste precisa ficar fora do Google, então alguém coloca Disallow: /. No lançamento, o arquivo vai junto. É o erro mais comum e o mais fácil de corrigir: apague a linha, ou troque por Allow: /.
2. Bloquear CSS, JavaScript e imagens
Regras como Disallow: /wp-includes/, Disallow: /_next/ ou Disallow: /assets/ parecem inofensivas, mas o Google precisa desses arquivos pra renderizar a página como uma pessoa vê. Sem eles, a página pode parecer quebrada ou vazia pro robô. Libere tudo que a página precisa pra aparecer.
3. O robots.txt respondendo erro
O Google trata o status do próprio arquivo assim:
O que /robots.txt responde | O que o Google faz |
|---|---|
| 200 com regras | Segue as regras |
| 404 ou outro 4xx | Entende que não há restrição e rastreia tudo |
| 5xx ou servidor fora do ar | Para de rastrear o site por um tempo, como se estivesse tudo bloqueado |
| Redirect | Segue até 5 saltos; depois disso, trata como 404 |
O caso perigoso é o 5xx. Um firewall que bloqueia o robots.txt, uma função serverless que falha ou um servidor instável fazem o Google parar de rastrear o site inteiro. Se o erro passa de 30 dias, ele volta a usar a última versão boa que guardou; se não tiver nenhuma, entende que não há restrição.
4. A SPA que responde HTML no lugar do robots.txt
Em sites de página única, toda rota desconhecida devolve o index.html. Se o robots.txt não existe de verdade, /robots.txt responde 200 com HTML. O Google não acha regra nenhuma ali, então rastreia tudo, mas você perde a linha do sitemap e qualquer bloqueio que achava que tinha. Abra o endereço e confira se aparece texto puro.
5. O arquivo no host errado
Cada combinação de protocolo, subdomínio e porta tem o seu robots.txt. O de www.seusite.com.br não vale pra seusite.com.br, nem pra loja.seusite.com.br. Se o site muda de host num redirect, confira o arquivo no host final.
6. Regras que o Google ignora
Noindex:dentro do robots.txt nunca foi oficial e deixou de funcionar em 2019.Crawl-delay:é ignorado pelo Google. Outros buscadores, como o Bing, respeitam.- O Google lê só os primeiros 500 KiB do arquivo. O que passar disso é ignorado.
Como testar
- Abra o arquivo no navegador e leia. Parece óbvio, mas resolve a maioria dos casos.
- Confira o status:
curl -sI https://seusite.com.br/robots.txt | head -1 - No Search Console, abra Configurações › robots.txt. O relatório mostra a versão que o Google tem guardada, quando ela foi buscada, erros de leitura, e tem um botão pra pedir uma nova leitura. Ele substituiu o antigo testador de robots.txt, aposentado em 2023.
- Pra uma URL específica, use a Inspeção de URL. Se ela estiver bloqueada, aparece "Rastreamento permitido? Não: bloqueado pelo robots.txt".
A ferramenta verificar robots.txt lê o arquivo e mostra o que está fechado pro robô, sem precisar de conta no Search Console.
Um robots.txt bom pra começar
Pra maioria dos sites, menos é mais:
User-agent: *
Disallow: /api/
Disallow: /carrinho
Disallow: /minha-conta
Sitemap: https://seusite.com.br/sitemap.xml
No Next.js (App Router), gere pelo código pra não depender de arquivo solto:
// app/robots.ts
import type { MetadataRoute } from "next";
export default function robots(): MetadataRoute.Robots {
return {
rules: { userAgent: "*", allow: "/", disallow: ["/api/"] },
sitemap: "https://seusite.com.br/sitemap.xml",
};
}
Se precisar de um robots.txt diferente no staging, decida pela variável de ambiente do seu projeto, definida em cada ambiente, e nunca pelo nome do domínio da hospedagem.
No WordPress, o arquivo é gerado automaticamente. Yoast e Rank Math têm um editor de robots.txt nas ferramentas. Se existir um arquivo robots.txt de verdade na raiz do servidor, ele tem prioridade sobre o gerado.
E os robôs de IA?
O robots.txt também é onde você decide se ChatGPT, Claude, Perplexity e companhia podem ler o site. Bloquear o GPTBot é uma decisão de negócio; bloquear o OAI-SearchBot tira você das buscas do ChatGPT. As diferenças estão no artigo sobre como aparecer nas respostas com IA.
Depois de corrigir
O Google guarda o robots.txt por até 24 horas. Pra acelerar, peça uma nova leitura no relatório do robots.txt e depois peça indexação das páginas mais importantes na Inspeção de URL. Se o bloqueio durou semanas, a volta completa leva mais tempo, porque o Google precisa rastrear cada página de novo.
Um Disallow: / esquecido custa caro e é trivial de detectar. A varredura grátis da Varrida lê o robots.txt de qualquer site, avisa se ele bloqueia o Google e mostra a correção pra sua plataforma.


