Rastreamento

robots.txt bloqueando o Google: como testar e corrigir sem chutar

Uma barra separa um site saudável de um site invisível. Como ler o arquivo, as pegadinhas que mais derrubam sites e como testar antes de publicar.

Equipe VarridaAtualizado em 6 min de leitura
Cadeado azul-noite fechado, com brilho âmbar
Neste artigo
  1. O que o robots.txt faz e o que não faz
  2. Como ler um robots.txt em 2 minutos
  3. Os erros que mais tiram sites do Google
  4. Como testar
  5. Um robots.txt bom pra começar
  6. E os robôs de IA?
  7. Depois de corrigir
  8. Perguntas frequentes

Resposta curta

Abra seusite.com.br/robots.txt. Se tiver Disallow: / no grupo do * ou do Googlebot, o Google não pode rastrear nada. Apague a linha, confira no relatório do robots.txt do Search Console e peça um novo rastreamento. Cuidado com três pegadinhas: um grupo específico do Googlebot faz ele ignorar o grupo *, um robots.txt com erro 5xx faz o Google parar de rastrear, e bloquear CSS e JavaScript atrapalha a renderização.

O que o robots.txt faz e o que não faz

O robots.txt é um arquivo de texto na raiz do domínio que diz aos robôs quais caminhos eles podem rastrear. Ele não decide o que é indexado. A diferença importa:

  • Uma página bloqueada pode continuar no Google se outros sites apontarem pra ela. Ela aparece sem descrição, com algo como "Não há informações disponíveis sobre esta página", e no Search Console vira "Indexada, mas bloqueada pelo robots.txt".
  • Como o Google não abre a página bloqueada, ele também não lê o noindex que estiver lá dentro. Pra tirar uma página do índice, use noindex e deixe ela rastreável, como explicado no artigo sobre noindex sem querer.

O robots.txt também não é segurança. Qualquer pessoa lê o arquivo, e robôs mal-intencionados ignoram. Pra esconder algo de verdade, use senha.

Como ler um robots.txt em 2 minutos

User-agent: *
Disallow: /admin/
Disallow: /carrinho
Allow: /admin/ajuda/

User-agent: Googlebot-Image
Disallow: /fotos-privadas/

Sitemap: https://seusite.com.br/sitemap.xml
  • Grupos. Cada bloco começa com User-agent e vale pros robôs com aquele nome. * é todo mundo.
  • O robô segue só o grupo mais específico. Se existe um grupo User-agent: Googlebot, o Googlebot ignora o grupo * inteiro. Muita gente cria um grupo do Googlebot pra liberar uma pasta e, sem querer, libera tudo o que o * bloqueava, ou o contrário.
  • A regra mais longa vence. No exemplo, /admin/ajuda/ está liberado porque Allow: /admin/ajuda/ é mais específico que Disallow: /admin/. No empate, o Google fica com a regra menos restritiva.
  • Os caminhos diferenciam maiúscula de minúscula. Disallow: /Admin não bloqueia /admin.
  • Curingas. * vale qualquer sequência e $ marca o fim. Disallow: /*.pdf$ bloqueia todos os PDFs.
  • Disallow: vazio libera tudo. É bem diferente de Disallow: /, que bloqueia tudo. Uma barra separa um site saudável de um site invisível.

Os erros que mais tiram sites do Google

1. O Disallow: / que veio do staging

O ambiente de teste precisa ficar fora do Google, então alguém coloca Disallow: /. No lançamento, o arquivo vai junto. É o erro mais comum e o mais fácil de corrigir: apague a linha, ou troque por Allow: /.

2. Bloquear CSS, JavaScript e imagens

Regras como Disallow: /wp-includes/, Disallow: /_next/ ou Disallow: /assets/ parecem inofensivas, mas o Google precisa desses arquivos pra renderizar a página como uma pessoa vê. Sem eles, a página pode parecer quebrada ou vazia pro robô. Libere tudo que a página precisa pra aparecer.

3. O robots.txt respondendo erro

O Google trata o status do próprio arquivo assim:

O que /robots.txt respondeO que o Google faz
200 com regrasSegue as regras
404 ou outro 4xxEntende que não há restrição e rastreia tudo
5xx ou servidor fora do arPara de rastrear o site por um tempo, como se estivesse tudo bloqueado
RedirectSegue até 5 saltos; depois disso, trata como 404

O caso perigoso é o 5xx. Um firewall que bloqueia o robots.txt, uma função serverless que falha ou um servidor instável fazem o Google parar de rastrear o site inteiro. Se o erro passa de 30 dias, ele volta a usar a última versão boa que guardou; se não tiver nenhuma, entende que não há restrição.

4. A SPA que responde HTML no lugar do robots.txt

Em sites de página única, toda rota desconhecida devolve o index.html. Se o robots.txt não existe de verdade, /robots.txt responde 200 com HTML. O Google não acha regra nenhuma ali, então rastreia tudo, mas você perde a linha do sitemap e qualquer bloqueio que achava que tinha. Abra o endereço e confira se aparece texto puro.

5. O arquivo no host errado

Cada combinação de protocolo, subdomínio e porta tem o seu robots.txt. O de www.seusite.com.br não vale pra seusite.com.br, nem pra loja.seusite.com.br. Se o site muda de host num redirect, confira o arquivo no host final.

6. Regras que o Google ignora

  • Noindex: dentro do robots.txt nunca foi oficial e deixou de funcionar em 2019.
  • Crawl-delay: é ignorado pelo Google. Outros buscadores, como o Bing, respeitam.
  • O Google lê só os primeiros 500 KiB do arquivo. O que passar disso é ignorado.

Como testar

  1. Abra o arquivo no navegador e leia. Parece óbvio, mas resolve a maioria dos casos.
  2. Confira o status:
    curl -sI https://seusite.com.br/robots.txt | head -1
  3. No Search Console, abra Configurações › robots.txt. O relatório mostra a versão que o Google tem guardada, quando ela foi buscada, erros de leitura, e tem um botão pra pedir uma nova leitura. Ele substituiu o antigo testador de robots.txt, aposentado em 2023.
  4. Pra uma URL específica, use a Inspeção de URL. Se ela estiver bloqueada, aparece "Rastreamento permitido? Não: bloqueado pelo robots.txt".

A ferramenta verificar robots.txt lê o arquivo e mostra o que está fechado pro robô, sem precisar de conta no Search Console.

Um robots.txt bom pra começar

Pra maioria dos sites, menos é mais:

User-agent: *
Disallow: /api/
Disallow: /carrinho
Disallow: /minha-conta

Sitemap: https://seusite.com.br/sitemap.xml

No Next.js (App Router), gere pelo código pra não depender de arquivo solto:

// app/robots.ts
import type { MetadataRoute } from "next";

export default function robots(): MetadataRoute.Robots {
  return {
    rules: { userAgent: "*", allow: "/", disallow: ["/api/"] },
    sitemap: "https://seusite.com.br/sitemap.xml",
  };
}

Se precisar de um robots.txt diferente no staging, decida pela variável de ambiente do seu projeto, definida em cada ambiente, e nunca pelo nome do domínio da hospedagem.

No WordPress, o arquivo é gerado automaticamente. Yoast e Rank Math têm um editor de robots.txt nas ferramentas. Se existir um arquivo robots.txt de verdade na raiz do servidor, ele tem prioridade sobre o gerado.

E os robôs de IA?

O robots.txt também é onde você decide se ChatGPT, Claude, Perplexity e companhia podem ler o site. Bloquear o GPTBot é uma decisão de negócio; bloquear o OAI-SearchBot tira você das buscas do ChatGPT. As diferenças estão no artigo sobre como aparecer nas respostas com IA.

Depois de corrigir

O Google guarda o robots.txt por até 24 horas. Pra acelerar, peça uma nova leitura no relatório do robots.txt e depois peça indexação das páginas mais importantes na Inspeção de URL. Se o bloqueio durou semanas, a volta completa leva mais tempo, porque o Google precisa rastrear cada página de novo.

Um Disallow: / esquecido custa caro e é trivial de detectar. A varredura grátis da Varrida lê o robots.txt de qualquer site, avisa se ele bloqueia o Google e mostra a correção pra sua plataforma.

Perguntas frequentes

O robots.txt tira uma página do Google?

Não. Ele só impede o rastreamento. Uma página bloqueada pode continuar nos resultados, sem descrição, se outros sites apontarem pra ela. Pra tirar do índice, use noindex e deixe a página rastreável.

Como testar o robots.txt no Google?

No Search Console, abra Configurações › robots.txt. O relatório mostra a versão que o Google tem, quando foi lida e os erros. Pra testar uma URL específica, use a Inspeção de URL, que diz se o rastreamento está permitido.

Meu site precisa ter robots.txt?

Não é obrigatório. Sem o arquivo (resposta 404), o Google entende que pode rastrear tudo. Ter um é útil pra apontar o sitemap e fechar áreas que não precisam ser rastreadas, como /api/ e o carrinho.

Quanto tempo o Google leva pra ler o robots.txt novo?

O Google guarda o arquivo por até 24 horas. Dá pra pedir uma nova leitura no relatório do robots.txt do Search Console.

Fontes

Publicado em 8 de outubro de 2026. Viu algo desatualizado? Escreve pra contato@varrida.com.

Varredura grátis

Veja o que o Google enxerga no seu site.

Cole o endereço e, em menos de 1 minuto, veja a nota e os problemas mais graves, cada um com a correção. Sem cadastro.

  • Grátis
  • Sem cadastro
  • Menos de 1 minuto
Continue lendo

Outros guias do blog