Testar o robots.txt

Uma linha a mais num ficheiro de quatro linhas retira um site inteiro dos resultados, sem erro e sem aviso. Esta página diz se o seu endereço está em causa.

O robots.txt é procurado na raiz do domínio do endereço que escreve.

Como ler este resultado

O robots.txt é um ficheiro de algumas linhas colocado na raiz de um site. É público, qualquer pessoa o pode ler, e não protege nada: é um pedido, não uma fechadura.

A regra que decide não é a primeira

Entre um Disallow e um Allow que correspondem ambos a um endereço, ganha o mais longo. É a regra aplicada pela Google, e é a que este testador usa. Permite escrever:

Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

e ser compreendido: toda a área de administração está fechada, exceto esse ficheiro preciso. Muitos testadores aplicam «ganha o primeiro» e dão o veredicto contrário.

Rastreio e indexação não são a mesma coisa

É a confusão mais espalhada sobre o assunto, e custa nos dois sentidos.

Bloquear um endereço no robots.txt impede um motor de o ler. Não o impede de o listar nos resultados se outros sites apontarem para ele: aparece então sem descrição, o que é o pior dos dois mundos. Para retirar mesmo uma página é preciso uma etiqueta noindex, e portanto deixar o motor vir lê-la.

Ao contrário, um endereço permitido aqui pode muito bem ter um noindex e não aparecer em lado nenhum. Este ficheiro não o vê.

O bloqueio total, e como acontece

Duas linhas bastam para retirar um site inteiro dos motores:

User-agent: *
Disallow: /

É a definição normal de um site em pré-produção, e é também o que fica no dia da colocação online quando ninguém pensa nisso. O site funciona perfeitamente, simplesmente já não existe para os motores, e nada o assinala.

Crawl-delay e sitemap

O Crawl-delay pede para espaçar os pedidos. A Google ignora-o, a maioria dos outros robôs respeita-o. As linhas Sitemap declaram onde encontrar a lista de páginas: é o único sítio onde um motor a pode descobrir sem que lha entreguem.

O que esta ferramenta não faz

  • Não diz se a página está indexada. O robots.txt governa o rastreio; a indexação depende também da etiqueta meta robots e do cabeçalho X-Robots-Tag, que esta ferramenta não lê.
  • Testa um endereço de cada vez, e para um só robô. Um ficheiro pode muito bem permitir o Googlebot e bloquear o GPTBot.
  • Não modifica nada nem propõe correções: lê o ficheiro tal como está e diz o que implica.

Perguntas frequentes

Uma página bloqueada pode aparecer na Google?

Sim, e é essa a armadilha. Se outros sites apontarem para ela, a Google pode mostrá-la sem descrição, indicando que não há informação disponível. Para retirar uma página de vez é preciso uma etiqueta noindex, e portanto deixar o motor lê-la.

É preciso bloquear as páginas de pesquisa interna e os filtros?

Regra geral sim. São endereços em número potencialmente infinito, sem conteúdo próprio, e deixá-los abertos gasta o orçamento de rastreio noutro sítio que não as suas páginas verdadeiras.

Porquê testar o GPTBot em separado?

Porque as regras podem diferir de robô para robô, e muitos sites acrescentaram regras dirigidas aos robôs de inteligência artificial sem tocar nas restantes. Verificar com o asterisco não diz, portanto, o que verá um robô nomeado explicitamente.

Para aprofundar

Orçamento de rastreio: porque não é o seu problema O orçamento de rastreio existe e quase de certeza não se aplica ao seu site. A quem diz respeito de facto, e o que se confunde com ele.

As outras ferramentas

Todas as ferramentas gratuitas →

Detetar um bloqueio acidental no dia em que acontece

O rastreio Expansel assinala as páginas excluídas pelo robots.txt do seu site, e vê logo se uma colocação em produção fechou mais do que o previsto.