Testar o robots.txt
Uma linha a mais num ficheiro de quatro linhas retira um site inteiro dos resultados, sem erro e sem aviso. Esta página diz se o seu endereço está em causa.
Como ler este resultado
O robots.txt é um ficheiro de algumas linhas colocado na raiz de um site. É público, qualquer pessoa o pode ler, e não protege nada: é um pedido, não uma fechadura.
A regra que decide não é a primeira
Entre um Disallow e um Allow que correspondem ambos a um endereço, ganha o mais longo. É a regra aplicada pela Google, e é a que este testador usa. Permite escrever:
Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php
e ser compreendido: toda a área de administração está fechada, exceto esse ficheiro preciso. Muitos testadores aplicam «ganha o primeiro» e dão o veredicto contrário.
Rastreio e indexação não são a mesma coisa
É a confusão mais espalhada sobre o assunto, e custa nos dois sentidos.
Bloquear um endereço no robots.txt impede um motor de o ler. Não o impede de o listar nos resultados se outros sites apontarem para ele: aparece então sem descrição, o que é o pior dos dois mundos. Para retirar mesmo uma página é preciso uma etiqueta noindex, e portanto deixar o motor vir lê-la.
Ao contrário, um endereço permitido aqui pode muito bem ter um noindex e não aparecer em lado nenhum. Este ficheiro não o vê.
O bloqueio total, e como acontece
Duas linhas bastam para retirar um site inteiro dos motores:
User-agent: * Disallow: /
É a definição normal de um site em pré-produção, e é também o que fica no dia da colocação online quando ninguém pensa nisso. O site funciona perfeitamente, simplesmente já não existe para os motores, e nada o assinala.
Crawl-delay e sitemap
O Crawl-delay pede para espaçar os pedidos. A Google ignora-o, a maioria dos outros robôs respeita-o. As linhas Sitemap declaram onde encontrar a lista de páginas: é o único sítio onde um motor a pode descobrir sem que lha entreguem.
O que esta ferramenta não faz
- Não diz se a página está indexada. O robots.txt governa o rastreio; a indexação depende também da etiqueta meta robots e do cabeçalho X-Robots-Tag, que esta ferramenta não lê.
- Testa um endereço de cada vez, e para um só robô. Um ficheiro pode muito bem permitir o Googlebot e bloquear o GPTBot.
- Não modifica nada nem propõe correções: lê o ficheiro tal como está e diz o que implica.
Perguntas frequentes
Uma página bloqueada pode aparecer na Google?
Sim, e é essa a armadilha. Se outros sites apontarem para ela, a Google pode mostrá-la sem descrição, indicando que não há informação disponível. Para retirar uma página de vez é preciso uma etiqueta noindex, e portanto deixar o motor lê-la.
É preciso bloquear as páginas de pesquisa interna e os filtros?
Regra geral sim. São endereços em número potencialmente infinito, sem conteúdo próprio, e deixá-los abertos gasta o orçamento de rastreio noutro sítio que não as suas páginas verdadeiras.
Porquê testar o GPTBot em separado?
Porque as regras podem diferir de robô para robô, e muitos sites acrescentaram regras dirigidas aos robôs de inteligência artificial sem tocar nas restantes. Verificar com o asterisco não diz, portanto, o que verá um robô nomeado explicitamente.
Para aprofundar
Orçamento de rastreio: porque não é o seu problema O orçamento de rastreio existe e quase de certeza não se aplica ao seu site. A quem diz respeito de facto, e o que se confunde com ele.As outras ferramentas
Verificar um nome de domínio
Data de expiração, registrar e estado de um nome de domínio.
Verificar um certificado SSL
Data de expiração do certificado, emissor e nomes realmente cobertos.
Verificar os redirecionamentos
Toda a cadeia de redirecionamentos, salto a salto, com o tipo de cada um.
Detetar um bloqueio acidental no dia em que acontece
O rastreio Expansel assinala as páginas excluídas pelo robots.txt do seu site, e vê logo se uma colocação em produção fechou mais do que o previsto.