Protocolo de exclusão de robôs
O Protocolo de Exclusão de Robôs, mais conhecido como robots.txt, é um método padrão empregado pelos administradores de sistemas para informar aos robôs rastreadores da web (rastreadores dos serviços de pesquisa online) quais URLs e diretórios de um site possuem permissão para visitar;[1] em resumo gerencia o acesso do indexador no seu site e evitar a sobrecarga de acessos ao site.[1]
O termo robot (do inglês robô) é um programa de computador que percorre automaticamente as páginas da Internet em busca de documentos, a fim de indexá-los, validá-los ou monitorar alterações de conteúdo. Para controlar as atividades desses robots durante suas buscas, opcionalmente, os webmasters podem criar no diretório raiz de um determinado endereço web o arquivo no formato texto (.txt) chamado robots.txt aparecendo no link www.site.com/robots.txt;[1] que será um "filtro" para os crawlers e robots dos motores de busca da Internet, permitindo ou bloqueando o acesso a partes ou à totalidade de um determinado site.
História
[editar | editar código]Em fevereiro de 1994[2] o padrão foi proposto por Martijn Koster[3][4] (enquanto trabalhava para a Nexor)[5] na lista de discussões da www-talk, o então principal canal de atividades relacionadas com a WWW na época.
Exemplo
[editar | editar código]Um exemplo simples do formato do arquivo robots.txt:
# Bloqueia o robô Googlebot e o Bingbot
User-agent: Googlebot
User-agent: Bingbot
Disallow: /
# Permite a indexação dos outros robôs
User-agent: *
Allow: /
# Bloqueia a indexação do conteúdo da pasta blog
Disallow: /blog/
# A pasta blog não será indexada, mas o conteúdo da página home.php será indexado
Allow: /blog/home.php
# Bloqueia a indexação de conteúdo da página secreto.php
Disallow: secreto.php
# Informa o caminho do sitemap
Sitemap: https://www.example.com/sitemap.xml
Informa que o user-agent "Googlebot" do Google e o "Bingbot" do Bing não poderão rastrear as URLs, mas os outros user-agents poderão rastrear todo o site;[1]
Informa que os user-agents não podem fazer a indexação do conteúdo da pasta "blog" e o conteúdo da página "secreto.php", mas o conteúdo da página "home.php" que está salvo na pasta "blog" poderá ser indexado;[6]
Informa que o arquivo sitemap.xml está localizado na URL https://www.site.com/sitemap.xml.[1] O sitemap é um arquivo usado para fornecer informações sobre um site e seus arquivos (vídeos, imagens, PDF), e indicar a relação entre eles. Os buscadores online leem esse arquivo para indexar seu site com eficiência, pois informa as páginas e os arquivos que você considera mais importantes no site, e fornece informações sobre cada arquivo.[7]
Para manter um site sem a indexação dos robôs e não aparecer nos resultados dos buscadores online, bloqueie a indexação usando o código noindex ou adicione no site uma senha de acesso.[1] Ao visitar um site, os robôs buscam primeiro pelo arquivo robots. Se o conteúdo deste arquivo listar algo conforme segue:
User-agent: * Disallow: /
então o robô saberá que deve deixar o site sem indexar nada. Outra maneira de se conseguir algo semelhante é através de meta-tags, adicionadas nos cabeçalhos de páginas HTML:
<META NAME="ROBOTS" CONTENT="NOINDEX,NOFOLLOW">
O parâmetro NOINDEX diz ao robô que o conteúdo daquele site não deve ser indexado e NOFOLLOW indica que os possíveis links ali existentes não devem ser analisados.
Se o robô não encontrar o arquivo robots.txt e não houver nenhuma meta-tag que o proíba formalmente de analisar um site, a decisão sobre o que fazer passa a ser do próprio robô. Dependendo do site de busca ao qual ele pertence, ele poderá ou não prosseguir com a busca. A maioria optará por prosseguir (permissão de forma implícita).[1]
Referências
- 1 2 3 4 5 6 7 «Introdução e guia sobre o robots.txt | documentation». Google for Developers. Consultado em 10 de setembro de 2026
- ↑ Koster, Martijn (25 de fevereiro de 1994). «Important: Spiders, Robots and Web Wanderers» (Hypermail archived message). www-talk mailing list
- ↑ Martijn, Koster. «Martijn Koster»
- ↑ Fielding, Roy (1994). «Maintaining Distributed Hypertext Infostructures: Welcome to MOMspider's Web (em inglês)» (PostScript). First International Conference on the World Wide Web. Geneva. Consultado em 25 de setembro de 2013
- ↑ «The Web Robots Pages (em inglês)». Robotstxt.org. 30 de junho de 1994. Consultado em 29 de dezembro de 2013
- ↑ «O que é robots.txt? | Guia do arquivo robots.txt». Cloud Flare. Consultado em 10 de setembro de 2026
- ↑ «O que é um sitemap | Central da Pesquisa Google | Documentation». Google for Developers. Consultado em 10 de setembro de 2026