Ir para o conteúdo

Protocolo de exclusão de robôs

Origem: Wikipédia, a enciclopédia livre.

O Protocolo de Exclusão de Robôs, mais conhecido como robots.txt, é um método padrão empregado pelos administradores de sistemas para informar aos robôs rastreadores da web (rastreadores dos serviços de pesquisa online) quais URLs e diretórios de um site possuem permissão para visitar;[1] em resumo gerencia o acesso do indexador no seu site e evitar a sobrecarga de acessos ao site.[1]

O termo robot (do inglês robô) é um programa de computador que percorre automaticamente as páginas da Internet em busca de documentos, a fim de indexá-los, validá-los ou monitorar alterações de conteúdo. Para controlar as atividades desses robots durante suas buscas, opcionalmente, os webmasters podem criar no diretório raiz de um determinado endereço web o arquivo no formato texto (.txt) chamado robots.txt aparecendo no link www.site.com/robots.txt;[1] que será um "filtro" para os crawlers e robots dos motores de busca da Internet, permitindo ou bloqueando o acesso a partes ou à totalidade de um determinado site.

História

[editar | editar código]

Em fevereiro de 1994[2] o padrão foi proposto por Martijn Koster[3][4] (enquanto trabalhava para a Nexor)[5] na lista de discussões da www-talk, o então principal canal de atividades relacionadas com a WWW na época.

Um exemplo simples do formato do arquivo robots.txt:

# Bloqueia o robô Googlebot e o Bingbot
User-agent: Googlebot
User-agent: Bingbot
Disallow: /

# Permite a indexação dos outros robôs
User-agent: *
Allow: /

# Bloqueia a indexação do conteúdo da pasta blog
Disallow: /blog/

# A pasta blog não será indexada, mas o conteúdo da página home.php será indexado
Allow: /blog/home.php 

# Bloqueia a indexação de conteúdo da página secreto.php
Disallow: secreto.php

# Informa o caminho do sitemap
Sitemap: https://www.example.com/sitemap.xml

Informa que o user-agent "Googlebot" do Google e o "Bingbot" do Bing não poderão rastrear as URLs, mas os outros user-agents poderão rastrear todo o site;[1]

Informa que os user-agents não podem fazer a indexação do conteúdo da pasta "blog" e o conteúdo da página "secreto.php", mas o conteúdo da página "home.php" que está salvo na pasta "blog" poderá ser indexado;[6]

Informa que o arquivo sitemap.xml está localizado na URL https://www.site.com/sitemap.xml.[1] O sitemap é um arquivo usado para fornecer informações sobre um site e seus arquivos (vídeos, imagens, PDF), e indicar a relação entre eles. Os buscadores online leem esse arquivo para indexar seu site com eficiência, pois informa as páginas e os arquivos que você considera mais importantes no site, e fornece informações sobre cada arquivo.[7]

Para manter um site sem a indexação dos robôs e não aparecer nos resultados dos buscadores online, bloqueie a indexação usando o código noindex ou adicione no site uma senha de acesso.[1] Ao visitar um site, os robôs buscam primeiro pelo arquivo robots. Se o conteúdo deste arquivo listar algo conforme segue:

 User-agent: *
 Disallow: /

então o robô saberá que deve deixar o site sem indexar nada. Outra maneira de se conseguir algo semelhante é através de meta-tags, adicionadas nos cabeçalhos de páginas HTML:

 <META NAME="ROBOTS" CONTENT="NOINDEX,NOFOLLOW">

O parâmetro NOINDEX diz ao robô que o conteúdo daquele site não deve ser indexado e NOFOLLOW indica que os possíveis links ali existentes não devem ser analisados.

Se o robô não encontrar o arquivo robots.txt e não houver nenhuma meta-tag que o proíba formalmente de analisar um site, a decisão sobre o que fazer passa a ser do próprio robô. Dependendo do site de busca ao qual ele pertence, ele poderá ou não prosseguir com a busca. A maioria optará por prosseguir (permissão de forma implícita).[1]

Referências

  1. 1 2 3 4 5 6 7 «Introdução e guia sobre o robots.txt | documentation». Google for Developers. Consultado em 10 de setembro de 2026
  2. Koster, Martijn (25 de fevereiro de 1994). «Important: Spiders, Robots and Web Wanderers» (Hypermail archived message). www-talk mailing list
  3. Martijn, Koster. «Martijn Koster»
  4. Fielding, Roy (1994). «Maintaining Distributed Hypertext Infostructures: Welcome to MOMspider's Web (em inglês)» (PostScript). First International Conference on the World Wide Web. Geneva. Consultado em 25 de setembro de 2013
  5. «The Web Robots Pages (em inglês)». Robotstxt.org. 30 de junho de 1994. Consultado em 29 de dezembro de 2013
  6. «O que é robots.txt? | Guia do arquivo robots.txt». Cloud Flare. Consultado em 10 de setembro de 2026
  7. «O que é um sitemap | Central da Pesquisa Google | Documentation». Google for Developers. Consultado em 10 de setembro de 2026

Ligações externas

[editar | editar código]