Skip to content

Crawler

Um Crawler, também chamado bot ou spider, é um programa automatizado que os motores de pesquisa usam para percorrer a internet, seguindo links de página em página, para descobrir e ler o conteúdo que depois pode ser indexado.

Definição abrangente

Crawler (ou spider) é um programa automatizado usado por motores de pesquisa para percorrer a web, seguindo links de página em página, descobrindo e descarregando conteúdo que depois é processado e potencialmente adicionado ao índice de pesquisa.

O mais conhecido é o Googlebot, mas existem muitos outros: bingbot (Bing), e mais recentemente crawlers de IA como o GPTBot ou o ClaudeBot, que recolhem dados para treinar ou alimentar modelos de linguagem.

Como um site controla o acesso dos crawlers

O ficheiro robots.txt, colocado na raiz do domínio, é a forma padrão de dar instruções a crawlers sobre que áreas do site podem ou não visitar, dirigidas por nome a cada User-Agent específico.

Cada crawler decide, por sua própria política, se respeita ou não as instruções do robots.txt: os crawlers legítimos das grandes empresas normalmente respeitam, mas bots maliciosos podem simplesmente ignorá-las.

Crawl Budget e a gestão eficiente do rastreio

Nenhum crawler tem recursos infinitos: cada site recebe um Crawl Budget limitado, a quantidade de páginas que um crawler está disposto a visitar num determinado período de tempo.

Sites grandes, com milhares de páginas, beneficiam particularmente de gerir este orçamento com cuidado, evitando desperdiçá-lo em páginas de baixo valor, para garantir que o conteúdo realmente importante é rastreado com a frequência adequada.

Partilha este conteúdo: