Crawler
Um Crawler, também chamado bot ou spider, é um programa automatizado que os motores de pesquisa usam para percorrer a internet, seguindo links de página em página, para descobrir e ler o conteúdo que depois pode ser indexado.
Definição abrangente
Crawler (ou spider) é um programa automatizado usado por motores de pesquisa para percorrer a web, seguindo links de página em página, descobrindo e descarregando conteúdo que depois é processado e potencialmente adicionado ao índice de pesquisa.
O mais conhecido é o Googlebot, mas existem muitos outros: bingbot (Bing), e mais recentemente crawlers de IA como o GPTBot ou o ClaudeBot, que recolhem dados para treinar ou alimentar modelos de linguagem.
Como um site controla o acesso dos crawlers
O ficheiro robots.txt, colocado na raiz do domínio, é a forma padrão de dar instruções a crawlers sobre que áreas do site podem ou não visitar, dirigidas por nome a cada User-Agent específico.
Cada crawler decide, por sua própria política, se respeita ou não as instruções do robots.txt: os crawlers legítimos das grandes empresas normalmente respeitam, mas bots maliciosos podem simplesmente ignorá-las.
Crawl Budget e a gestão eficiente do rastreio
Nenhum crawler tem recursos infinitos: cada site recebe um Crawl Budget limitado, a quantidade de páginas que um crawler está disposto a visitar num determinado período de tempo.
Sites grandes, com milhares de páginas, beneficiam particularmente de gerir este orçamento com cuidado, evitando desperdiçá-lo em páginas de baixo valor, para garantir que o conteúdo realmente importante é rastreado com a frequência adequada.
Artigos de blog relacionados:
Partilha este conteúdo:
