Devo bloquear rastreadores de IA no Robots.txt ou no nível do servidor? – Pergunte a um SEO


Decidir bloquear rastreadores de IA é uma decisão de negócios que muitos profissionais de pesquisa estão discutindo atualmente. Mas depois de tomar a decisão, qual é a melhor maneira de bloquear esses bots?

Existem duas abordagens principais para bloquear rastreadores a serem consideradas: por meio do robots.txt e na pilha do servidor.

As duas abordagens

Ambas as abordagens têm seus prós e contras. Vamos começar examinando como eles funcionam e as diferenças entre os dois.

Bloqueio por meio do Robots.txt

Bloquear rastreadores de IA usando robots.txt é exatamente o mesmo processo que você usaria para bloquear qualquer tipo de bot.

Cada bot de IA tem seu próprio nome de identificação, por exemplo, GPTBot e OAI-SearchBot da OpenAI. Para bloqueá-los, basta adicionar uma regra de proibição especificando o nome do rastreador. Por exemplo, para evitar que o GPTBot rastreie qualquer parte do seu site, você adicionaria:

Agente de usuário: GPTBot

Proibir: /

Se houver apenas certas partes do seu site que você deseja evitar que os bots de IA rastreiem, você pode denunciá-las da mesma maneira. Por exemplo, para evitar que o GPTBot rastreie as páginas de seus produtos, você incluiria a pasta em que essas páginas estão, por exemplo:

Agente de usuário: GPTBot

Proibir: /produtos/

Bloqueio no nível do servidor

Existem algumas maneiras de bloquear bots no nível do servidor: através do próprio servidor, do CDN ou do WAF.

Neste caso, o servidor irá ler a solicitação recebida, como o IP do bot, cabeçalho, etc., e aplicar as regras específicas que você configurou para aquele agente (negar, permitir, redirecionar). Por exemplo, você pode especificar que o GPTBot receba um comando “deny”. Isso impediria que o bot acessasse o conteúdo do seu site.

Para Content Delivery Network (CDN), o conceito é o mesmo, mas acontece numa fase anterior da visita de um bot. A CDN intercepta uma solicitação de conteúdo de um bot antes que ele chegue ao servidor. Isso essencialmente economiza largura de banda do servidor, pois o bot nunca interage com ele. Algumas CDNs oferecem essa tecnologia de forma nativa, sem que você precise fazer muito para configurá-la. Por exemplo, a Cloudflare oferece bloqueio predefinido com base no fato de o bot ser um rastreador de pesquisa, um agente ou usado para treinamento, além de permitir um ajuste mais fino bot por bot.

No Web Application Firewall (WAF), os bots são mais examinados do que o CDN. O WAF atua como uma camada de segurança que pode analisar o comportamento das solicitações, não apenas os cabeçalhos usados ​​pelos bots. Isso significa que ele é capaz de detectar bots que falsificam outros agentes de usuário. É a maneira mais competente na maioria das pilhas de tecnologia de identificar rastreadores de IA mais sofisticados que procuram escapar do radar das tentativas de bloqueio. O WAF que sua empresa está usando pode fazer parte do seu CDN, por exemplo, Cloudflare WAF ou um aplicativo independente como AWS WAF.

Robots.txt: prós e contras

O robots.txt é possivelmente a forma mais acessível para os profissionais de pesquisa controlarem bots. Normalmente, os SEOs têm acesso para alterar o robots.txt de seus domínios ou podem facilmente solicitar uma atualização rápida pela equipe de desenvolvimento.

No entanto, existem alguns outros benefícios em usar esse método.

Prós

O mecanismo de proibição de robots.txt é oficialmente apoiado pelas maiores e mais conceituadas empresas de IA. Por exemplo, GPTBot e OAI-SearchBot da OpenAI, ClaudeBot da Anthropic, Claude-User e Claude-SearchBot, Google-Extended do Google e PerplexityBot da Perplexity.

Este método permite que você escolha seletivamente quais páginas impedir a visita dos bots e também ajuste o bloqueio com base em cada rastreador.

Contras

Existem alguns contras neste método, no entanto. O maior risco é que a conformidade com o robots.txt seja totalmente voluntária e não monitorada centralmente. Ou seja, embora os criadores de bots de IA possam alegar que seus bots respeitam o robots.txt, é apenas um conjunto de solicitações, não um bloco real. Pense nisso como uma placa de proibição de invasão na frente de um portão aberto. Na verdade, não há nada que impeça os bots, apenas que eles sejam codificados para respeitar as regras do robots.txt.

O robots.txt pode ser configurado para proibir bots de determinadas páginas com muita facilidade se houver controles robots.txt no CMS do site. Isso significa que partes interessadas não técnicas podem bloquear acidentalmente mais bots do que o previsto com uma regra de proibição equivocada. Isso pode ser catastrófico se o robots.txt for atualizado para proibir todos os bots, por exemplo, implementando:

Agente do usuário: *

Proibir: /

O robots.txt não é atualizado automaticamente quando novos agentes de usuário são lançados. Isso significa que alguém precisará adicionar manualmente novas proibições sempre que você quiser impedir que um novo bot de IA acesse seu site.

Pilha de servidores: prós e contras

O bloqueio de bots em nível de servidor, CDN ou WAF tem vantagens diferentes dependendo da implementação.

Prós

As implementações de CDN e WAF interromperão as solicitações de bot antes que elas cheguem ao servidor. Isso economizará largura de banda do servidor, reduzindo a pressão sobre o servidor e economizando custos associados.

A maior vantagem para as implementações de pilha de servidores, não importa qual você escolha, é que elas são um bloco definitivo. Se o robots.txt for um sinal educado de “proibição de invasão”, os blocos do servidor, CDN e WAF serão um cadeado no portão. Esses métodos de implementação não exigem conformidade do rastreador; eles detectam os bots e os impedem de acessar o conteúdo, independentemente de o bot ser compatível ou não.

Outro benefício desse método é que o software instalado nesses níveis geralmente fornece relatórios sobre os bots que foram bloqueados. O “cadeado” registra as tentativas de desbloqueio. Isso pode ser útil para analisar quais bots estão tentando acessar seu site. Para sites que estão recebendo muita atenção indesejada de bots de IA, isso pode ser usado em discussões, às vezes legais, com os proprietários desses bots.

Contras

As desvantagens dos métodos de implementação da pilha de servidores são principalmente a sobrecarga de manutenção. A maioria dos servidores de sites são bastante bloqueados, portanto, apenas aqueles que realmente sabem o que estão fazendo com eles terão permissão para acessar os arquivos do servidor, WAF ou CDN. Isso significa que as alterações nos blocos provavelmente precisarão passar por um desenvolvedor, em vez de serem implementadas diretamente por um SEO. Essa necessidade de um intermediário traz implicações de tempo, recursos e custos, especialmente se o servidor for gerenciado por terceiros, como uma agência de desenvolvimento.

Para cada camada de segurança, a falsificação de bot é possível. Embora o WAF seja a linha de defesa mais forte, ainda é possível que bots altamente avançados consigam contornar suas verificações de validação. Isso significa que não existe um método totalmente infalível de bloquear bots de IA desonestos por meio da pilha de servidores. No entanto, eles ainda são altamente eficazes para a maioria.

Então, qual devemos usar?

Nãouma resposta para isso. Depende da configuração, dos custos e da estrutura de gerenciamento do seu site.

Em um mundo ideal, você bloquearia os bots em cada nível da pilha de servidores. O servidor é uma boa maneira de bloquear agentes de usuários conhecidos e pode detectar padrões simples no comportamento do bot. Os blocos CDN são amplamente eficazes e evitarão que os bots consumam largura de banda do servidor. O WAF é o mais eficaz na detecção de bots falsificados e na prevenção de acesso de raspadores de IA avançados ao site. No entanto, você pode não ter acesso fácil para configurar seu WAF, se o seu site tiver um.

O robots.txt é o método mais simples de declarar o desejo de determinados bots de não acessar seu site e é eficaz para bots responsáveis. No entanto, pode simplesmente ser ignorado e, portanto, é um elemento dissuasor e não um método de prevenção.

Em resumo, se você tiver uma forte necessidade de bloquear determinados rastreadores de IA, eu recomendaria subir o mais alto possível na pilha do servidor; bloqueando via WAF se puder, CDN se não puder e através do servidor como último recurso.

Se você precisar bloquear apenas um ou dois dos rastreadores de IA mais confiáveis, provavelmente poderá contar apenas com o robots.txt como um impedimento. No entanto, eu também sugeriria monitorar os logs do servidor para ver se algum desses bots está escapando da proibição do robots.txt.

Mais recursos:


Imagem em destaque: Paul Poetry/Search Engine Journal



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo