O Google diz por que pode ignorar o Robots.txt e impactar negativamente o SEO
John Mueller, do Google, respondeu a uma pergunta sobre o robots.txt e explicou um erro fácil de ignorar que pode afetar seus objetivos de SEO e de indexação de sites. O problema específico estava relacionado ao spam da caixa de pesquisa indexado pelo Google, mas esse erro pode acontecer com qualquer pessoa em geral, em qualquer contexto.
Spam na caixa de pesquisa de sites
A pessoa que fez a pergunta no Reddit estava sofrendo um ataque de spam na barra de pesquisa. O que os spammers fazem é pesquisar uma consulta que reflita seu nicho de spam e adicionar um link ou nome de site. O que acontece a seguir é que a barra de pesquisa gera um URL que pode ser referenciado para gerar o resultado da pesquisa com spam.
E era isso que estava acontecendo com a pessoa que fazia a pergunta. A resposta deles foi adicionar uma linha ao arquivo robots.txt para evitar que o Google indexasse o arquivo. Mas o Google estava indexando esses URLs gerados por pesquisas com spam de qualquer maneira.
Páginas indexadas do Google bloqueadas por Robots.txt
Alguém postou no Reddit que a caixa de pesquisa do Shopify de seu cliente estava gerando páginas da web com spam em resposta a consultas de spammer e que o Google as estava indexando, apesar de um arquivo robots.txt proibir o Google de indexar essas páginas. O que o cliente fez foi redirecionar esses URLs com spam para outra página da web. A pessoa que fez a pergunta não perguntou como impedir que as páginas fossem indexadas (que é o que deveria estar perguntando); eles perguntaram se esses URLs redirecionados deveriam ser marcados como 404.
A pessoa perguntou:
“Trabalhando na loja Shopify de um cliente onde adicionamos /search como uma proibição no robots.txt, porém esses resultados de pesquisa ainda são indexados dentro do Google.
Porém, se eu tentar abrir uma dessas páginas, elas terão um redirecionamento definido e redirecionarão para outra página de coleção na loja. Deveríamos exibir uma página 404? Qual é a maneira mais fácil de consertar isso?”
Por que o arquivo Robots.txt fez com que o spam fosse indexado
John Mueller, do Google, deu um passo extra para identificar e revisar o arquivo robots.txt do cliente e identificou um erro que estava fazendo com que o Google ignorasse a diretiva que proíbe o Googlebot de indexar páginas de resultados de pesquisa.
Muller respondeu:
“Além disso, não tenho certeza se é o seu site, mas aquele que encontrei com URLs indexados semelhantes tinha seções para “user-agent: Googlebot” (no bloco “START: Regras personalizadas” nos comentários), bem como muito mais na seção “user-agent: *” mais abaixo. Com o robots.txt, as regras mais específicas vencem, portanto, se você tiver uma seção user-agent: Googlebot, ele usará *apenas* essa seção. Se você quiser aplicar todas as regras no Seção “user-agent: *”, você precisa copiá-los. Além disso, se esse for o seu site, você pode simplesmente listar todos os agentes de usuário para os quais deseja compartilhar regras, por exemplo:
agente do usuário: googlebot
agente do usuário: otherbot
agente do usuário: imgsrc
agente do usuário: algopt
proibir: /peixes
proibir: /gatos-laranja
… etc…”
Diretivas específicas de agente de usuário têm precedência
O que aconteceu é que o cliente contava com o Google para seguir as diretrizes em uma linha destinada a todos os agentes de usuário, “user-agent: *”, mas como há outra seção do arquivo robots.txt específica do Googlebot, o Google ignorou as diretivas “user-agent: *” e obedeceu àquela que se dirigia especificamente ao Googlebot.
Isso pode parecer uma peculiaridade na forma como o robots.txt funciona, mas na verdade faz sentido porque permite que os usuários direcionem rastreadores específicos com regras exclusivas e direcionem todos os outros com um conjunto diferente de regras.
Como se proteger contra spam na caixa de pesquisa
WordPress e Shopify têm maneiras de mitigar o spam na caixa de pesquisa.
WordPress e Shopify têm maneiras de mitigar o spam na caixa de pesquisa.
Mitigação de spam na caixa de pesquisa do Shopify
O site do Shopify tem um tutorial sobre como adicionar automaticamente uma diretiva noindex a todos os resultados da pesquisa. Isso impedirá efetivamente a indexação de todas as páginas de resultados de pesquisa. Porém, é necessário não bloquear páginas de pesquisa com robots.txt para que isso funcione.
Usar uma diretiva noindex é mais eficaz do que usar robots.txt porque robots.txt não controla a indexação; ele controla apenas o rastreamento.
Instruções do Shopify:
“Você pode ocultar páginas que não estão incluídas em seu arquivo robots.txt.liquid personalizando o
seção do arquivo de layout theme.liquid da sua loja. Você precisa incluir algum código metatag para interromper a indexação de páginas específicas.
No admin do Shopify, acesse Loja Online > Temas.
Encontre o tema que deseja editar, clique no botão… para abrir o menu de ações e clique em Editar código.
Na pasta de layout, clique no arquivo theme.liquid.
Para excluir o modelo de pesquisa, cole o código a seguir em uma linha em branco no campo
seção:
{% se o modelo contiver ‘pesquisa’ %}
{% endif %}”
Mitigação de spam na caixa de pesquisa do WordPress
É muito fácil mitigar o spam da caixa de pesquisa com o WordPress. Os usuários dos plug-ins Yoast, Rank Math e AIOSEO SEO têm suas páginas de resultados de pesquisa configuradas automaticamente como noindex por padrão. Além disso, alguns construtores de páginas e temas como Divi (e seu tema Extra) não gerarão automaticamente palavras e URLs com spam em resposta às pesquisas e, em vez disso, injetarão algumas frases dizendo que a pesquisa não produziu resultados.
Conhecimento sobre Robots.txt
SEO eficaz requer uma ampla gama de conhecimentos. Robots.txt contém algumas peculiaridades que podem torná-lo menos eficaz do que o pretendido, por isso é útil ler as especificações oficiais para se manter atualizado.
Imagem em destaque da Shutterstock/Stockinq
