ChatGPT pesquisa subreddits individuais por nome


Aqui está uma linha de pesquisa que o ChatGPT escreveu para si esta semana, direto do tráfego.

fast|site:reddit.com/r/whatnotapp seller tips Whatnot live selling|3650|reddit.com

Olhe o caminho. Ele lê r/whatnotappum subreddit, escolhido pelo nome antes de qualquer coisa ser buscada.

Crdito da imagem: Suganthan Mohanadasan

Na desmontagem que publiquei no dia 21, documentei o ChatGPT solicitando o Reddit no nível do domínio, reddit.com no espaço de segmentação com uma janela de 365 dias.

Isso vai um nível mais profundo.

O modelo escolheu a comunidade, não o site, e deu-lhe 3.650 dias, uma década de threads.

Ele voltou com 48 tópicos do Reddit de 71 resultados daquela conversa. 68% de tudo que recuperou.

reddit.com/r/whatnotapp/comments/1vqdlaq/tips_for_a_new_seller/
reddit.com/r/whatnotapp/comments/1r6mws8/advice_on_selling_on_whatnot/
reddit.com/r/whatnotapp/comments/1tzv075/new_to_whatnot_best_tips_for_selling_smocked/

Então os citou.

Seis das oito citações nessa resposta foram para r/whatnotapp tópicos. Um foi ao centro de ajuda do próprio Whatnot.

Um chip do Reddit fica ao lado do conselho sobre não começar itens valiosos por US$ 1, ao lado do ponto sobre tratar uma transmissão como entretenimento e ao lado daquele sobre agendar programas com antecedência.

A citação do Reddit depende da consulta, não está desativada

Isso importa porque quatro dias antes captei o oposto na mesma conta.

Consulta Páginas buscadas Do Reddit Citações Ganhou pelo Reddit
dicas de vendedor 71 48 8 6
melhor software de suporte de chat ao vivo com IA 221 84 11 0

Quatro dias de intervalo, mesma conta, ambas questões comerciais. Um deu ao Reddit três quartos do crédito visível. O outro buscou 84 tópicos e não creditou nenhum deles.

Publiquei o segundo no dia 21 e li como o Reddit se tornando uma entrada invisível, alimentando os veredictos enquanto as páginas dos fornecedores coletam as citações.

Esta captura diz que a leitura é muito ampla. Vale para essa conversa. Não vale como regra.

Vale a pena adivinhar o que os separa, e é apenas um palpite. Whatnot é um nicho de mercado, e o conhecimento prático do vendedor está em um subreddit e em nenhum outro lugar. O software de chat ao vivo é uma categoria de fornecedor com páginas de preços, documentação e sites de comparação competindo pelas mesmas reivindicações. Quando a melhor fonte honesta é um fórum, o fórum ainda ganha a citação.

Na semana passada, escrevi que o Reddit saiu das citações do ChatGPT, e não do modelo, e que todo o resto precisava de outro experimento.

Essa captura é esse experimento e tem consequências para as duas explicações que circulam.

Ryan Jones no Bing

Ryan descobriu que o Bing parou de classificar o Reddit para consultas comerciais comuns e argumentou que, como o Bing está por trás da recuperação do ChatGPT, o Reddit o seguiu.

Crdito da imagem: Suganthan Mohanadasan

Sua observação é confirmada e vai além de seus quatro exemplos. Executei-os e mais dois por meio do Bing, lendo o SERP renderizado em vez de uma API.

Consulta Reddit nos resultados do Bing
melhor tv para esportes nenhum
melhor escova de dentes nenhum
dicas de vendedor nenhum
resenha do filme transformadores nenhum
melhores tênis de corrida nenhum
melhor CRM para pequenas empresas nenhum

Não “não está entre os 10 primeiros”. A corda reddit.com aparece zero vezes no HTML de todas as seis páginas, enquanto o Google coloca o Reddit na posição 2 para duas delas.

O que quer que tenha acontecido no Bing é real e vale a pena saber por si só.

Crdito da imagem: Suganthan Mohanadasan

O passo que não sobrevive é uma suposição que toda a indústria carrega desde 2023, que os resultados da web do ChatGPT são resultados do Bing.

Eu mesmo repeti isso em palestras. Um pool não pode conter o que o índice não possui, portanto, se 68% desse pool for Reddit e a página do Bing para a mesma consulta não tiver nenhum, os dois não serão a mesma fonte.

Algo chega ao Reddit de outra maneira, seja o próprio índice da OpenAI ou o feed licenciado do acordo do Reddit.

A descoberta de Ryan no Bing permanece de qualquer maneira. Pode muito bem ser a mesma decisão ocorrendo em dois lugares, em vez de um causar o outro.

Jenny Halasz no acesso

Jenny apontou para o mural de acesso pago do Reddit e perguntou se os agentes de usuário da OpenAI agora estão obtendo o robots.txt restrito e perdendo acesso ao conteúdo.

Crdito da imagem: Suganthan Mohanadasan

Ela está certa sobre a arquitetura. Eu verifiquei. O robots.txt público do Reddit é Disallow: / para todos, e a versão permissiva é aquela servida para parceiros verificados, então o arquivo aberto é o camuflado.

Eu falsifiquei o GPTBot e o Googlebot, e ambos obtiveram um 403 em vez de um robots.txt.

Esse 403 é a parte interessante, porque o Googlebot real obviamente não está bloqueado no Reddit.

Ele informa que o Reddit verifica o IP solicitante em relação aos intervalos de rastreadores publicados, em vez de confiar na string do agente do usuário. Tanto a OpenAI quanto o Google publicam esses intervalos, o que torna a verificação possível.

A consequência é que ninguém fora dos intervalos de IP da OpenAI pode ver o que os agentes verificados da OpenAI recebem. Jenny diz isso em sua própria postagem, que ela pode falsificar um agente de usuário, mas não um IP. Portanto, um teste de agente de usuário mostra a visão de quem está de fora, independentemente de quem o executa.

Quando eu coloquei isso para ela, ela fez uma boa pergunta. Ela ainda obtém o robots.txt voltado para o usuário sem problemas, então meu teste foi executado em um endereço IP dos EUA?

Não foi. Estou em uma conexão residencial nos Emirados Árabes Unidos. Isso acaba tornando o resultado mais limpo, em vez de mais confuso, porque todas as solicitações vieram do mesmo endereço no mesmo minuto e apenas o agente do usuário foi alterado.

Solicitado como Resposta
Chrome no macOS 200, o robots.txt público
OAI-SearchBot 200
GPTBot 403
Usuário ChatGPT 403
Googlebot 403

Todos vieram do mesmo endereço em um minuto, então a geografia não pode ser a variável ali. O resultado dela e o meu também concordam, já que um navegador normal UA retorna 200 para mim também, então provavelmente estávamos testando coisas diferentes.

A linha que merece atenção é OAI-SearchBot em 200 enquanto GPTBot e ChatGPT-User obtenha 403. O Reddit está tratando os próprios agentes da OpenAI de maneira diferente uns dos outros, uma distinção que nenhuma explicação geográfica alcança.

Qualquer que seja o robots.txt que cada agente receba, esse conteúdo chegou ao modelo, atual e em massa, em uma consulta feita esta semana. Vale a pena acrescentar que o robots.txt rege o rastreamento de qualquer maneira e um feed de dados licenciado não está rastreando.

Autenticação em Old.reddit.com

Uma terceira versão da ideia de acesso também está circulando, em que o Reddit colocou um mural de login old.reddit.com e tornou a raspagem mais difícil. Essa parte é verdade. O r/whatnotapp thread ChatGPT citado redireciona para /login/ sobre old.reddit.comenquanto o mesmo tópico em www.reddit.com retorna 200 e atende normalmente.

Crdito da imagem: Suganthan Mohanadasan

Porém, isso não acontece porque cada URL do Reddit no pool de recuperação é www.reddit.com. Uma parede em um nome de host que ChatGPT nunca solicitou não está no caminho. O acordo de licenciamento da OpenAI pode tornar toda a questão discutível de qualquer maneira, e não posso dizer pela carga útil se esses threads chegaram através da API de dados, do próprio índice da OpenAI ou de um rastreamento de www. O nome do host eu posso lhe dizer, e não é o fechado.

De qualquer forma, seis tópicos citados respondem à questão de acesso do outro lado. Você não pode citar o que não pode alcançar.

Há também um problema de tempo para o acesso como causa. O portão que Jenny descreve está em vigor há cerca de dois anos. A queda nas citações já dura três semanas.

Na consulta do chat ao vivo, a queda ocorreu após a busca

Ambas as explicações são sobre busca e buscar está funcionando em todas as consultas que capturei.

Na desmontagem, uma consulta de chat ao vivo puxou 84 tópicos do Reddit de 221 resultados e não citou nenhum deles. As páginas chegaram nessa questão e depois ficaram sem créditos, o que ainda precisa ser explicado. É também aquele que não se repete aqui, portanto, o que quer que governe o crédito varia de acordo com a consulta, em vez de ocorrer em uma direção.

Essa é a etapa que você não consegue ver em um SERP ou robots.txt. A experiência de que necessita é outra vez diferente. Mantenha uma consulta constante, capture o pool e verifique se o texto da resposta rastreia os trechos do Reddit que foram buscados e nunca creditados. Isso testaria a influência diretamente, o que nenhum de nós pode provar atualmente.

Uma parcela de citações em queda e um subreddit vencedor

O Reddit está sendo pesquisado deliberadamente, até a comunidade individual, com as janelas de atualização mais amplas que já vi o ChatGPT conceder alguma coisa. Ele foi muito citado na questão de onde um subreddit é a melhor fonte disponível, e não na questão da categoria do fornecedor que verifiquei, onde páginas de preços e sites de comparação respondem à mesma coisa.

Esse é um problema diferente daquele que está sendo discutido. A parcela agregada de citações pode cair drasticamente enquanto o Reddit continua ganhando as consultas que merece, e ambas podem ser verdadeiras ao mesmo tempo.

O que não estou reivindicando

Quatro consultas, uma conta, uma semana. Dois dos quatro não acessaram nenhum Reddit e um não desencadeou uma busca. O ponto mais amplo que o Reddit aparece menos do que antes não está em discussão, e não posso dizer onde fica a linha entre uma consulta que recebe citações do Reddit e outra que não.

Jenny chamou isso de situação sim e com vários fatores contribuintes, e acho que isso está mais próximo da verdade do que uma explicação por si só, inclusive a minha. As classificações do Bing, as regras de acesso do Reddit e tudo o que rege o crédito podem estar acontecendo ao mesmo tempo.

O trânsito muda para onde olhar. A porta está aberta, então a questão passa para o que decidiu que 84 tópicos buscados valiam a pena ser lidos e não valiam a pena serem creditados na consulta do chat ao vivo, quando os 48 buscados aqui receberam seis das oito citações.

Se esses tópicos não creditados ainda constituem a resposta é a parte que não posso provar pelo tráfego, porque a influência sem uma citação não deixa rastros na transmissão.

Mais recursos:


Este post foi publicado originalmente no Suganthan.


Imagem em destaque: NONGNUCH VIKRUTHA/Shutterstock



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Veja Também
Fechar
Botão Voltar ao Topo