O mapeamento de entidades funciona no Google. Alguma coisa chega ao ChatGPT?
Se o mapeamento de entidades parece familiar, é porque você já executou esta peça. É a conversa sobre gráfico de conhecimento que você teve em 2021, vestindo uma roupa de 2026. O vocabulário migrou quase intacto: entidades, não strings; desambiguação; mesmoAs; relacionamentos entre nós; alimentar a estrutura; e a máquina entende você. Pegue uma apresentação do cliente de quatro anos atrás, troque “Gráfico de conhecimento” por “IA” e a maioria dos slides sobreviveria à mudança. É por isso que o termo está se espalhando e também é um motivo para desacelerar antes de comprá-lo. A versão compactada, caso você não leia mais: o mapeamento de entidades faz um trabalho real no Google, onde há um gráfico real para alimentar, e quase nenhum trabalho no modelo de linguagem em si, onde não há gráfico para alimentar e nunca existiu. Esses são dois sistemas diferentes com duas regras diferentes, e a indústria os vende como uma tática. Mantê-los separados é importante para os sistemas e LLMs.

No Google, há algum valor
O Mapa do Conhecimento é um objeto real e curado (não deve ser confundido com, digamos, o seu gráfico do conhecimento, que é o seu próprio gráfico mantido de entidades e relacionamentos). O Google o lançou em 2012 sob o lema “coisas, não strings”, e passou anos desde que se tornou a camada que decide sobre quem e sobre o que se trata uma consulta antes que um único resultado seja carregado. Você o alimenta, mas apenas indiretamente, por meio de dados estruturados, corroboração consistente de terceiros e talvez uma entrada limpa do Wikidata com a qual fontes independentes concordem. Você não preenche um formulário e se envia. Você reúne consenso suficiente em toda a web aberta para que os sistemas do Google concluam que você é algo distinto e real para o qual vale a pena ter um nó. A razão pela qual a autodeclaração por si só não faz isso é que o gráfico é uma máquina de confiança, não uma caixa de submissão. Seu esquema declara o que você afirma ser; o nó é construído e confiável quando fontes independentes e confiáveis suficientes dizem a mesma coisa ao Google. É por isso que um item bem referenciado do Wikidata e um punhado de menções autorizadas têm mais peso do que uma página perfeitamente marcada que só fala sobre si mesma, e é por isso que o Google passou os últimos anos restringindo o gráfico em direção a entidades que pode corroborar com confiança, em vez de aquelas que apenas se afirmam. E como as respostas de IA do Google resolvem entidades no mesmo gráfico antes de serem geradas, o trabalho agora ultrapassa os 10 links azuis e também chega às superfícies de IA. No Google, o mapeamento de entidades tem um alvo, e o alvo tem um endereço de correspondência. Essa é a parte que a torcida acerta, mas tem mais.
Então o sistema de destino muda e ninguém anuncia isso
A conversa que você teve em 2021 assumiu um objeto discreto, inspecionável e alimentável. Um nó que você poderia puxar em um painel e corrigir quando estivesse errado. Você poderia ver sua própria entidade, registrar uma correção e observá-la mudar, e toda a prática cresceu em torno de uma superfície que você poderia realmente observar. O mapeamento de entidades mantém cada palavra dessa tática e a aponta silenciosamente para um sistema que não possui nenhuma dessas propriedades. Essa reformulação é um truque de prestidigitação e funciona precisamente porque as palavras não mudaram. Uma suposição atravessa a fronteira sem ser declarada: a de que a coisa do outro lado pode ser alimentada.
Um modelo de linguagem não tem nó para você alimentar
Comece pelo termo, porque nele reside toda a confusão. Memória paramétrica é o conhecimento que um modelo carrega em seus pesos, aprendido uma vez durante o treinamento e distinto do que ele observa ao vivo quando lhe responde. Do lado paramétrico, não há registro da sua marca para abrir e editar. Nenhuma linha, nenhum nó, nenhum painel para corrigir. Existe um padrão estatístico difuso espalhado por bilhões de parâmetros, e ele chegou lá porque o modelo leu o corpus em escala, não porque leu sua marcação. Os investigadores da interpretabilidade afirmam-no sem hesitação: o conhecimento factual nestes modelos é paramétrico e emergente, sem que nenhum parâmetro único contenha qualquer facto e a recordação surge, em vez disso, da activação distribuída através da rede. O mecanismo merece ser enunciado com precisão, porque é na imprecisão que se esconde a tática. Durante o treinamento, o modelo vê sua marca em milhões de contextos e ajusta seus pesos para codificar a forma estatística de como você é descrito: em quais entidades você aparece, em quais categorias você se enquadra, quais afirmações ocorrem ao seu redor. Nada nesse processo analisa um bloco de esquema ou respeita um link SameAs. Ele lê a linguagem, em volume, e o que sobrevive é o consenso, não o código. Sua página é um contexto entre bilhões e, a menos que seja ecoada e repetida em outro lugar, suas declarações estruturadas não pesam quase nada contra a massa de tudo o mais que o modelo ingeriu. Você pode adicionar links SameAs até que toda a página fique azul e você não terá movido esse padrão nem um centímetro, porque o padrão nunca foi aprendido com sua página. Aprendeu com a frequência, a consistência e a credibilidade com que o resto da web fala sobre você. A consequência incômoda é que o trabalho da entidade de maior alavancagem para o lado paramétrico mal chega ao seu site. É ser citado em lugares em que a modelo já confia, receber menções que você não controla e ser descrito da mesma forma por pessoas que não são você. Esse trabalho é mais lento, mais difícil e muito mais durável do que uma auditoria de esquema, e é exatamente por isso que a versão organizada no local vende mais que ele.
Fica pior com a tática. O próprio mapa do modelo não é um mapa
Conceda-me, para fins de argumentação, que você poderia de alguma forma alcançar o lado paramétrico e escrever nele. Você ainda não conseguiu espelhar seu diagrama nele, porque aquilo que você estaria espelhando não tem o formato de um diagrama. Vale a pena lembrar aqui qual mapeamento de entidade realmente está por baixo. Cada declaração de dados estruturados que você faz é um triplo: um sujeito, um predicado e um objeto. Sua marca vende esse produto. Este autor escreveu esse artigo. Esse triplo é a unidade atômica da web semântica e é a unidade que toda a sua prática de entidade existe para produzir. É também a unidade que o modelo de linguagem não armazena. Quando os investigadores rastreiam onde este conhecimento se encontra fisicamente, descobrem que o conhecimento da entidade e o conhecimento relacional vivem em partes diferentes do modelo e não se mapeiam um no outro. Mude a entidade em um fato e mude o relacionamento nesse mesmo fato, e o modelo não responde de forma equivalente, mesmo que seu triplo os trate como dois slots intercambiáveis. Portanto, a estrutura limpa sujeito-predicado-objeto que seu esquema codifica, a própria estrutura que o gráfico do Google foi construído para consumir, não tem nenhuma contrapartida fiel dentro do modelo. O mapeamento de entidade-imagem de nós e arestas é uma conveniência humana, útil para planejamento e inútil como uma descrição dos componentes internos do modelo. Não há nenhum gráfico organizado esperando que você se alinhe, o que torna a entrega um mapa de um território que nunca foi organizado como um mapa. Esse não é um problema de ajuste que você resolve com uma marcação melhor. É uma incompatibilidade de categoria e nenhum esquema a fecha. Na prática, isso significa que você deve parar de avaliar seu trabalho paramétrico pela aparência completa de sua marcação de entidade, porque a organização do mapa não diz nada sobre se o modelo mantém o território.
Imagine um fornecedor de médio porte que fez tudo o que o manual pede. Esquema de organização completo, o mesmo que aponta para cada perfil, um gráfico de entidade interno limpo em todo o site. Pergunte ao ChatGPT sobre sua categoria com a pesquisa habilitada e o fornecedor aparece, porque a busca encontrou aquelas páginas bem estruturadas e as retirou de forma limpa. Faça a mesma pergunta com a pesquisa desativada e o fornecedor simplesmente estará ausente, porque o treinamento do modelo nunca viu o suficiente do mundo descrevê-lo para codificá-lo. Mesma empresa, mesma marcação, mesma plataforma, resultados opostos e a única coisa que mudou foi se o sistema tinha permissão para ler a página. As próprias superfícies do Google ficam em uma terceira posição, resolvendo em relação ao gráfico que o fornecedor vem alimentando o tempo todo, e é por isso que esse lado do trabalho continua parecendo estar ganhando.
Aqui está a parte que traduz
Não deixem que nada disso se transforme em “nada importa”, porque isso é uma reação exagerada. A pesquisa por IA não é puramente paramétrica e a recuperação está realizando um trabalho enorme. Ajuda a separar as superfícies, pois elas se comportam de maneira diferente. Quando um modelo responde de memória sem nenhuma pesquisa, você está atingindo o lado paramétrico e nada em sua página chega até ele. Quando o Perplexity, a IA do Google responde ou um modelo no modo de pesquisa busca páginas ativas antes de responder, você está atingindo o lado da recuperação, onde uma estrutura limpa e sinais de entidade claros realmente ajudam você a ser puxado e citado. A maioria das respostas reais agora combina os dois, usando o conhecimento paramétrico para enquadrar a pergunta e a recuperação para preencher os detalhes, e essa combinação é exatamente a razão pela qual a tática parece funcionar: ela move a metade da recuperação, visivelmente, sem fazer nada com a metade paramétrica que você não pode observar. Ajudar um retriever a encontrá-lo e analisá-lo não é o mesmo que o modelo ter aprendido você. Uma é uma porta que você pode abrir neste bairro com desambiguação e estrutura. O outro está no corpus sobre o qual se falou durante anos para ser construído e que levará anos para mudar. O mapeamento de entidades compra o primeiro de forma confiável e é vendido discretamente como o segundo. O conteúdo estruturado proporciona uma busca e uma extração limpa; a corroboração consistente em toda a web garante a você uma posição por baixo dela. Tratá-los como um único item é o erro.
Isso levanta a questão óbvia de como você saberia qual sistema está realmente se movendo. Você não pode abrir o lado paramétrico e inspecioná-lo, o que é precisamente o que permite que a promessa permaneça incontestada. A única resposta honesta é parar de confiar na história da tática e observar os resultados diretamente: monitorar se você aparece quando o modelo responde de memória e quando ele responde a partir de uma busca ao vivo, nas mesmas perguntas, ao longo do tempo. Se a sua presença aumenta apenas nas respostas orientadas pela recuperação, enquanto as respostas apenas na memória permanecem estáveis, você está observando a divisão acontecer em tempo real e está observando o mapeamento de entidades fazer exatamente metade do que foi vendido para fazer. A medição é o desempate ao qual o discurso de vendas não consegue sobreviver, e esse é o motivo para insistir nele.
A conflação é o produto
Você verá escrito que os dados da sua entidade agora treinam ChatGPT e Claude. Isso não acontece. Esses modelos não são treinados no gráfico proprietário do Google, e a única razão pela qual a afirmação passa de relance é que o Gemini pode usar o gráfico do próprio Google, o que permite que uma verdade específica do Google tome emprestado um traje universal. Uma segunda indicação é mais sutil e mais comum. Um fornecedor mostra que páginas com esquema rico são citadas com mais frequência e chama isso de prova de causalidade. Mas essa correlação é exatamente o que você esperaria por um motivo totalmente diferente: as páginas construídas com cuidado suficiente para conter a marcação completa tendem a ser as mesmas páginas bem fornecidas, bem vinculadas e amplamente referenciadas, que é o que realmente merece a citação. O esquema seguiu em frente. Não dirigiu. O esquema permanece o que sempre foi, uma infraestrutura que ajuda as máquinas a desambiguar você, em vez de uma alavanca que puxa uma citação, e qualquer pessoa que relate uma correlação entre páginas marcadas e citações está observando os resultados, não lendo um mecanismo. Portanto, coloque uma pergunta em cada tom que você ouvir. Peça à pessoa que vende o mapeamento de entidade para nomear o mecanismo pelo qual seu gráfico local altera o que o modelo aprendeu durante o treinamento. Se a resposta for que o esquema ajuda a IA a entender, você recebeu uma observação disfarçada de mecanismo e a etiqueta de preço pertence a um produto diferente. A alfabetização que separa os praticantes que vencerão daqueles que comandaram a peça do ano passado é esta: saber qual sistema você está realmente alimentando e recusar-se a pagar preços gráficos por promessas paramétricas.
Se você está administrando um trabalho de entidade agora e observando sua presença no Google enquanto as próprias respostas do LLM permanecem inalteradas, essa lacuna é o que diz, e eu gostaria de saber como isso está aparecendo para você. Deixe um comentário abaixo.
Mais recursos:
Esta postagem foi publicada originalmente em Duane Forrester Decodes.
Imagem em destaque: FOTOGRIN/Shutterstock; Paulo Bobita/Search Engine Journal
