Por que a marca d’água Claude da Anthropic pode ser um novo método de marcação de texto

Vários artigos de pesquisa se alinham estreitamente com a recém-anunciada marca d’água de texto da Anthropic. Um artigo de pesquisa, no entanto, se destaca porque corresponde muito a tudo o que Claude divulgou até agora, incluindo informações totalmente novas publicadas recentemente na página Transparência da Anthropic.
O tipo de tecnologia para marca d’água de IA
Existem várias tecnologias de marca d’água, mas a que parece ser a candidata mais forte é a chamada MirrorMark, do início deste ano.
MirrorMark não é Unicode, então não é algo que você possa copiar, colar, ver e remover. É um padrão. O padrão reflete a amostragem aleatória inerente à geração de texto LLM, por isso é chamado de MirrorMark.
Ele foi projetado para ser indistinguível da geração normal de texto LLM e resistente à exclusão e inserção de texto, ao mesmo tempo que é resistente à paráfrase.
A razão pela qual o MirrorMark é um forte candidato para o tipo de tecnologia que a Anthropic usa é porque ele atende a todos os seis critérios descritos sobre sua marca d’água.
- MirrorMark é, por design, indistinguível do texto gerado pelo LLM.
- Ele reflete a amostragem aleatória LLM na geração de texto. Não é algo que é aplicado depois.
- É resistente a edições, exclusão de texto e paráfrase.
- Pode ser decodificado. Essa é outra das seis qualidades da Anthropic em seu anúncio de marca d’água de IA.
- Foi inventado pela academia, com quem a Anthropic disse que estava trabalhando.
- Os investigadores universitários também pertencem a uma entidade comercializadora para licenciar a sua utilização.
Duas páginas da Web oferecem pistas sobre a marca d’água da Anthropic
Existem duas páginas no site da Anthropic que oferecem pistas sobre o que é seu algoritmo de marca d’água e como ele funciona.
- O primeiro conjunto de pistas está no anúncio oficial da marca d’água, que detalha seis qualidades da tecnologia de marca d’água. Todo mundo já leu isso.
- A segunda página, a página de transparência de IA, foi atualizada recentemente e informa que a tecnologia foi desenvolvida em uma universidade.
Juntos, os dois conjuntos de pistas ajudam a identificar um forte candidato para a tecnologia, especificamente, seis qualidades para sua tecnologia de marca d’água de IA.
Seis qualidades da marca d’água antrópica
Aqui estão as seis qualidades da marca d’água da Anthropic:
- Está incorporado diretamente no texto gerado
- Não pode ser percebido olhando para o texto.
- A marca d’água não altera o “significado, qualidade ou legibilidade” do texto gerado.
- A marca d’água é gerada no nível do modelo.
- Pode ser detectado após a edição do texto.
- Usuários e terceiros poderão detectá-lo.
Segunda pista: desenvolvida em uma universidade
A página de transparência da Anthropic foi atualizada no dia 23 de julho.
A nova versão contém a seguinte pista totalmente nova:
“…e estamos nos preparando para cumprir as leis aplicáveis dentro dos prazos legais relevantes.”
Essa redação não existia antes de 23 de julho, como pode ser verificado no Archive.org.
A versão anterior dessa seção dizia que a Anthropic não fornecia marca d’água. Isso foi removido. Mas ainda diz que eles trabalham com a academia e a indústria para se manterem atualizados com as tecnologias de marcas d’água.
Versão anterior da página de transparência
“Transparência da geração de IA
Atualmente, Claude possui recursos de entrada multimodais e saídas baseadas em texto, incluindo artefatos baseados em texto e saída de voz de conversão de texto em fala. Embora a marca d’água seja mais comumente aplicada a resultados de imagens, que atualmente não fornecemos, continuamos a trabalhar na indústria e na academia para explorar e nos manter atualizados sobre os desenvolvimentos tecnológicos nesta área.”
Tecnologia de licença de universidades
Muitas pessoas presumem que as empresas de tecnologia constroem e patenteiam suas próprias tecnologias. Mas a realidade é que as universidades licenciam as tecnologias que desenvolvem e recebem pagamentos de royalties por elas. E é isso que pode estar a acontecer com o MirrorMark porque os investigadores pertencem a uma entidade comercializadora que licencia a tecnologia.
Marca d’água imparcial
Primeiro vou escrever sobre uma abordagem diferente de marca d’água chamada MCmark, que também é uma forte candidata. Se você quiser ler sobre Marca de espelhobasta rolar um pouco para baixo. Mas vale a pena entender um pouco sobre o MCmark só para entender que existem diversas formas de colocar marca d’água.
MCmark é um método imparcial de marca d’água que incorpora um sinal estatístico oculto em texto gerado por IA durante a geração de token. Ele preserva a distribuição de saída original do modelo, de modo que a qualidade do texto permanece praticamente inalterada. A marca d’água pode ser detectada posteriormente sem acesso ao prompt original ou à API do modelo e foi projetada para permanecer detectável após alguma modificação no texto.
MCmark é um forte candidato à marca d’água da Anthropic. Se eu fosse avaliar em uma escala de um a cinco quanto à probabilidade de ser compatível, daria uma pontuação de 4,5. A razão pela qual deduzo meio ponto é que a paráfrase pode reduzir a taxa de verdadeiros positivos (TPR) para 11% com uma taxa de falsos positivos (FPR) de 1%. Na reformulação do GPT, obteve 48% TPR e 1% FPR.
Existe outra abordagem chamada MirrorMark que pode permanecer detectável com paráfrase, embora com paráfrase pesada a taxa de verdadeiros positivos possa cair para cerca de 57,8% com uma taxa de falsos positivos de 1%. Mas isso é esperado, visto que a paráfrase reescreve o texto gerado pela IA. A questão é que o MirrorMark pode ser mais resistente contra truques adversários para derrotar a marca d’água do que o MCmark, embora deva ser observado que os dois artigos não usaram exatamente os mesmos métodos de teste.
MirrorMark: uma marca d’água multibit sem distorção para modelos de linguagem grande
Um artigo de pesquisa de 2026 da George Mason University descreve uma abordagem única chamada MirrorMark. A equipe que publicou o MirrorMark também foi responsável por uma abordagem de marca d’água de 2025 chamada StealthInk, que também investiguei, mas descobri que ela fazia uma compensação que a tornava menos confiável em sequências curtas de texto.
InvisibleID e comercialização
MirrorMark se aproxima do anúncio da Anthropic porque corresponde às seis qualidades de marca d’água da Anthropic. E talvez não por coincidência, todos os três pesquisadores envolvidos com o MirrorMark fazem parte da InvisibleID de George Mason, uma entidade para comercializar essa tecnologia. Essa é outra pista de que o MirrorMark pode estar disponível para licenciamento.
Visão geral de como funciona o MirrorMark
MirrorMark é uma tecnologia que insere uma marca d’água sem perturbar os padrões de escolha de token do LLM. O texto gerado permanece indistinguível do texto sem marca d’água. Sobreviver à edição e paráfrase (inserções, exclusões e substituições), com o uso do que chamam de CABS, é um dos objetivos de design do MirrorMark. E, semelhante ao descrito pela Anthropic, a marca d’água é inserida no ponto de geração do texto.
O artigo de pesquisa explica:
“O CABS não só reduz o risco de alocações vazias ou altamente desequilibradas, mas também melhora a resiliência às operações de edição, como inserção, exclusão e substituição.”
MirrorMark influencia as escolhas de token da IA generativa para que o texto gerado contenha um padrão estatístico oculto que se repete, que é a marca d’água. O sistema funciona em três etapas.
A marca d’água não é algo visível e não é um caractere oculto. É um padrão estatístico inserido no momento da seleção do token.
Etapa 1: espelhamento
Os LLMs não escolhem simplesmente a próxima palavra mais provável. Há uma certa quantidade de amostragem aleatória que acontece quando a IA escolhe a próxima palavra em uma sequência. MirrorMark aproveita esse aspecto de como as palavras são escolhidas, espelhando a amostragem aleatória para inserir um símbolo específico, sem alterar visivelmente a qualidade ou o significado do texto.
Etapa 2: Agendador balanceado ancorado no contexto (CABS)
O CABS escolhe qual “símbolo” será inserido em cada etapa do processo de geração do texto. A colocação do símbolo está ligada ao contexto circundante, o que torna o padrão mais difícil de ser perturbado.
Etapa 3: detectando a marca d’água
Um decodificador usa CABS para “repetir” o processo e recuperar as “atribuições de token para posição”, e todos os valores decodificados juntos são usados para detectar a marca d’água.
É assim que o artigo descreve o processo:
“Neste artigo, propomos uma estrutura de marca d’água multi-bit e sem distorção, MirrorMark, que combina três componentes complementares para incorporar e recuperar mensagens multi-bit sem alterar a distribuição de saída dos LLMs.
Primeiro, uma transformação de espelhamento mod-1 codifica um símbolo de m bits refletindo cada valor de u em torno de um pivô específico da mensagem.
Em seguida, o Agendador Balanceado Ancorado no Contexto (CABS) determina qual símbolo é incorporado em cada etapa de geração, mapeando tokens para posições de mensagens de maneira equilibrada e dependente do contexto.
Finalmente, durante a decodificação, o CABS é reproduzido para recuperar atribuições de token para posição, cada símbolo é decodificado a partir dos valores u espelhados usando a função de pontuação apropriada, e todos os valores decodificados sobre os tokens são agregados para detectar a marca d’água.”
Até que ponto o MirrorMark corresponde às seis qualidades de marca d’água da Anthropic?
1. Está incorporado diretamente no texto gerado.
MirrorMark incorpora a marca d’água no ponto de geração do token. Conforme explicado anteriormente, um LLM não escolhe a próxima palavra mais provável em uma sequência de palavras. Ele escolhe a próxima palavra em uma sequência com um fator de aleatoriedade (a aleatoriedade da amostragem). MirrorMark modifica a aleatoriedade da amostragem usada para escolher cada próximo token. É por isso que é chamado de MirrorMark: o jornal diz que o codificador reflete a “aleatoriedade da amostragem”.
2. Não pode ser percebido olhando o texto porque é uma “marca d’água imperceptível”
MirrorMark é uma abordagem de marca d’água para texto sem distorção. Sua principal alegação é incorporar a marca d’água sem alterar a distribuição de probabilidade do token. O texto gerado permanece estatisticamente igual à geração de texto normal.
3. A marca d’água não altera o “significado, qualidade ou legibilidade” do texto gerado.
MirrorMark corresponde fortemente a esta qualidade. O artigo de pesquisa diz que o MirrorMark “preserva a diversidade linguística natural”. Isso ocorre intencionalmente.
4. A marca d’água é “aplicada no nível do modelo”
MirrorMark faz seu trabalho durante a parte de geração de texto, não depois. Isso acontece à medida que o texto é gerado.
5. A marca d’água ainda pode ser detectada após a edição do texto.
MirrorMark foi testado com copiar e colar, exclusão, inserção, paráfrase e substituição. O artigo de pesquisa diz “melhora a resiliência” à exclusão, inserção e substituição. Quanto à paráfrase, diz que “mantém uma forte separabilidade entre amostras com e sem marca d’água… já que a paráfrase altera a forma superficial das sentenças, mas muitas vezes preserva padrões semânticos e estatísticos subjacentes que ainda carregam sinais fracos de marca d’água.” Isso significa que o sinal da marca d’água ainda está lá e pode ser detectado.
6. Usuários e terceiros poderão detectá-lo.
O trabalho de pesquisa diz que a marca d’água é detectável no texto quando ele é decodificado.
O artigo explica:
“Finalmente, durante a decodificação, o CABS é reproduzido para recuperar atribuições de token para posição, cada símbolo é decodificado a partir dos valores u espelhados usando o apropriado
função de pontuação, e todos os valores decodificados nos tokens são agregados para detectar a marca d’água.”
Há uma seção inteira do artigo de pesquisa dedicada à decodificação e detecção da marca d’água (seção 3.3), onde diz:
“O texto é declarado com marca d’água se a pontuação exceder um limite predefinido.”
Esta é a solução de marca d’água de Claude?
Compreensivelmente, Claude não está explicando qual é a solução que eles estão usando. O valor de entender o MirrorMark é que ele mostra que existem métodos alternativos de marca d’água que vão além dos padrões estatísticos no texto gerado e, em vez disso, incorporam a marca d’água na aleatoriedade usada para escolher cada próximo token.
Pode muito bem ser que o que Claude esteja usando seja algo mais próximo do MCmark ou algo totalmente diferente. Mas vale a pena dar uma olhada no MirrorMark simplesmente por causa da maneira como ele trata a marca d’água.
A página da web InvisibleID também contém informações sobre outras abordagens de marca d’água. O artigo 2026 MirrorMark pode ser acessado aqui. StealthInk, um artigo de 2025 dos pesquisadores do MirrorMark, pode ser lido aqui. E a pesquisa MCmark 2025 pode ser lida aqui.
Ler: Anthropic revela o que é a marca d’água e como ela pode ser derrotada
Imagem em destaque por Shutterstock/Melinda Nagy






