Como a marca d’água em texto do Claude funciona
anthropic.com
Todos os grandes provedores de LLMs serão obrigados, pelo AI Act da União Europeia, a adicionar marcas d’água no conteúdo gerado, incluindo texto. A Anthropic, dona do Claude, explicou o seu método:
Grandes modelos de linguagem, como o Claude, funcionam gerando uma palavra de cada vez. A cada nova palavra, o modelo escolhe entre uma lista de candidatas possíveis, selecionando no fim a mais coerente ou provável com base no texto anterior. Pegue a frase “O tempo hoje estava frio e…”. É muito improvável que a próxima palavra seja “açucarado”. Mas é bem provável que seja “nublado” ou “cinzento”. Na maioria dos casos, não faz muita diferença para o leitor qual dessas duas últimas palavras o modelo escolhe — o sentido da frase permanece praticamente o mesmo de qualquer forma. Em situações assim, a escolha é decidida por um número aleatório.
A marca d’água usa justamente essas escolhas de baixo impacto — que se repetem muitas vezes ao longo de um texto gerado — para deixar um padrão nas respostas do Claude. Esse padrão é imperceptível para quem lê, mas identificável por qualquer um que tenha uma chave capaz de decodificá-lo. Quando a marca d’água é usada, as escolhas continuam sendo feitas de forma aleatória, mas a origem dessa aleatoriedade muda. Em vez de recorrer a um gerador de números aleatórios qualquer para escolher a próxima palavra, o sistema usa a chave e as palavras anteriores para definir qual palavra o modelo deve escolher. Ou seja, as palavras que o Claude escolhe continuam sendo aleatórias, mas agora é possível verificar a sequência de palavras e checar se ela é compatível com as escolhas que o Claude faria caso estivesse usando aquela chave. Se for, dá para calcular a probabilidade de que o texto tenha sido gerado pelo Claude.
A solução é a mesma que o Google criou e usa desde 2024 no Gemini, chamada SynthID-Text.
Tem gente arrancando os cabelos por causa dessa mudança. Como digo há algum tempo, para mim tanto faz.
Além disso, é provável que apareçam (se já não existirem) sistemas simples que substituam algumas palavras por sinônimos, o que (em tese? Alguém me corrija se for o caso) quebraria a assinatura digital do SynthID-Text. Ainda no campo das suposições, imagino que jogar o texto em outro LLM e pedir para substituir algumas palavras e estruturas já surta efeito.
Independentemente de qualquer coisa, está na hora de quem usa IA generativa para criar texto assumir os seus BOs, né?
Acho que a primeira coisa que ocorre às pessoas quando esse assunto vem à tona é o uso da marca d’água para apontar dedos e humilhar quem os usa. É possível imaginar, porém, outros usos, como auxiliar na triagem de solicitações a órgãos públicos, que, como Ronaldo Lemos apontou em sua coluna na Folha de S.Paulo deste domingo (16), já está afogando governos e a Justiça de vários países.