Como a marca d’água em texto do Claude funciona
anthropic.com
Todos os grandes provedores de LLMs serão obrigados, pelo AI Act da União Europeia, a adicionar marcas d’água no conteúdo gerado, incluindo texto. A Anthropic, dona do Claude, explicou o seu método:
Grandes modelos de linguagem, como o Claude, funcionam gerando uma palavra de cada vez. A cada nova palavra, o modelo escolhe entre uma lista de candidatas possíveis, selecionando no fim a mais coerente ou provável com base no texto anterior. Pegue a frase “O tempo hoje estava frio e…”. É muito improvável que a próxima palavra seja “açucarado”. Mas é bem provável que seja “nublado” ou “cinzento”. Na maioria dos casos, não faz muita diferença para o leitor qual dessas duas últimas palavras o modelo escolhe — o sentido da frase permanece praticamente o mesmo de qualquer forma. Em situações assim, a escolha é decidida por um número aleatório.
A marca d’água usa justamente essas escolhas de baixo impacto — que se repetem muitas vezes ao longo de um texto gerado — para deixar um padrão nas respostas do Claude. Esse padrão é imperceptível para quem lê, mas identificável por qualquer um que tenha uma chave capaz de decodificá-lo. Quando a marca d’água é usada, as escolhas continuam sendo feitas de forma aleatória, mas a origem dessa aleatoriedade muda. Em vez de recorrer a um gerador de números aleatórios qualquer para escolher a próxima palavra, o sistema usa a chave e as palavras anteriores para definir qual palavra o modelo deve escolher. Ou seja, as palavras que o Claude escolhe continuam sendo aleatórias, mas agora é possível verificar a sequência de palavras e checar se ela é compatível com as escolhas que o Claude faria caso estivesse usando aquela chave. Se for, dá para calcular a probabilidade de que o texto tenha sido gerado pelo Claude.
A solução é a mesma que o Google criou e usa desde 2024 no Gemini, chamada SynthID-Text.
Tem gente arrancando os cabelos por causa dessa mudança. Como digo há algum tempo, para mim tanto faz.
Além disso, é provável que apareçam (se já não existirem) sistemas simples que substituam algumas palavras por sinônimos, o que (em tese? Alguém me corrija se for o caso) quebraria a assinatura digital do SynthID-Text. Ainda no campo das suposições, imagino que jogar o texto em outro LLM e pedir para substituir algumas palavras e estruturas já surta efeito.
Independentemente de qualquer coisa, está na hora de quem usa IA generativa para criar texto assumir os seus BOs, né?
Acho que a primeira coisa que ocorre às pessoas quando esse assunto vem à tona é o uso da marca d’água para apontar dedos e humilhar quem os usa. É possível imaginar, porém, outros usos, como auxiliar na triagem de solicitações a órgãos públicos, que, como Ronaldo Lemos apontou em sua coluna na Folha de S.Paulo deste domingo (16), já está afogando governos e a Justiça de vários países.
Vou ser eu a perguntar qual é o problema de gerar um texto com IA?
Ou melhor, qual é a diferença de usar IA para gerar o texto a partir de várias sessões com as duas ideias e de traduzir um texto usando o Google Tradutor (que lembre, use Transformers desde 2017)? Ou ainda, de usar o Trados que auto-traduz segmentos inteiros usando fuzzy-matchs?
Se antes a gente usava o Google Tradutor e arrumava (editava) a tradução dele, o texto era nosso? Qual é a diferença entre várias sessões de idas-e-vindas com o LLM e uma edição de tradução por máquina? Parece que o problema é mais psicológico do que tecnológico.
Indo além, O Trados (e outros SMT) usam essa lógica de fuzzy-match onde ele compara os segmentos de uma tradução e vai sugerindo traduções com base nisso. Isso não é muito diferente de um LLM que escolhe o que escrever de acordo com a similaridade dois segmentos (tem até níveis percentuais disso).
De novo, me soa como indulgência. E europeus são muito bons nisso.
No meu achismo, creio que o rancor maior é pelo texto gerado e compartilhado sem essas idas e vindas. Que o digam os muitos trechos esquecidos do LLM perguntando se o usuário quer mudar isso ou adicionar aquilo. Acho que o texto de IA é um reflexo bem vistoso de algo feito sem cuidado; a pessoa apenas não se importa em absoluto com quem terá que ler aquilo.
Entendo esse ponto, não tinha me passado pela cabeça.
Mas esse desleixo não é reflexo da IA, ela só deve ter deixado ele ainda mais evidente. Mas quando eu era tradutor/revisor, o que eu mais pegava era tradução feita no modelo que eu citei (Google + Trados) que era muito ruim. As vezes por prazos apertados, mas na maioria das vezes por desleixo reforçado pelo pensando de “o revisor arruma isso depois”. Mas com o tempo fomos extirpando o revisor do processo (custos, sempre eles) e o texto foi ficando mais e mais robótico e mais e mais estranho.
Disso vieram coisas como mandatório, aplicar (no sentido de candidatar-se), eu assumo que (I assume that), é sobre isso (it’s about), performar, customizar etc.
Veja que o meu ponto não é defender a IA, é pontuar que estamos atacando algo que sempre existiu só que agora parece que as pessoas se deram conta porque alguns profissionais estão muito brabos com essas ocorrências. O meu ponto é que isso é o normal do mercado (de texto) faz quase 2 décadas.
você está coberto de razão
o mesmo vale para o mundo da ilustração e do design (mas não no mundo da arte que aí o problema é de outra ordem): todo mundo reclamando da mediocridade e pasteurização das peças gráficas produzidas por IA mas essa mediocridade JÁ VINHA DAS PRÓPRIAS IMAGENS QUE ALIMENTARAM AS IAs EM PRIMEIRO LUGAR.
o mundo da indústria cultural (e da cultura pop) já produzia essa estética pasteurizada e agora ela é potencializada pelas IAs
não é como se no interior da cultura pop fosse possível promover de forma sistemática e hegemônica estéticas sofisticadas ou experimentais antes das IAs
e mesmo assim isso não impede falsos positivos (afinal, não é impossível que entre milhões de pessoas produzindo textos previsíveis, sobretudo em contextos bastante protocolares, nenhuma delas não gere um texto muito similar àquele gerado por esta chave)
não se trata afinal de um metadado que fica inserido no próprio texto — algo impossível, salvo engano, em texto puro, correto? houvesse algum tipo de metadado, ele poderia perdurar mesmo que parte das palavras do conjunto fosse alterada, mas não é o caso
e independente disso, acho que a simples existência deste tipo de detector apenas aponta para o pânico moral em torno das IAs e à neurose em identificar o que é supostamente verdadeiro ou falso (num momento em que já não faz mais sentido falar em verdade ou mentira)
> e independente disso, acho que a simples existência deste tipo de detector apenas aponta para o pânico moral em torno das IAs e à neurose em identificar o que é supostamente verdadeiro ou falso (num momento em que já não faz mais sentido falar em verdade ou mentira)
Neurose parece dar conta do recado.
Tínhamos o “pânico satânico” antigamente, agora temos o “pânico de IA”.
Eu acredito em usos legítimos para IAs generativas que não sejam especificamente para aumentar e acelerar a produção de conteúdo, e sim auxiliar em certos aspectos da vida humana, especialmente quando pessoas possuem incapacidades. Cito, por exemplo, uma IA que conseguiria descrever uma imagem para pessoas cegas, ou outro exemplo que vi recentemente, uma IA integrada a um óculos e que descreveria, ao ser acionada, o que está na frente de uma pessoa, ou responderia a perguntas sobre um cardápio ou uma placa.