Anthropic inserirà una firma digitale nascosta in ogni testo e file prodotto dai suoi modelli Claude, una mossa pensata per soddisfare le nuove norme sulla trasparenza dell'IA dell'Unione Europea. La modifica entra in vigore per tutti i modelli rilasciati dopo l'entrata in vigore del Transparency Code dell'EU AI Act, avvenuta il 2 agosto, e apparirà automaticamente nelle interfacce API, Code, Cowork e Tag di Claude.

Perché la norma UE è importante

Il Transparency Code obbliga gli sviluppatori a contrassegnare i contenuti generati o modificati dall'IA, in modo che i sistemi a valle possano individuarne l'origine sintetica. La norma mira a contrastare la disinformazione e a fornire agli utenti un segnale chiaro quando si trovano di fronte a materiale creato da una macchina. La risposta di Anthropic — il watermarking a livello di modello — inserisce il segno direttamente nell'output, invece di aggiungerlo tramite l'interfaccia utente di un prodotto.

Altri giganti dell'IA stanno facendo promesse simili. Google, Meta, Microsoft, OpenAI e Black Forest Labs hanno tutti dichiarato che rispetteranno gli standard dell'UE. Per i contenuti non testuali, Anthropic utilizzerà lo standard aperto C2PA, un metodo documentato pubblicamente per incorporare i dati di provenienza in immagini, video e altri media. Seguendo una specifica aperta, Anthropic spera che i suoi contrassegni siano compatibili con gli strumenti già utilizzati da giornalisti, piattaforme e fact-checker.

Come funziona il watermark

Anthropic afferma che il watermark è integrato nel processo di generazione del testo del modello. In pratica, la firma diventa parte del flusso di token emesso dal modello. Quando un utente copia il testo in un elaboratore di testi, in un'e-mail o in un post sui social media, il pattern nascosto lo segue. L'azienda osserva che il watermark può resistere a modifiche moderate, ma non ha rivelato quanti caratteri debbano cambiare prima che il segno scompaia.

Il timore del "Claudefishing"

Il rilascio di Anthropic avviene mentre cresce l'allarme per l'uso improprio dei modelli linguistici di grandi dimensioni (LLM). Il CEO di Substack, Chris Best, ha coniato recentemente il termine "Claudefishing" per descrivere l'uso dell'IA per creare contenuti ingannevoli che imitano la voce di un particolare autore. Poiché il testo sintetico diventa sempre più difficile da distinguere dalla scrittura umana, il rilevamento automatizzato della provenienza diventa una linea di difesa cruciale.

Anthropic non è l'unica ad aggiungere misure di sicurezza. La piattaforma di generazione musicale Suno e il servizio di newsletter Substack hanno introdotto meccanismi di segnalazione che avvisano i lettori quando un contenuto è stato creato dall'IA. Incorporando il watermark alla fonte, Anthropic mira a rendere il segnale più difficile da rimuovere e più facile da elaborare per i filtri a valle.

Punti chiave

  • Conformità normativa: Anthropic sta implementando il watermarking per soddisfare il Transparency Code dell'EU AI Act, entrato in vigore il 2 agosto.
  • Integrazione a livello di modello: I watermark vengono applicati a livello di modello, quindi persistono in tutti i prodotti (API, Claude Code, ecc.) e sopravvivono alle operazioni di copia-incolla.
  • Contrassegno standardizzato dei file: Per i file, Anthropic utilizzerà lo standard aperto C2PA per garantire interoperabilità e trasparenza nei contenuti digitali.