Anthropic zal een verborgen digitale handtekening in elk stuk tekst en elk bestand inbedden dat door zijn Claude-modellen wordt geproduceerd, een stap die is ontworpen om te voldoen aan de nieuwe AI-transparantieregels van de Europese Unie. De wijziging treedt in werking voor alle modellen die zijn uitgebracht nadat de Transparency Code van de EU AI Act op 2 augustus van kracht is geworden, en het zal automatisch verschijnen in de API-, Code-, Cowork- en Tag-interfaces van Claude.

Waarom de EU-regel belangrijk is

De Transparency Code verplicht ontwikkelaars om door AI gegenereerde of bewerkte inhoud te markeren, zodat systemen verderop in de keten de synthetische oorsprong ervan kunnen herkennen. De regel heeft tot doel desinformatie in te dammen en gebruikers een duidelijk signaal te geven wanneer ze te maken hebben met door machines vervaardigd materiaal. De reactie van Anthropic — watermerking op modelniveau — plaatst de markering rechtstreeks in de output, in plaats van deze aan een product-UI toe te voegen.

Andere AI-giganten doen soortgelijke beloften. Google, Meta, Microsoft, OpenAI en Black Forest Labs hebben allemaal aangegeven dat ze aan de EU-normen zullen voldoen. Voor niet-tekstuele activa zal Anthropic de open standaard C2PA gebruiken, een publiekelijk gedocumenteerde methode voor het inbedden van herkomstgegevens in afbeeldingen, video en andere media. Door een open specificatie te volgen, hoopt Anthropic dat zijn markeringen zullen werken met tools die journalisten, platforms en factcheckers al gebruiken.

Hoe het watermerk werkt

Anthropic zegt dat het watermerk is ingebakken in het tekstgeneratieproces van het model. In de praktijk wordt de handtekening onderdeel van de tokenstroom die het model uitzendt. Wanneer een gebruiker de tekst kopieert naar een tekstverwerker, een e-mail of een bericht op sociale media, gaat het verborgen patroon ermee mee. Het bedrijf merkt op dat het watermerk bescheiden bewerkingen kan overleven, maar heeft niet onthuld hoeveel tekens er moeten veranderen voordat de markering verdwijnt.

De "Claudefishing"-zorg

De uitrol van Anthropic vindt plaats terwijl de bezorgdheid over het misbruik van large language models (LLM's) toeneemt. Substack-CEO Chris Best heeft onlangs de term "Claudefishing" bedacht om het gebruik van AI te beschrijven voor het creëren van misleidende inhoud die de stem van een specifieke auteur nabootst. Nu synthetische tekst steeds moeilijker te onderscheiden is van menselijk schrijven, wordt automatische detectie van herkomst een cruciale verdedigingslinie.

Anthropic is niet de enige die veiligheidsmaatregelen toevoegt. Het muziekgeneratieplatform Suno en de nieuwsbriefservice Substack hebben mechanismen geïntroduceerd die lezers waarschuwen wanneer een stuk door AI is gemaakt. Door het watermerk bij de bron in te bedden, streeft Anthropic ernaar om het signaal moeilijker te verwijderen en het voor filters verderop in de keten gemakkelijker te maken om erop te reageren.

Belangrijkste punten

  • Naleving van regelgeving: Anthropic voert watermerking in om te voldoen aan de Transparency Code van de EU AI Act, die op 2 augustus van kracht is geworden.
  • Integratie op modelniveau: Watermerken worden op modelniveau toegepast, zodat ze behouden blijven in alle producten (API, Claude Code, etc.) en kopieer-plakacties overleven.
  • Gestandaardiseerde bestandmarkering: Voor bestanden zal Anthropic de open standaard C2PA gebruiken om interoperabiliteit en transparantie in digitale inhoud te waarborgen.