Anthropic ने AI पारदर्शकता वाढवण्यासाठी आणि उदयोन्मुख नियमांचे पालन करण्यासाठी त्यांच्या Claude मॉडेल फॅमिलीमध्ये अधिकृतपणे 'टेक्स्ट वॉटरमार्किंग' (text watermarking) लागू करण्यास सुरुवात केली आहे. कंपनीने अखंड एकत्रीकरणाचे आश्वासन दिले असले तरी, भाषिक अचूकतेवर होणारा परिणाम आणि शोधण्यायोग्य AI लेखनाचे कायदेशीर परिणाम याबद्दल एक वाद निर्माण होत आहे.
स्टेल्थ वॉटरमार्किंगची कार्यपद्धती
Anthropic चा दृष्टिकोन Google DeepMind च्या SynthID-Text कार्यपद्धतीवर आधारित आहे. पारंपारिक वॉटरमार्किंगच्या उलट, जे दृश्य लेबल किंवा लपलेले Unicode कॅरेक्टर्स समाविष्ट करू शकते, ही प्रणाली Large Language Model (LLM) च्या संभाव्यता (probabilistic) स्तरावर कार्य करते. टोकन निवडीदरम्यान वापरल्या जाणाऱ्या रँडमनेस (randomness) स्त्रोतात सूक्ष्म बदल करून ही प्रणाली काम करते. विशिष्ट शब्द निवडीची संभाव्यता समायोजित करून, ही प्रणाली एक सांख्यिकीयदृष्ट्या शोधण्यायोग्य नमुना (pattern) तयार करते, जो मजकुराचे दृश्य स्वरूप न बदलता विशेष सॉफ्टवेअरद्वारे ओळखला जाऊ शकतो.
Anthropic चा असा दावा आहे की या प्रक्रियेचा Claude च्या आउटपुटच्या सर्जनशीलता किंवा वाचनीयतेवर कोणताही मोजता येण्याजोगा परिणाम होत नाही. उच्च-अचूकता असलेल्या वातावरणातील धोके कमी करण्यासाठी, कंपनीने नमूद केले आहे की, ज्या परिच्छेदांमध्ये तथ्ये जास्त आहेत आणि जिथे शब्दसंग्रह अर्थपूर्ण आवश्यकतेमुळे मर्यादित आहे, तिथे वॉटरमार्किंग "विरळ" (sparser) असते.
भाषिक टीका: अचूकता विरुद्ध पॅटर्निंग
Anthropic च्या आश्वासनांनंतरही, Daring Fireball चे जॉन ग्रुबर यांसारख्या प्रमुख तंत्रज्ञान समीक्षकांचा असा युक्तिवाद आहे की "अदृश्य" (imperceptible) असल्याचा दावा सदोष आहे. या युक्तिवादाचा गाभा अर्थपूर्ण सूक्ष्मतेवर (semantic nuance) आधारित आहे: कोणतेही दोन समानार्थी शब्द पूर्णपणे एकमेकांऐवजी वापरता येत नाहीत. जर वॉटरमार्किंग अल्गोरिदम सांख्यिकीय नमुना टिकवून ठेवण्यासाठी एखाद्या विशिष्ट टोकनला प्राधान्य देत असेल, तर ते वॉटरमार्किंगसाठी सांख्यिकीयदृष्ट्या "योग्य" असलेल्या शब्दाच्या बाजूने अधिक अचूक शब्द वगळू शकते.
ग्रुबर यांच्या मते, यामुळे मजकुराच्या गुणवत्तेत सूक्ष्म घसरण होऊ शकते. त्यांनी असेही नमूद केले की SynthID सारख्या प्रणालींची पडताळणी करण्यासाठी वापरले जाणारे सध्याचे निकष—जसे की वापरकर्त्यांचे "thumbs-up/down" रेटिंग—अपुरे आहेत. एखादा वापरकर्ता "overcast" ऐवजी "grey" हा शब्द निवडल्याबद्दल मॉडेलला कमी गुण देण्याची शक्यता कमी आहे, जरी दुसरा शब्द अधिक चांगल्या शैलीची खोली देत असला तरीही. याचा अर्थ असा की, मजकुराची "गुणवत्ता" अशा प्रकारे कमी होऊ शकते जी मानक बेंचमार्क पकडू शकत नाहीत.
कायदेशीर परिणाम आणि खुणांचे "चिकट" स्वरूप
ही अंमलबजावणी व्यावसायिक क्षेत्रांसाठी, विशेषतः कायद्याच्या क्षेत्रासाठी, महत्त्वपूर्ण गुंतागुंत निर्माण करते. Artificial Lawyer नुसार, बहुतेक क्लायंट्सना AI च्या मदतीबद्दल फारशी तमा नसते, परंतु ज्या प्रकरणांमध्ये न्यायाधीश किंवा क्लायंटने AI च्या वापराला स्पष्टपणे मनाई केली आहे, अशा प्रकरणांमध्ये AI चा सहभाग सिद्ध करण्याची क्षमता ही एक जबाबदारी (liability) बनते.
या वॉटरमार्क्सचे "टिकून राहणे" (persistence) हे एक महत्त्वाचे तांत्रिक आव्हान आहे. कारण हे खुणा मजकुरातच अंतर्भूत असतात, त्यामुळे त्या कागदपत्रांमध्ये पसरू शकतात. मानवाने तयार केलेल्या करारात जर AI-निर्मित कलम असेल, तर त्यातील वॉटरमार्क पुढेही कायम राहील, ज्यामुळे भविष्यातील टेम्पलेट्स दूषित होण्याची शक्यता आहे. शिवाय, कायदेतज्ज्ञ अनेक LLMs वापरत असल्याने, कागदपत्रांमध्ये कालांतराने विविध पुरवठादारांचे ओव्हरलॅपिंग वॉटरमार्क्स असू शकतात, ज्यामुळे पारदर्शकता ऑडिटसाठी एक फॉरेन्सिक nightmare (तपासणीसाठी अत्यंत क्लिष्ट समस्या) निर्माण होऊ शकते.
अनुपालन आणि बगल
हा निर्णय प्रामुख्याने EU AI Act चे पालन करण्याच्या गरजेतून प्रेरित आहे, तरीही प्रादेशिक विखंडन टाळण्यासाठी Anthropic हे फिचर जागतिक स्तरावर लागू करत आहे. २ ऑगस्ट नंतर रिलीज झालेली सर्व Claude मॉडेल्स आधीच वॉटरमार्किंगला सपोर्ट करतात, तर जुन्या मॉडेल्समध्ये हे फिचर नंतर समाविष्ट केले जाणार आहे. तथापि, या प्रणालीची परिणामकारकता अद्याप वादाचा विषय आहे; Declaude सारखी साधने पॅराफ्रेझिंगद्वारे (paraphrasing) या खुणा काढून टाकण्यासाठी आधीच वापरली जात आहेत, ज्यावरून असे सूचित होते की वॉटरमार्किंग नियामक संस्थांना समाधान देऊ शकते, परंतु जाणीवपूर्वक केलेली बगल (circumvention) रोखण्यात ती अपयशी ठरू शकते.
मुख्य निष्कर्ष
- संभाव्यता आधारित शोध (Probabilistic Detection): Anthropic SynthID-शैलीची पद्धत वापरते जी दृश्य कॅरेक्टर्स जोडण्याऐवजी टोकन निवडीचा रँडमनेस बदलते, ज्यामुळे वॉटरमार्क सांख्यिकीयदृष्ट्या शोधण्यायोग्य परंतु दृश्य स्वरूपात लपलेला असतो.
- गुणवत्तेतील तडजोड (Quality Trade-offs): समीक्षकांचा असा युक्तिवाद आहे की वॉटरमार्क नमुना टिकवून ठेवण्यासाठी विशिष्ट शब्द निवडण्यास भाग पाडल्यामुळे अर्थपूर्ण अचूकता आणि शैलीगत सूक्ष्मतेचा मूळतः बळी दिला जातो.
- कायदेशीर जबाबदारी (Legal Liability): वॉटरमार्क्सच्या "चिकट" स्वरूपामुळे AI-निर्मित मजकूर भविष्यातील कागदपत्रांमध्ये शोधण्यायोग्य नमुने नेऊ शकतो, ज्यामुळे लॉ फर्म्स आणि उच्च-नियमन असलेल्या उद्योगांसाठी पारदर्शकतेचे धोके निर्माण होतात.
