AI வெளிப்படைத்தன்மையை மேம்படுத்தவும், வளர்ந்து வரும் விதிமுறைகளுக்கு இணங்கவும், Anthropic நிறுவனம் தனது Claude மாடல் குடும்பம் முழுவதும் உரை நீர் அடையாளங்களை (text watermarking) அதிகாரப்பூர்வமாக நடைமுறைப்படுத்தத் தொடங்கியுள்ளது. இந்த ஒருங்கிணைப்பு தடையின்றி இருக்கும் என்று நிறுவனம் உறுதியளித்தாலும், மொழியியல் துல்லியம் மற்றும் கண்டறியக்கூடிய AI ஆசிரியர் உரிமை குறித்த சட்டரீதியான தாக்கங்கள் தொடர்பாக ஒரு விவாதம் எழுந்து வருகிறது.

மறைமுக நீர் அடையாள முறையின் செயல்பாடுகள்

Anthropic-ன் அணுகுமுறை Google DeepMind-ன் SynthID-Text முறையைப் பின்பற்றி வடிவமைக்கப்பட்டுள்ளது. கண்ணுக்குத் தெரியும் லேபிள்களையோ அல்லது மறைக்கப்பட்ட Unicode எழுத்துக்களையோ சேர்க்கும் பாரம்பரிய நீர் அடையாள முறையைப் போலல்லாமல், இந்த அமைப்பு Large Language Model (LLM)-ன் நிகழ்தகவு (probabilistic) மட்டத்தில் செயல்படுகிறது. இது டோக்கன் (token) தேர்வின் போது பயன்படுத்தப்படும் சீரற்ற தன்மையின் (randomness) மூலத்தை நுணுக்கமாக மாற்றுவதன் மூலம் செயல்படுகிறது. குறிப்பிட்ட சொற்களைத் தேர்ந்தெடுப்பதற்கான நிகழ்தகவைச் சரிசெய்வதன் மூலம், இந்த அமைப்பு உரையின் காட்சித் தோற்றத்தை மாற்றாமல், சிறப்பு மென்பொருட்களால் கண்டறியக்கூடிய புள்ளிவிவர ரீதியான அமைப்பை (statistically detectable pattern) உருவாக்குகிறது.

இந்த செயல்முறை Claude-ன் வெளியீட்டின் படைப்பாற்றல் அல்லது வாசிப்புத் திறனில் அளவிடக்கூடிய தாக்கத்தை ஏற்படுத்தாது என்று Anthropic கூறுகிறது. அதிகத் துல்லியம் தேவைப்படும் சூழல்களில் ஏற்படும் அபாயங்களைக் குறைக்க, சொற்களஞ்சியம் பொருண்மைத் தேவைகளால் (semantic necessity) கட்டுப்படுத்தப்படும் உண்மை சார்ந்த பகுதிகளில், நீர் அடையாளங்கள் "குறைவாகவே" (sparser) இருக்கும் என்று நிறுவனம் குறிப்பிடுகிறது.

மொழியியல் விமர்சனம்: துல்லியம் மற்றும் அமைப்புமுறை

Anthropic-ன் உறுதிமொழிகளுக்கு மத்தியிலும், Daring Fireball-ன் John Gruber போன்ற முன்னணி தொழில்நுட்ப விமர்சகர்கள், "கண்டறிய முடியாதது" என்ற கூற்று தவறானது என்று வாதிடுகின்றனர். இந்த வாதத்தின் மையம் பொருண்மை நுணுக்கம் (semantic nuance) ஆகும்: எந்த இரண்டு ஒத்த சொற்களும் (synonyms) முற்றிலும் மாற்றத்தக்கவை அல்ல. நீர் அடையாள அல்காரிதம் ஒரு புள்ளிவிவர அமைப்பைப் பராமரிக்க ஒரு குறிப்பிட்ட டோக்கனுக்கு முன்னுரிமை அளித்தால், அது நீர் அடையாளத்திற்கு புள்ளிவிவர ரீதியாக "சரியான" ஒரு சொல்லைத் தேர்ந்தெடுக்க, மிகவும் துல்லியமான ஒரு சொல்லைத் தவிர்த்துவிடக்கூடும்.

இது உரைத் தரத்தில் ஒரு நுட்பமான வீழ்ச்சிக்கு வழிவகுக்கும் என்று Gruber கூறுகிறார். SynthID போன்ற அமைப்புகளைச் சரிபார்க்கப் பயன்படுத்தப்படும் தற்போதைய அளவீடுகள்—பயனர்களின் "thumbs-up/down" மதிப்பீடுகள் போன்றவை—போதுமானவை அல்ல என்றும் அவர் குறிப்பிடுகிறார். "overcast" என்பதற்குப் பதிலாக "grey" என்ற சொல்லைத் தேர்ந்தெடுப்பதற்காக ஒரு பயனர் மாடலுக்குத் தண்டனை அளிக்க வாய்ப்பில்லை; ஏனெனில் "overcast" என்பது சிறந்த பாணி ஆழத்தை (stylistic depth) வழங்கினாலும், தரமான அளவுகோல்கள் (benchmarks) கண்டறிய முடியாத வழிகளில் உரையின் "தரம்" குறையக்கூடும்.

சட்டரீதியான தாக்கங்கள் மற்றும் அடையாளங்களின் "ஒட்டும்" தன்மை

இந்த அறிமுகம் தொழில்முறைத் துறைகளில், குறிப்பாகச் சட்டத் துறையில் குறிப்பிடத்தக்க சிக்கல்களை ஏற்படுத்துகிறது. Artificial Lawyer-ன் படி, பெரும்பாலான வாடிக்கையாளர்கள் AI உதவியைப் பற்றி கவலைப்படாவிட்டாலும், ஒரு நீதிபதி அல்லது வாடிக்கையாளர் AI பயன்பாட்டைத் தெளிவாகத் தடை செய்திருக்கும் வழக்குகளில், AI-ன் ஈடுபாட்டை நிரூபிக்கும் திறன் ஒரு பொறுப்பாக (liability) மாறுகிறது.

இந்த நீர் அடையாளங்களின் "நிலைத்தன்மை" (persistence) ஒரு முக்கியமான தொழில்நுட்ப சவாலாகும். இந்த அடையாளங்கள் உரையின் உள்ளேயே இணைக்கப்பட்டுள்ளதால், அவை ஆவணங்கள் முழுவதும் பரவக்கூடும். ஒரு மனிதனால் உருவாக்கப்பட்ட ஒப்பந்தத்தில் AI மூலம் உருவாக்கப்பட்ட ஒரு பிரிவு இருந்தால், அது அந்த நீர் அடையாளத்தை அடுத்தடுத்த ஆவணங்களுக்கும் கொண்டு செல்லும், இது எதிர்கால டெம்ப்ளேட்களை (templates) பாதிக்கக்கூடும். மேலும், சட்ட வல்லுநர்கள் பல LLM-களைப் பயன்படுத்துவதால், ஆவணங்களில் இறுதியில் வெவ்வேறு வழங்குநர்களிடமிருந்து வரும் ஒன்றன் மேல் ஒன்றாகப் படிந்த நீர் அடையாளங்கள் இருக்கலாம், இது வெளிப்படைத்தன்மை தணிக்கைகளுக்கு (transparency audits) ஒரு பெரும் தடயவியல் சவாலாக அமையும்.

விதிமுறை இணக்கம் மற்றும் தவிப்பு முறைகள்

இந்த நடவடிக்கை முக்கியமாக EU AI Act-க்கு இணங்குவதற்கான தேவையால் எடுக்கப்பட்டது, இருப்பினும் பிராந்திய ரீதியான பிரிவினையைத் தவிர்க்க Anthropic இந்த அம்சத்தை உலகளவில் செயல்படுத்துகிறது. ஆகஸ்ட் 2-க்குப் பிறகு வெளியிடப்பட்ட அனைத்து Claude மாடல்களும் ஏற்கனவே நீர் அடையாளங்களை ஆதரிக்கின்றன, பழைய மாடல்களும் விரைவில் இத்தகைய வசதியுடன் மேம்படுத்தப்பட உள்ளன. இருப்பினும், இந்த அமைப்பின் செயல்திறன் இன்னும் விவாதத்திற்குரியதாகவே உள்ளது; Declaude போன்ற கருவிகள் ஏற்கனவே மறுசொல் மாற்றங்கள் (paraphrasing) மூலம் இந்த அடையாளங்களை நீக்கப் பயன்படுத்தப்படுகின்றன. இது நீர் அடையாளங்கள் ஒழுங்குமுறை ஆணையர்களைத் திருப்திப்படுத்தினாலும், திட்டமிட்ட தவிப்பு முறைகளைத் தடுப்பதில் அது சிரமப்படலாம் என்பதைக் காட்டுகிறது.

முக்கியக் குறிப்புகள்

  • நிகழ்தகவு அடிப்படையிலான கண்டறிதல்: Anthropic ஒரு SynthID-பாணி முறையைப் பயன்படுத்துகிறது, இது கண்ணுக்குத் தெரியும் எழுத்துக்களைச் சேர்ப்பதற்குப் பதிலாக டோக்கன் தேர்வுச் சீரற்ற தன்மையை மாற்றுகிறது, இதனால் நீர் அடையாளம் புள்ளிவிவர ரீதியாகக் கண்டறியக்கூடியதாகவும் ஆனால் காட்சி ரீதியாக மறைக்கப்பட்டதாகவும் உள்ளது.
  • தரத் தரம் சார்ந்த சமரசங்கள்: ஒரு நீர் அடையாள அமைப்பைப் பராமரிக்க குறிப்பிட்ட சொற்களைத் தேர்ந்தெடுக்கக் கட்டாயப்படுத்துவது, இயல்பாகவே பொருண்மைத் துல்லியம் மற்றும் பாணி நுணுக்கங்களைச் சிதைக்கும் என்று விமர்சகர்கள் வாதிடுகின்றனர்.
  • சட்டரீதியான பொறுப்பு: நீர் அடையாளங்களின் "ஒட்டும்" தன்மை காரணமாக, AI மூலம் உருவாக்கப்பட்ட உரை எதிர்கால ஆவணங்களிலும் கண்டறியக்கூடிய வடிவங்களைக் கொண்டு செல்லக்கூடும், இது சட்ட நிறுவனங்கள் மற்றும் அதிகக் கட்டுப்பாடுகள் கொண்ட தொழில்துறைகளுக்கு வெளிப்படைத்தன்மை அபாயங்களை உருவாக்குகிறது.