Anthropic আনুষ্ঠানিকভাবে তাদের Claude মডেল ফ্যামিলিতে টেক্সট ওয়াটারমার্কিং (text watermarking) প্রয়োগ করা শুরু করেছে যাতে AI স্বচ্ছতা বৃদ্ধি করা যায় এবং উদীয়মান রেগুলেশন বা নীতিমালা মেনে চলা যায়। যদিও কোম্পানিটি নিরবচ্ছিন্ন ইন্টিগ্রেশনের প্রতিশ্রুতি দিচ্ছে, তবে ভাষাগত নির্ভুলতার ওপর এর প্রভাব এবং শনাক্তযোগ্য AI লেখকত্বের আইনি দিক নিয়ে একটি ক্রমবর্ধমান বিতর্ক তৈরি হচ্ছে।
স্টিলথ ওয়াটারমার্কিংয়ের কার্যপদ্ধতি
Anthropic-এর এই পদ্ধতিটি Google DeepMind-এর SynthID-Text মেথডোলজির আদলে তৈরি। প্রথাগত ওয়াটারমার্কিংয়ের মতো নয়, যা দৃশ্যমান লেবেল বা লুকানো Unicode ক্যারেক্টার যুক্ত করতে পারে, এই সিস্টেমটি Large Language Model (LLM)-এর প্রোবাবিলিস্টিক (probabilistic) স্তরে কাজ করে। এটি টোকেন নির্বাচনের সময় ব্যবহৃত র্যান্ডমনেস সোর্সকে (randomness source) সূক্ষ্মভাবে পরিবর্তন করার মাধ্যমে কাজ করে। নির্দিষ্ট শব্দ নির্বাচনের সম্ভাবনা (probability) সমন্বয় করার মাধ্যমে, সিস্টেমটি একটি পরিসংখ্যানগতভাবে শনাক্তযোগ্য প্যাটার্ন তৈরি করে যা টেক্সটের বাহ্যিক রূপ পরিবর্তন না করেই বিশেষায়িত সফটওয়্যারের মাধ্যমে শনাক্ত করা সম্ভব।
Anthropic দাবি করেছে যে, এই প্রক্রিয়ার ফলে Claude-এর আউটপুটের সৃজনশীলতা বা পঠনযোগ্যতার ওপর কোনো পরিমাপযোগ্য প্রভাব পড়ে না। উচ্চ-নির্ভুলতা সম্পন্ন পরিবেশে ঝুঁকি কমাতে কোম্পানিটি উল্লেখ করেছে যে, তথ্যবহুল অনুচ্ছেদগুলোতে যেখানে শব্দভাণ্ডার অর্থগত প্রয়োজনের কারণে সীমাবদ্ধ থাকে, সেখানে ওয়াটারমার্কিং অনেক বেশি "বিরল" (sparser) হয়।
ভাষাগত সমালোচনা: নির্ভুলতা বনাম প্যাটার্নিং
Anthropic-এর আশ্বাসের পরেও, Daring Fireball-এর জন গ্রুবার (John Gruber)-এর মতো বিশিষ্ট প্রযুক্তি সমালোচকরা যুক্তি দিচ্ছেন যে, "অদৃশ্য" বা "অনুপ্রবেশহীন" (imperceptible) দাবিটি ত্রুটিপূর্ণ। এই যুক্তির মূল ভিত্তি হলো সেমান্টিক বা অর্থগত সূক্ষ্মতা: কোনো দুটি সমার্থক শব্দই পুরোপুরি একে অপরের বিকল্প হতে পারে না। যদি ওয়াটারমার্কিং অ্যালগরিদম একটি পরিসংখ্যানগত প্যাটার্ন বজায় রাখার জন্য একটি নির্দিষ্ট টোকেনকে অগ্রাধিকার দেয়, তবে এটি ওয়াটারমার্কের জন্য পরিসংখ্যানগতভাবে "সঠিক" একটি শব্দের পরিবর্তে আরও নির্ভুল শব্দ বাদ দিতে পারে।
গ্রুবার পরামর্শ দিয়েছেন যে, এটি টেক্সটের গুণমানকে সূক্ষ্মভাবে হ্রাস করতে পারে। তিনি উল্লেখ করেছেন যে, SynthID-এর মতো সিস্টেমগুলো যাচাই করার জন্য বর্তমানে ব্যবহৃত মেট্রিক্স—যেমন ব্যবহারকারীর "thumbs-up/down" রেটিং—পর্যাপ্ত নয়। একজন ব্যবহারকারী সম্ভবত "overcast"-এর পরিবর্তে "grey" শব্দ বেছে নেওয়ার জন্য একটি মডেলকে নেতিবাচক রেটিং দেবেন না, যদিও পরের শব্দটি আরও ভালো শৈল্পিক গভীরতা প্রদান করে। এর অর্থ হলো, টেক্সটের "গুণমান" এমনভাবে ক্ষয় হতে পারে যা সাধারণ বেঞ্চমার্কগুলো ধরতে ব্যর্থ হয়।
আইনি প্রভাব এবং মার্কের "স্টিকি" বা লেগে থাকার প্রকৃতি
এই পদক্ষেপটি পেশাদার খাতগুলোর জন্য, বিশেষ করে আইনের ক্ষেত্রে, উল্লেখযোগ্য জটিলতা তৈরি করছে। Artificial Lawyer-এর মতে, যদিও বেশিরভাগ ক্লায়েন্ট AI-এর সহায়তা নেওয়ার বিষয়ে উদাসীন, তবে এমন ক্ষেত্রে যেখানে বিচারক বা ক্লায়েন্ট স্পষ্টভাবে AI ব্যবহার নিষিদ্ধ করেছেন, সেখানে AI-এর সম্পৃক্ততা প্রমাণ করার ক্ষমতা একটি দায়বদ্ধতা বা ঝুঁকির কারণ হয়ে দাঁড়ায়।
একটি গুরুত্বপূর্ণ প্রযুক্তিগত চ্যালেঞ্জ হলো এই ওয়াটারমার্কগুলোর "স্থায়িত্ব" (persistence)। যেহেতু এই চিহ্নগুলো টেক্সটের মধ্যেই গেঁথে থাকে, তাই এগুলো নথিপত্র জুড়ে ছড়িয়ে পড়তে পারে। মানুষের লেখা কোনো চুক্তিতে যদি একটি AI-জেনারেটেড ধারা থাকে, তবে সেটি সেই ওয়াটারমার্কটি বহন করে নিয়ে যাবে, যা সম্ভাব্যভাবে ভবিষ্যতের টেমপ্লেটগুলোকে দূষিত করতে পারে। তদুপরি, আইনি পেশাজীবীরা যেহেতু একাধিক LLM ব্যবহার করেন, তাই নথিপত্রগুলোতে শেষ পর্যন্ত বিভিন্ন প্রোভাইডারের ওভারল্যাপিং (overlapping) ওয়াটারমার্ক থাকতে পারে, যা স্বচ্ছতা অডিটের ক্ষেত্রে একটি ফরেনসিক দুঃস্বপ্ন তৈরি করবে।
কমপ্লায়েন্স এবং পরিহার
এই পদক্ষেপটি মূলত EU AI Act মেনে চলার প্রয়োজনে নেওয়া হয়েছে, যদিও আঞ্চলিক বিভাজন এড়াতে Anthropic বিশ্বব্যাপী এই ফিচারটি প্রয়োগ করছে। ২ আগস্টের পরে মুক্তি পাওয়া সমস্ত Claude মডেল ইতিমধ্যেই ওয়াটারমার্কিং সমর্থন করে এবং পুরনো মডেলগুলোকে রিফিটিং (retrofitting)-এর জন্য রাখা হয়েছে। তবে, সিস্টেমটির কার্যকারিতা নিয়ে বিতর্ক রয়েছে; Declaude-এর মতো টুলগুলো ইতিমধ্যেই প্যারাফ্রেজিংয়ের (paraphrasing) মাধ্যমে এই চিহ্নগুলো সরিয়ে ফেলার জন্য ব্যবহৃত হচ্ছে। এটি ইঙ্গিত দেয় যে, ওয়াটারমার্কিং নিয়ন্ত্রকদের সন্তুষ্ট করতে পারলেও, ইচ্ছাকৃতভাবে এটি এড়িয়ে যাওয়া বা পরিহার করা রোধ করতে এটি হিমশিম খেতে পারে।
মূল বিষয়সমূহ
- প্রোবাবিলিস্টিক ডিটেকশন (Probabilistic Detection): Anthropic একটি SynthID-শৈলীর পদ্ধতি ব্যবহার করে যা দৃশ্যমান ক্যারেক্টার যোগ করার পরিবর্তে টোকেন নির্বাচনের র্যান্ডমনেস পরিবর্তন করে, ফলে ওয়াটারমার্কটি পরিসংখ্যানগতভাবে শনাক্তযোগ্য কিন্তু দৃশ্যত অদৃশ্য থাকে।
- গুণমানের ভারসাম্যহীনতা (Quality Trade-offs): সমালোচকরা যুক্তি দেন যে, একটি ওয়াটারমার্ক প্যাটার্ন বজায় রাখার জন্য নির্দিষ্ট শব্দ নির্বাচনে বাধ্য করা মূলত সেমান্টিক নির্ভুলতা এবং শৈল্পিক সূক্ষ্মতাকে বিসর্জন দেয়।
- আইনি দায়বদ্ধতা (Legal Liability): ওয়াটারমার্কের "স্টিকি" বা লেগে থাকার প্রকৃতির অর্থ হলো AI-জেনারেটেড টেক্সট ভবিষ্যতের নথিপত্রে শনাক্তযোগ্য প্যাটার্ন বহন করতে পারে, যা ল ফার্ম এবং উচ্চ-নিয়ন্ত্রিত শিল্পগুলোর জন্য স্বচ্ছতার ঝুঁকি তৈরি করে।
