Pangram, স্ট্যানফোর্ড AI অ্যালামনাই ম্যাক্স স্পেরো এবং ব্র্যাডলি এমি দ্বারা প্রতিষ্ঠিত নিউ ইয়র্ক ভিত্তিক একটি স্টার্টআপ, Menlo Ventures-এর নেতৃত্বে ৯ মিলিয়ন ডলারের একটি Series A রাউন্ড সম্পন্ন করেছে। এই অর্থায়ন প্ল্যাটফর্মগুলোর জন্য একটি API এবং মাসে ২০ ডলারের একটি Chrome extension চালনা করবে, যা দাবি করে যে এটি ৯৯ শতাংশ নির্ভুলতার সাথে AI-সহায়তা প্রাপ্ত টেক্সট শনাক্ত করতে পারে—এমন একটি দাবি যা সাংবাদিক, পণ্ডিত এবং নিয়োগকর্তাদের সত্যতা যাচাই করার পদ্ধতি বদলে দিতে পারে।

AI-জেনারেটেড “স্লপ”-এর জোয়ার

লার্জ ল্যাঙ্গুয়েজ মডেলগুলো এখন ব্যাপক আকারে নিবন্ধ, সোশ্যাল মিডিয়া পোস্ট এমনকি আইনি উদ্ধৃতিও তৈরি করছে। এর ফলাফল: নিম্নমানের SEO স্প্যাম, সমন্বিত অপপ্রচার (disinformation campaigns) এবং একটি ধূসর অঞ্চল যেখানে মানুষ AI-জেনারেটেড খসড়াগুলোকে পরিমার্জিত করে। প্রতিষ্ঠানগুলো ইতিমধ্যেই প্রতিক্রিয়া জানাচ্ছে। প্রি-প্রিন্ট সার্ভার arXiv সতর্ক করেছে যে, যেসব লেখক অনূর্ধ্বিত LLM আউটপুট জমা দেবেন তাদের এক বছরের জন্য নিষিদ্ধ করা হতে পারে, এবং আদালত সেইসব আইনজীবীদের বিরুদ্ধে ব্যবস্থা নিতে শুরু করেছে যারা AI দ্বারা তৈরি করা ভুয়া উদ্ধৃতির ওপর নির্ভর করেন। মানুষের তৈরি এবং মেশিনের তৈরি আউটপুট আলাদা করার চাপ বাড়ছে, এবং Pangram বাজি ধরেছে যে তাদের প্রযুক্তি ডিফল্ট ভেরিফিকেশন লেয়ার হিসেবে কাজ করতে পারবে।

সিন্থেটিক মিররিং: প্রতিটি ডকুমেন্টের একটি যমজ বা টুইনের ওপর প্রশিক্ষণ

Pangram-এর ফ্ল্যাগশিপ মডেল, Pangram 4, একটি পদ্ধতি ব্যবহার করে যাকে কোম্পানিটি বলে “synthetic mirroring”। তাদের ট্রেনিং সেটে থাকা প্রতিটি মানুষের লেখা ডকুমেন্টের জন্য—যা কোটি কোটি যাচাইকৃত লেখা—টিম একটি ফ্রন্টিয়ার LLM-এর মাধ্যমে তার একটি প্রতিরূপ তৈরি করেছে। এই সিন্থেটিক টুইনটি বিষয়বস্তু, দৈর্ঘ্য এবং টোনের দিক থেকে মূলটির সাথে মিলে যায় কিন্তু এটি একটি AI দ্বারা তৈরি। উভয় সংস্করণকে একই নিউরাল নেটে ইনপুট দেওয়ার মাধ্যমে, Pangram মডেলটিকে সেই সূক্ষ্ম পরিসংখ্যানগত ছাপগুলো (statistical fingerprints) শনাক্ত করতে শেখায় যা AI-জেনারেটেড টেক্সটে থেকে যায়, এমনকি যখন লেখকরা মেশিনের আউটপুট লুকানোর জন্য ডিজাইন করা “AI humanizer” টুল ব্যবহার করেন।

প্রতিযোগীরা মেটাডেটা বা অদৃশ্য ওয়াটারমার্কের ওপর নির্ভর করে, যা মুছে ফেলা বা উপেক্ষা করা সম্ভব। পরিবর্তে Pangram শৈলীগত বিশ্লেষণের (stylistic analysis) ওপর গুরুত্ব দেয়: শব্দ চয়ন, বাক্যের ছন্দ এবং টোকেন ডিস্ট্রিবিউশনের প্যাটার্ন যা একটি মডেলের আউটপুটে সামঞ্জস্যপূর্ণ থাকে। কোম্পানির প্রকাশনা অনুযায়ী, অভ্যন্তরীণ পরীক্ষায় এই সিস্টেমটি ৯৯ শতাংশ নির্ভুলতার সাথে AI-সহায়তা প্রাপ্ত লেখা শনাক্ত করেছে।

API থেকে ব্রাউজার: প্রযুক্তিটি কোথায় পৌঁছাবে

Pangram নিজেকে একটি একক-উদ্দেশ্য অ্যাপের পরিবর্তে একটি ইনফ্রাস্ট্রাকচার হিসেবে উপস্থাপন করছে। এর API ইতিমধ্যেই Substack-এর সাথে যুক্ত হয়েছে, যেখানে নিউজলেটারগুলো AI-জেনারেটেড কন্টেন্টের অনুপাত নির্দেশকারী একটি লেবেল প্রদর্শন করে। প্রাথমিক ব্যবহারকারীদের মধ্যে রয়েছে প্রশ্নোত্তর প্ল্যাটফর্ম Quora, বেশ কিছু বিশ্ববিদ্যালয়ের রাইটিং সেন্টার এবং রিক্রুটমেন্ট এজেন্সি যারা প্রার্থীদের জমা দেওয়া কাজের মৌলিকতা যাচাই করতে চায়।

ব্যক্তিগত ব্যবহারকারীদের জন্য, স্টার্টআপটি একটি Chrome extension অফার করে যা X, LinkedIn, Reddit এবং Medium-এর মতো সাইটগুলোতে একটি “feed health score” প্রদর্শন করে। এই স্কোরটি টেক্সটের কত শতাংশ মানুষের তৈরি এবং কত শতাংশ AI-এর তৈরি বলে মডেলটি মনে করে তার একটি বিভাজন দেখায়। গ্রাহকরা রিয়েল-টাইম লেবেলিং এবং সন্দেহজনক অংশগুলো আরও পর্যালোচনার জন্য ফ্ল্যাগ করার সুবিধার জন্য মাসে ২০ ডলার প্রদান করেন।

একটি সংশয়বাদী দৃষ্টিভঙ্গি

নির্ভুলতার দাবিগুলো অনিবার্যভাবে সূক্ষ্ম পর্যবেক্ষণের মুখে পড়ে। “ধূসর অঞ্চলে” (gray area)—যেখানে একজন লেখক একটি মডেল দ্বারা তৈরি খসড়া সম্পাদনা করেন—সেখানে AI সহায়তা শনাক্ত করা একটি কঠিন কাজ। জেনারেটিভ মডেলগুলো উন্নত হওয়ার সাথে সাথে, Pangram যে শৈলীগত পার্থক্যের ওপর নির্ভর করে তা কমে আসতে পারে, যা শনাক্তকরণ এবং এড়ানোর কৌশলের মধ্যে একটি অস্ত্র প্রতিযোগিতা (arms race) শুরু করতে পারে। সমালোচকরা 'ফলস পজিটিভ' (false positives) সম্পর্কেও সতর্ক করেছেন: একটি বৈধ মানুষের লেখা piece-কে AI-জেনারেটেড হিসেবে চিহ্নিত করা মানুষের সুনাম নষ্ট করতে পারে, বিশেষ করে একাডেমিক বা আইনি প্রেক্ষাপটে যেখানে ঝুঁকি অনেক বেশি।

Pangram এই চ্যালেঞ্জটি স্বীকার করে এবং উল্লেখ করে যে নতুন LLM আসার সাথে সাথে তারা ক্রমাগত নতুন সিন্থেটিক মিরর ব্যবহার করে তাদের মডেলকে পুনরায় প্রশিক্ষণ দিচ্ছে। তবে, কোম্পানিটি তাদের অভ্যন্তরীণ পরীক্ষার বাইরে কোনো স্বতন্ত্র বেঞ্চমার্ক ফলাফল প্রকাশ করেনি, ফলে বৃহত্তর সম্প্রদায়কে ৯৯ শতাংশের এই পরিসংখ্যানটি যাচাই করতে হবে।

যা নজরদারিতে রাখতে হবে

আগামী কয়েক মাস প্রকাশ করবে যে Pangram পাইলট ইন্টিগ্রেশনের বাইরে বৃহত্তর প্ল্যাটফর্ম গ্রহণের দিকে এগোতে পারে কি না। মূল সূচকগুলোর মধ্যে রয়েছে:

  • API চুক্তির সম্প্রসারণ বর্তমান প্রাথমিক অংশীদারদের তালিকার বাইরে।
  • প্রাতিষ্ঠানিক ব্যবহারকারীদের প্রতিক্রিয়া ফলস-পজিটিভ রেট এবং এডিটোরিয়াল ওয়ার্কফ্লোতে এর প্রভাব সম্পর্কে।
  • LLM ডেভেলপারদের প্রতিক্রিয়া, যারা মানুষের শৈলী আরও ঘনিষ্ঠভাবে অনুকরণ করার লক্ষ্যে মডেল আপডেট নিয়ে আসতে পারেন।
  • নিয়ন্ত্রক উন্নয়ন (Regulatory developments) যা নির্দিষ্ট প্রকাশনা বা একাডেমিক সাবমিশনের জন্য AI-ডিটেকশন টুল বাধ্যতামূলক করতে পারে।

যদি স্টার্টআপটি কম ত্রুটির হার বজায় রেখে তাদের শনাক্তকরণ ক্ষমতা ধরে রাখতে পারে, তবে এটি ডিজিটাল সত্যতা যাচাইয়ের একটি ডি-ফ্যাক্টো স্ট্যান্ডার্ড (de-facto standard) হয়ে উঠতে পারে। যদি না পারে, তবে বাজারটি বিভিন্ন প্রতিযোগিতামূলক টুলের একটি মিশ্রণে বিভক্ত হয়ে যেতে পারে, যার প্রতিটির নিজস্ব সীমাবদ্ধতা থাকবে।

মূল কথা

Pangram-এর ৯ মিলিয়ন ডলারের বিনিয়োগ এমন একটি শনাক্তকরণ কৌশলকে ত্বরান্বিত করছে, যা প্রায় নিখুঁতভাবে এআই-এর সহায়তা শনাক্ত করার লক্ষ্যে একটি 'টুইন-ডকুমেন্ট' (twin-document) প্রশিক্ষণ পদ্ধতির ওপর ভিত্তি করে কাজ করে। এর সাফল্য নির্ভর করবে এই পদ্ধতিটি বিবর্তনশীল ল্যাঙ্গুয়েজ মডেলগুলোর ক্ষেত্রে কতটা কার্যকরভাবে সম্প্রসারণ করা সম্ভব এবং সেইসব প্ল্যাটফর্ম ও প্রতিষ্ঠানগুলোর আস্থা অর্জন করতে পারে কি না, যাদের এটি সবচেয়ে বেশি প্রয়োজন।