स्टॅनफोर्ड AI माजी विद्यार्थी मॅक्स स्पेरो आणि ब्रॅडली एमी यांनी स्थापन केलेली न्यूयॉर्कमधील स्टार्टअप कंपनी Pangram ने Menlo Ventures च्या नेतृत्वाखाली $9 दशलक्षचा Series A राउंड पूर्ण केला आहे. या निधीचा वापर प्लॅटफॉर्मसाठी API आणि $20 प्रति महिना खर्च असलेले Chrome extension विकसित करण्यासाठी केला जाईल, जे 99 टक्के अचूकतेसह AI-सहाय्यित मजकूर ओळखण्याचा दावा करते—हा असा दावा आहे जो पत्रकार, विद्वान आणि भरती करणारे (recruiters) सत्यता कशी पडताळतात यामध्ये आमूलाग्र बदल घडवून आणू शकतो.
AI-द्वारे तयार होणाऱ्या “slop” (कचरा मजकूर) मध्ये झालेली वाढ
Large language models आता मोठ्या प्रमाणावर लेख, सोशल-मीडिया पोस्ट आणि अगदी कायदेशीर संदर्भ (legal citations) देखील तयार करत आहेत. परिणामी: कमी दर्जाचा SEO स्पॅम, समन्वित चुकीची माहिती पसरवण्याचे मोहिमा (disinformation campaigns) आणि एक 'ग्रे झोन' निर्माण झाला आहे जिथे मानवी लेखक AI-द्वारे तयार केलेल्या मसुद्यांना अधिक चांगले बनवतात. संस्थांनी यावर प्रतिक्रिया द्यायला सुरुवात केली आहे. pre-print सर्व्हर arXiv ने इशारा दिला आहे की, जे लेखक अनपेक्षित LLM आउटपुट सादर करतात त्यांना वर्षभरासाठी बंदी येऊ शकते, आणि ज्या वकिलांनी AI द्वारे तयार केलेले बनावट संदर्भ वापरले आहेत त्यांना न्यायालये दंड आकारू लागली आहेत. मानवी आणि मशीन आउटपुटमधील फरक ओळखण्याचा दबाव वाढत आहे आणि Pangram चा असा विश्वास आहे की त्यांचे तंत्रज्ञान हे पडताळणीचे (verification) मुख्य साधन बनू शकते.
Synthetic mirroring: प्रत्येक दस्तऐवजाच्या 'ट्विन'वर आधारित प्रशिक्षण
Pangram चे प्रमुख मॉडेल, Pangram 4, एका पद्धतीचा वापर करते ज्याला कंपनी “synthetic mirroring” म्हणते. त्यांच्या ट्रेनिंग सेटमधील प्रत्येक मानवी-लिखित दस्तऐवजासाठी—ज्यामध्ये करोडो पडताळलेले लेख आहेत—त्या टीमने एका frontier LLM वर त्याचा एक प्रतिरूप (counterpart) तयार केला. हे synthetic twin विषयानुसार, लांबीनुसार आणि स्वराप्रमाणे (tone) मूळ दस्तऐवजाशी जुळते, परंतु ते AI द्वारे तयार केलेले असते. दोन्ही आवृत्त्या एकाच neural net मध्ये फीड करून, Pangram मॉडेलला ते सूक्ष्म सांख्यिकीय ठसे (statistical fingerprints) ओळखण्यास शिकवते जे AI-द्वारे तयार केलेल्या मजकुरात कायम राहतात, अगदी जेव्हा लेखक मशीन आउटपुट लपवण्यासाठी “AI humanizer” टूल्सचा वापर करतात तेव्हाही.
स्पर्धक मेटाडेटा किंवा अदृश्य वॉटरमार्क्सवर अवलंबून असतात, जे काढून टाकले जाऊ शकतात किंवा दुर्लक्षित केले जाऊ शकतात. त्याऐवजी Pangram शैलीगत विश्लेषणावर (stylistic analysis) लक्ष केंद्रित करते: शब्द निवड, वाक्यांची लय आणि token distribution मधील असे नमुने जे मॉडेलच्या आउटपुटमध्ये सुसंगत राहतात. कंपनीच्या प्रसिद्धीपत्रकानुसार, अंतर्गत चाचण्यांमध्ये या प्रणालीने 99 टक्के अचूकतेसह AI-सहाय्यित लेखन ओळखले आहे.
APIs पासून ब्राउझर्सपर्यंत: हे तंत्रज्ञान कुठे पोहोचणार आहे
Pangram स्वतःला केवळ एका विशिष्ट कामासाठी वापरल्या जाणाऱ्या ॲपऐवजी एक पायाभूत सुविधा (infrastructure) म्हणून सादर करते. त्याचे API आधीच Substack सोबत जोडले गेले आहे, जिथे न्यूजलेटर्समध्ये AI-द्वारे तयार केलेल्या मजकुराचे प्रमाण दर्शवणारा लेबल दिसतो. सुरुवातीच्या वापरकर्त्यांमध्ये Q&A प्लॅटफॉर्म Quora, अनेक विद्यापीठांचे रायटिंग सेंटर्स आणि उमेदवारांच्या अर्जांची मूळता पडताळण्याची गरज असलेल्या रिक्रूटमेंट एजन्सींचा समावेश आहे.
वैयक्तिक वापरकर्त्यांसाठी, ही स्टार्टअप कंपनी एक Chrome extension देते जे X, LinkedIn, Reddit आणि Medium सारख्या साइट्सवर “feed health score” प्रदर्शित करते. हा स्कोअर मजकुराचा किती टक्के भाग मानवी आहे आणि किती AI द्वारे तयार केलेला आहे, याचे विश्लेषण करतो. सबस्क्रायबर्स रिअल-टाइम लेबलिंग आणि संशयास्पद उतारे पुढील पुनरावलोकनासाठी फ्लॅग करण्याच्या सुविधेसाठी दरमहा $20 देतात.
संशयात्मक दृष्टिकोन
अचूकतेचे दावे आपोआपच तपासणीच्या कक्षेत येतात. “ग्रे एरिया” मध्ये—जिथे लेखक मॉडेलने तयार केलेल्या मसुद्याचे संपादन करतो—AI सहाय्य शोधणे हे एक आव्हानात्मक काम आहे. जसे जनरेटिव्ह मॉडेल्स सुधारतील, तसे Pangram ज्या शैलीगत फरकावर अवलंबून आहे ते अंतर कमी होऊ शकते, ज्यामुळे शोध तंत्र (detection) आणि ते टाळण्याच्या तंत्रांमध्ये (evasion techniques) एक स्पर्धा निर्माण होऊ शकते. टीकाकार 'फॉल्स पॉझिटिव्ह' (false positives) बद्दलही सावध करतात: एखादा अस्सल मानवी लेख AI-द्वारे तयार केलेला म्हणून लेबल केल्यास प्रतिष्ठा मलीन होऊ शकते, विशेषतः शैक्षणिक किंवा कायदेशीर संदर्भात जिथे जोखीम जास्त असते.
Pangram या आव्हानाची दखल घेते आणि नमूद करते की, नवीन LLMs उपलब्ध होताच ते त्यांच्या मॉडेलला नवीन synthetic mirrors वर सतत प्रशिक्षित करत राहतात. तथापि, कंपनीने त्यांच्या अंतर्गत चाचण्यांव्यतिरिक्त कोणतेही स्वतंत्र बेंचमार्क निकाल जाहीर केलेले नाहीत, ज्यामुळे 99 टक्के आकडा पडताळण्याचे काम व्यापक समुदायावर सोपवले आहे.
काय पाहावे
पुढील काही महिने हे स्पष्ट करतील की Pangram पायलट इंटिग्रेशनच्या पलीकडे जाऊन व्यापक प्लॅटफॉर्म स्वीकृतीपर्यंत पोहोचू शकेल का. मुख्य निर्देशक खालीलप्रमाणे आहेत:
- API करारांचा विस्तार सध्याच्या सुरुवातीच्या भागीदारांच्या यादीच्या पलीकडे.
- संस्थात्मक वापरकर्त्यांकडून मिळणारा फीडबॅक, फॉल्स-पॉझिटिव्ह दर आणि संपादकीय कार्यप्रणालीवरील प्रभावाबाबत.
- LLM डेव्हलपर्सच्या प्रतिक्रिया, जे मानवी शैलीची अधिक जवळून नक्कल करण्याच्या उद्देशाने मॉडेल अपडेट्स आणू शकतात.
- नियामक घडामोडी (Regulatory developments), ज्यामुळे काही प्रकाशने किंवा शैक्षणिक सबमिशनसाठी AI-डिटेक्शन टूल्स अनिवार्य होऊ शकतात.
जर या स्टार्टअपने कमी त्रुटी दर राखून आपली शोध घेण्याची क्षमता टिकवून ठेवली, तर ते डिजिटल सत्यतेसाठी एक 'डी-फॅक्टो' (de-facto) मानक बनू शकते. अन्यथा, बाजारपेठ विविध स्पर्धात्मक साधनांमध्ये विभागली जाऊ शकते, ज्यामध्ये प्रत्येकाचे स्वतःचे फायदे आणि तोटे असतील.
सारांश
Pangram कडून मिळालेली ९ दशलक्ष डॉलर्सची गुंतवणूक अशा शोध घेण्याच्या रणनीतीला बळ देत आहे, जी जवळजवळ अचूक एआय-साहाय्य (AI-assistance) ओळखण्यासाठी 'ट्विन-डॉक्युमेंट' प्रशिक्षण पद्धतीचा आधार घेते. याचे यश यावर अवलंबून असेल की, ही पद्धत विकसित होत असलेल्या भाषा मॉडेल्समध्ये (language models) किती प्रभावीपणे विस्तारते आणि ज्या प्लॅटफॉर्म्स व संस्थांना याची सर्वाधिक गरज आहे, त्यांचा विश्वास संपादन करू शकते का.
