जब से ChatGPT एक जाना-पहचाना नाम बन गया है, AI डिटेक्टरों के इर्द-गिर्द एक मिथक बन गया है। लोग उन्हें ChatGPT के पदचिह्नों को सूंघने वाले डिजिटल शिकारी कुत्तों (bloodhounds) के रूप में देखते हैं। सच्चाई इससे कहीं कम नाटकीय है। ये उपकरण किसी ऐसे गुप्त डेटाबेस से जानकारी नहीं निकालते जिसमें वह सब कुछ हो जो एक LLM ने कभी लिखा है। उनका आपके ब्राउज़र इतिहास से कोई सीधा संबंध नहीं है। वे वास्तव में क्या करते हैं कि आपके टेक्स्ट को सांख्यिकीय मॉडल (statistical models) के माध्यम से चलाते हैं और उन गणितीय संकेतों की तलाश करते हैं जो मशीन द्वारा निर्मित गद्य (prose) के साथ मेल खाते हैं। उन संकेतों को समझना आपको उनके परिणामों की बुद्धिमानी से व्याख्या करने में मदद करता है, और यह आपको किसी प्रतिशत स्कोर पर अंधविश्वास करने से बचाता है।
ये उपकरण वास्तव में कैसे काम करते हैं
अपने मूल रूप में, AI डिटेक्टर संभावना (probability) पर आधारित पैटर्न-मैचिंग इंजन हैं। लार्ज लैंग्वेज मॉडल (LLM) एक के बाद एक वाक्य लिखते हुए, अगले सबसे संभावित टोकन (token) का अनुमान लगाकर काम करते हैं। हजारों शब्दों के दौरान, यह आदत एक सांख्यिकीय अवशेष (statistical residue) छोड़ देती है। डिटेक्टर उसी अवशेष को मापने की कोशिश करते हैं।
इसे हस्तलेखन विश्लेषण (handwriting analysis) की तरह समझें। एक विशेषज्ञ आपके "g" की तुलना अब तक लिखे गए हर "g" के मास्टर डेटाबेस से नहीं करता है। इसके बजाय, वे लय, झुकाव, दबाव और अंतराल को देखते हैं। डिटेक्टर टेक्स्ट पर इसी तरह का तर्क लागू करते हैं। वे जांचते हैं कि भाषा कितनी पूर्वानुमानित (predictable) है, संरचना कितनी एकसमान रहती है, और क्या शब्दावली कृत्रिम लेखन में सामान्य संकीर्ण सांख्यिकीय दायरे में फिट बैठती है।
चूंकि प्रत्येक डिटेक्टर प्रदाता अपने मॉडल को अलग-अलग कॉर्पोरा (corpora) पर प्रशिक्षित करता है और अपनी संवेदनशीलता को अलग तरह से ट्यून करता है, इसलिए एक ही पैराग्राफ एक प्लेटफॉर्म पर 12 प्रतिशत और दूसरे पर 87 प्रतिशत स्कोर कर सकता है। "AI-पन" (AI-ness) के लिए कोई सार्वभौमिक मानक नहीं है। प्रत्येक उपकरण अनिवार्य रूप से गणित के रूप में व्यक्त की गई एक राय है।
वे चार संकेत जिन्हें डिटेक्टर खोजते हैं
अधिकांश डिटेक्शन प्लेटफॉर्म कुछ विशिष्ट संकेतों की तलाश करते हैं। यह जानना कि वे क्या हैं, बहुत सारी भ्रम की स्थिति को स्पष्ट कर देता है।
पूर्वानुमानयोग्यता (Predictability) मानवीय भाषा अनिश्चित होती है। किसी कैफे का वर्णन करने वाला व्यक्ति एस्प्रेसो की जली हुई गंध का उल्लेख कर सकता है, फिर अपनी दादी की रसोई की याद में खो सकता है, और फिर दागदार फर्श की ओर वापस आ सकता है। एक AI उच्चतम संभावना वाले पथ का अनुसरण करने की प्रवृत्ति रखता है। यह उन शब्दों का चयन करता है जिन्हें उसके प्रशिक्षण डेटा ने सबसे सुरक्षित और सबसे अपेक्षित माना है। डिटेक्टर इसे 'परप्लेक्सिटी' (perplexity) जैसे प्रॉक्सी के माध्यम से मापते हैं। यदि आपका टेक्स्ट डिटेक्टर के अपने आंतरिक लैंग्वेज मॉडल को शायद ही कभी चौंकाता है, तो टूल AI की संलिप्तता का संदेह करता है। गद्य जितना अधिक पूर्वानुमानित होगा, फ्लैग उतना ही ऊंचा होगा।
वाक्यों में विविधता (Sentence variation) बिना एडिट किए गए AI आउटपुट के एक हजार शब्द जोर से पढ़ें, और आप एक मेट्रोनोम प्रभाव (metronome effect) देख सकते हैं। वाक्य अक्सर समान शब्द-गणना सीमा में होते हैं, जो आमतौर पर संयोजक (conjunctions) द्वारा जुड़े संयुक्त संरचनाएं होती हैं। मानव लेखक पन्ने पर अलग तरह से सांस लेते हैं। वे खंडित वाक्य (fragments) लिखते हैं। वे एक लंबे, घुमावदार वाक्य के बाद एक छोटे वाक्य का प्रहार करते हैं। वे प्रश्न पूछते हैं। वे जानबूझकर लय तोड़ते हैं। डिटेक्टर इसी अनियमितता की तलाश करते हैं, जिसे अक्सर "बर्स्टिनेस" (burstiness) कहा जाता है। सुचारू, एकसमान लय सांख्यिकीय लगती है। झटकेदार, असमान लय मानवीय लगती है।
स्वर और दृष्टिकोण की निरंतरता (Consistency of tone and perspective) AI आउटपुट पहले वाक्य से लेकर अंतिम वाक्य तक एक ही रजिस्टर (register) में रहने की प्रवृत्ति रखता है। यदि यह औपचारिक तीसरे व्यक्ति (third-person) की आवाज में शुरू होता है, तो यह आम तौर पर वहीं रहता है। इंसान भटकते हैं। वे एक पेशेवर अवलोकन के साथ शुरू करते हैं, फिर एक व्यक्तिगत किस्सा याद करते हैं, फिर एक मजाक करते हैं, और फिर से गंभीर हो जाते हैं। वे बीच में टिप्पणियां करते हैं, शब्दावली बदलते हैं, या विचार करने पर किसी पिछले बिंदु का खंडन करते हैं। वर्तमान लैंग्वेज मॉडल के लिए लंबे अनुच्छेदों में इस तरह के स्वर के उतार-चढ़ाव को विश्वसनीय रूप से दोहराना कठिन है। डिटेक्टर इस असंगति को कीबोर्ड के पीछे एक वास्तविक व्यक्ति के प्रमाण के रूप में देखते हैं।
शब्दों का चयन और रजिस्टर (Word choice and register) कृत्रिम लेखन आमतौर पर एक अजीब तरह से औपचारिक मध्य मार्ग में रहता है। यह विशिष्ट स्लैंग, क्षेत्रीय मुहावरों या उद्योग की संक्षिप्त शब्दावली के बजाय सामान्य अमूर्त संज्ञाओं (abstract nouns) और व्यापक रूप से उपयोग किए जाने वाले क्रियाओं को प्राथमिकता देता है। एक मानव प्रोग्रामर लिख सकता है कि उन्होंने "एक स्क्रिप्ट को जल्दी से तैयार किया" (hacked together a script) या "बिल्ड पाइपलाइन के साथ संघर्ष किया।" एक AI अधिक संभावना के साथ कहेगा कि उन्होंने "एक समाधान विकसित किया" या "डिप्लॉयमेंट समस्या का समाधान किया।" डिटेक्टर तब ध्यान देते हैं जब टेक्स्ट एक संकीर्ण, उच्च-आवृत्ति वाली शब्दावली सीमा के भीतर रहता है और शायद ही कभी किसी असामान्य वाक्यांश या जानबूझकर किए गए व्याकरणिक मोड़ का जोखिम उठाता है।
विभिन्न प्लेटफॉर्म पर आपका स्कोर क्यों बदल जाता है
यदि आप एक ही निबंध को तीन अलग-अलग डिटेक्टरों में पेस्ट करते हैं, तो आपको तीन असंगत निर्णय मिल सकते हैं। ऐसा इसलिए होता है क्योंकि अंतर्निहित मशीनरी सार्थक तरीकों से भिन्न होती है।
कुछ टूल्स को मुख्य रूप से पुराने GPT-3.5 आउटपुट पर प्रशिक्षित किया गया है। अन्य नए GPT-4 जनरेशन को शामिल करते हैं या कई मॉडलों के सिंथेटिक टेक्स्ट का मिश्रण करते हैं। उनके फीचर वेटिंग (feature weightings) भी अलग-अलग होते हैं। एक प्लेटफॉर्म वाक्य की लंबाई की एकरूपता (sentence-length uniformity) को अधिक महत्व दे सकता है, जबकि दूसरा परप्लेक्सिटी (perplexity) को प्राथमिकता देता है। थ्रेशोल्ड (Thresholds) मनमाने आंतरिक विकल्प हैं। एक विक्रेता 60 प्रतिशत से अधिक आत्मविश्वास को "संभावित AI" के रूप में लेबल कर सकता है, जबकि एक प्रतिस्पर्धी उस लेबल को 90 प्रतिशत के लिए सुरक्षित रखता है।
इन टूल्स को प्रमाणित करने वाली कोई नियामक संस्था (governing body) नहीं है। ये प्रयोगात्मक उपकरण हैं जिन्हें निश्चितता के आवरण में बेचा जाता है। उनके फैसलों को कानूनी सबूत या शैक्षणिक दंड के आधार के रूप में मानना वैसा ही है जैसे पूरे सीजन की फसल की पैदावार का पूर्वानुमान लगाने के लिए एक हैंडहेल्ड वेदर स्टेशन का उपयोग करना।
फॉल्स पॉजिटिव की समस्या
क्योंकि डिटेक्टर सीधे प्रमाण के बजाय सांख्यिकीय सहसंबंध (statistical correlation) पर निर्भर करते हैं, वे नियमित रूप से मानवीय लेखन को सिंथेटिक के रूप में गलत पहचान लेते हैं। वैध गद्य (prose) की कई श्रेणियां विशेष रूप से इसके प्रति संवेदनशील हैं।
शैक्षणिक पेपर कठोर परंपराओं का पालन करते हैं। पैसिव वॉइस (passive voice), हेजिंग वाक्यांश (hedging phrases), और मानकीकृत अनुभाग शीर्षक एक अत्यधिक नियमित सांख्यिकीय प्रोफाइल बनाते हैं जो AI मॉडलों के ट्रेनिंग डेटा की नकल करता है। तकनीकी मैनुअल को भी इसी समस्या का सामना करना पड़ता है। वे सुसंगत शब्दावली, छोटे घोषणात्मक वाक्यों और न्यूनतम भावनात्मक भिन्नता का उपयोग करते हैं, जो सभी पैटर्न-आधारित संदेह को जन्म देते हैं। कानूनी दस्तावेज़ अनिवार्य रूप से संरचित टेम्पलेट होते हैं, और उनकी दोहराव वाली सटीकता एक क्लासिफायर (classifier) को एल्गोरिदम जैसी लगती है।
गैर-देशी अंग्रेजी बोलने वाले अक्सर ऐसा लेखन करते हैं जो व्याकरणिक रूप से सही होता है लेकिन वाक्य संरचना (syntax) में सरल होता है। उनका सावधानीपूर्वक किया गया निर्माण—ठीक इसलिए क्योंकि यह एक देशी वक्ता की मुहावरेदार उथल-पुथल (idiomatic chaos) से बचता है—मशीनी टेक्स्ट के समान ही सांख्यिकीय क्षेत्र में आ सकता है। एक छात्र जिसने निबंध तैयार करने में घंटों मेहनत की है, उस पर गलत आरोप लगाया जा सकता है क्योंकि उसके अनुशासित, स्पष्ट वाक्य डिटेक्टर को बहुत अधिक व्यवस्थित लगते हैं।
डिटेक्टरों का उपयोग करें, लेकिन उन्हें खुद का उपयोग न करने दें
इन टूल्स के साथ जुड़ने का सबसे स्वस्थ तरीका उन्हें जूरी के फैसले के बजाय एक 'फर्स्ट-पास फिल्टर' के रूप में मानना है। यदि आप एक संपादक, शिक्षक या हायरिंग मैनेजर हैं, तो उच्च स्कोर को आरोप के बजाय बातचीत का संकेत बनने दें। लेखक से उनकी प्रक्रिया के बारे में पूछें। आउटलाइन या रफ ड्राफ्ट मांगें। गद्य के पीछे के मूल विचार को खोजें।
यदि आप एक लेखक हैं, तो डिटेक्टर को चकमा देने के लिए अपने काम को ऑप्टिमाइज़ न करें। जिस क्षण आप "अधिक मानवीय" दिखने के लिए यादृच्छिक टाइपो (typos) डालना, वाक्यों को कृत्रिम रूप से काटना, या सटीक शब्दों को अजीब पर्यायवाची शब्दों से बदलना शुरू करते हैं, आप स्पष्टता का बलिदान करके व्याकुलता (paranoia) को चुन लेते हैं। अब आप पाठक के लिए नहीं लिख रहे हैं। आप एक एल्गोरिदम के लिए प्रदर्शन कर रहे हैं।
वैसे लिखें जैसे आप सोचते हैं। अपनी लय (rhythm) को स्वाभाविक रूप से बदलें। अपने क्षेत्र की विशिष्ट शब्दावली का उपयोग करें। ऐसे अवलोकन शामिल करें जो केवल आप ही कर सकते हैं। वह बनावट (texture) किसी भी डिटेक्टर के खिलाफ आपका सबसे अच्छा बचाव है, और इससे भी महत्वपूर्ण बात यह है कि यही आपके लेखन को पढ़ने योग्य बनाता है।
वास्तविक निष्कर्ष
AI डिटेक्टर विश्लेषणात्मक साइडकार (analytical sidecars) हैं, ड्राइवर नहीं। वे सुझाव दे सकते हैं कि टेक्स्ट सांख्यिकीय रूप से सुचारू (smooth) दिखता है, लेकिन वे अंतर्दृष्टि, रचनात्मकता या जीवंत अनुभव को नहीं माप सकते। एक आत्मविश्वासपूर्ण स्कोर आपको यह नहीं बता सकता कि कोई तर्क मौलिक है, कोई कहानी सच है, या कोई तकनीकी स्पष्टीकरण सटीक है।
स्पष्टता पर ध्यान दें। स्क्रीन के दूसरी ओर मौजूद इंसान को प्राथमिकता दें। मौलिक विचारों में एक ऐसी बनावट होती है जिसे कोई भी क्लासिफायर पूरी तरह से नहीं पकड़ सकता, और कोई भी प्रतिशत कभी भी एक सतर्क पाठक के निर्णय की जगह नहीं ले पाएगा।
