AI शोधकर्ताओं ने लगभग 150 कम-ट्रैफ़िक वाली समाचार साइटों के एक नेटवर्क द्वारा बड़े भाषा मॉडल (LLM) के प्रशिक्षण डेटा में प्रो-क्रेमलिन विमर्श (narratives) को भरने के एक समन्वित प्रयास का खुलासा किया है। 'प्रवदा नेटवर्क' (Pravda network) के रूप में सामूहिक रूप से जाने जाने वाले ये साइटें सालाना लगभग तीस लाख लेख प्रकाशित करती हैं, और उनकी सामग्री अब Common Crawl डेटासेट में दिखाई देती है जो कई व्यावसायिक AI प्रणालियों को शक्ति प्रदान करता है।
दुष्प्रचार पाइपलाइन (disinformation pipeline) कैसे काम करती है
Pravda नेटवर्क का लक्ष्य मानव पाठकों को आकर्षित करना नहीं है। इसके बजाय, प्रत्येक साइट बार-बार एक ही तरह के लेख प्रकाशित करती है जो सीमित तर्कों (talking points) को दोहराते हैं। उन कीवर्ड्स से टेक्स्ट को भरकर जिन्हें सर्च इंजन और वेब क्रॉलर प्राथमिकता देते हैं, ये साइटें इस बात की संभावना बढ़ा देती हैं कि डेटा संग्रह के दौरान एक AI मॉडल का सामना उनसे हो जाए।
दो विषाक्तता तंत्र (poisoning mechanisms) काम कर रहे हैं:
- Retrieval-time poisoning – जब कोई AI सहायक वेब से लाइव जानकारी निकालता है, तो यह वैध स्रोतों के साथ एक Pravda लेख भी सामने ला सकता है। ज्ञात दुर्भावनापूर्ण डोमेन को ब्लॉक करने से इस जोखिम को कम किया जा सकता है।
- Training-time poisoning – यदि ये लेख मॉडल को प्री-ट्रेन करने के लिए उपयोग किए जाने वाले बड़े कॉर्पोरा (bulk corpora) में शामिल हो जाते हैं, तो झूठे दावे मॉडल के आंतरिक ज्ञान का हिस्सा बन जाते हैं। बाद में ऐसी सामग्री को हटाना कहीं अधिक कठिन होता है।
शोधकर्ताओं ने Common Crawl के भीतर Pravda लेखों का पता लगा लिया है, जो कई AI मॉडल को प्रशिक्षित करने के लिए उपयोग किया जाने वाला एक सार्वजनिक संग्रह है। इसका मतलब है कि यह विषाक्तता केवल काल्पनिक नहीं है; इसने उन मॉडलों के ज्ञान आधार (knowledge base) को पहले ही बदल दिया है जिन पर आज कई उपयोगकर्ता भरोसा करते हैं।
यह क्यों महत्वपूर्ण है
केवल इसलिए AI पर भरोसा न करें क्योंकि वह कहता है कि "कई स्रोत सहमत हैं।" यदि आप AI टूल बनाते हैं, तो ज्ञात दुष्प्रचार साइटों के लिए ब्लॉकलिस्ट का उपयोग करें। सत्य को मापने के तरीके के रूप में "उल्लेखों की संख्या" (number of mentions) का उपयोग न करें। मात्रा का अर्थ गुणवत्ता नहीं होता। AI आपको जो कुछ भी बताता है, उसकी पुष्टि करें, खासकर यदि वह पक्षपाती लगे।
इंटरनेट हमारी भविष्य की तकनीक के लिए प्रशिक्षण सेट (training set) है। जिसके पास भी वेबसाइट है, वह उन मशीनों को पक्षपाती बनाने की कोशिश कर सकता है जिन पर हम भरोसा करते हैं।
डेवलपर्स अभी क्या कर सकते हैं
- ब्लॉकलिस्ट बनाए रखें – क्रॉलिंग फिल्टर में ज्ञात दुष्प्रचार डोमेन जोड़ें; एक ब्लॉकलिस्ट रिट्रीवल-टाइम और ट्रेनिंग-टाइम दोनों तरह के जोखिमों को रोकती है।
- फ्रीक्वेंसी ह्यूरिस्टिक्स (frequency heuristics) पर पुनर्विचार करें – उल्लेखों की संख्या को सत्यता के बराबर मानना बंद करें। एक दावा जो दर्जनों निम्न-गुणवत्ता वाली साइटों पर दोहराया जाता है, वह एक सरल फ्रीक्वेंसी-आधारित मॉडल में एक प्रतिष्ठित स्रोत को पीछे छोड़ सकता है।
- प्रोवेनेंस चेक (provenance checks) लागू करें – जानकारी को उसके मूल स्रोत तक ट्रैक करें। यदि श्रृंखला का अंत किसी ऐसी साइट पर होता है जिसका ट्रैफ़िक नगण्य है और जिसका इतिहास दुष्प्रचार का रहा है, तो समीक्षा के लिए आउटपुट को फ्लैग करें।
- पोस्ट-ट्रेनिंग सैनिटाइजेशन (post-training sanitization) लागू करें – राजनीतिक रूप से संवेदनशील विषयों को छूने वाले मॉडल आउटपुट पर क्यूरेटेड ऑडिट चलाएं। मानव समीक्षक उस व्यवस्थित पूर्वाग्रह को पकड़ सकते हैं जिसे स्वचालित फ़िल्टर छोड़ देते हैं।
प्रति-तर्क और चुनौतियाँ
सुरक्षा और समावेशिता के बीच संतुलन बनाए रखना एक अनसुलझी समस्या बनी हुई है।
भविष्य की ओर देखते हुए
Pravda नेटवर्क दिखाता है कि कैसे राज्य अभिनेता (state actors) AI की अगली पीढ़ी को आकार देने के लिए खुले वेब को हथियार बना सकते हैं।
मुख्य बात (Takeaway): AI की अखंडता उस डेटा की स्वच्छता पर टिकी है जिससे वह सीखता है। कम-ट्रैफ़िक वाली, दुष्प्रचार से भरी साइटों का समन्वित प्रवाह पहले से ही उन मॉडलों में झूठ को शामिल कर सकता है जिन पर हम भरोसा करते हैं। डेवलपर्स को स्रोत की प्रतिष्ठा को एक प्राथमिक चिंता के रूप में मानना चाहिए, न कि बाद के विचार के रूप में, ताकि हमारे द्वारा बनाई गई मशीनें अनजाने में दुष्प्रचार के मुखपत्र न बन जाएं।
