Anthropic ने अपने Fable 5 मॉडल में एक महत्वपूर्ण अपडेट लागू किया है, जिससे इसके सुरक्षा स्तरों (safety layers) द्वारा ब्लॉक किए जाने वाले हानिरहित जैविक प्रश्नों (benign biological queries) की संख्या में भारी कमी आई है। इस रणनीतिक समायोजन का उद्देश्य उच्च-जोखिम वाले जैविक खतरों के खिलाफ सख्त सुरक्षा उपायों को बनाए रखते हुए वैध वैज्ञानिक अनुसंधान के लिए उपयोगिता को बहाल करना है।

वैज्ञानिक अनुसंधान के लिए बाधाओं को कम करना

वैज्ञानिक समुदाय की आलोचना से प्रेरित होकर, Anthropic ने Fable 5 के लिए अपने जीव विज्ञान सुरक्षा फिल्टरों में 'फॉल्स पॉजिटिव' (false positives) को लगभग 85 प्रतिशत तक सफलतापूर्वक कम कर दिया है। पहले, मॉडल का सुरक्षा क्लासिफायर अत्यधिक आक्रामक था, जो अक्सर वैध वैज्ञानिक पूछताछ को ब्लॉक कर देता था और उपयोगकर्ताओं को कम सक्षम Opus 5 मॉडल पर भेज देता था।

यह अपडेट शोधकर्ताओं और चिकित्सा पेशेवरों को विविध प्रकार के हानिरहित कार्यों के लिए Fable 5 की पूर्ण तर्क क्षमताओं (reasoning capabilities) का लाभ उठाने की अनुमति देता है। उपयोगकर्ता अब प्रयोगशाला परिणामों की व्याख्या करने, नैदानिक लक्षणों का विश्लेषण करने और जटिल चिकित्सा प्रश्नों के उत्तर देने जैसे जटिल कार्य बिना उस "सुरक्षा दीवार" (safety wall) से टकराए कर सकते हैं, जो पहले उत्पादकता में बाधा डालती थी।

दोहरे उपयोग (Dual-Use) के जोखिमों पर सुरक्षा घेरा बनाए रखना

सामान्य जीव विज्ञान प्रतिबंधों में ढील के बावजूद, Anthropic "दोहरे उपयोग" वाले अनुसंधान—ऐसी जानकारी जिसे नुकसान पहुँचाने के लिए पुन: उपयोग किया जा सकता है—पर सख्त रुख बनाए हुए है। कंपनी ने वायरोलॉजी, टॉक्सिकोलॉजी और उन्नत आणविक डिजाइन सहित अत्यधिक संवेदनशील विषयों पर प्रतिबंध नहीं हटाए हैं।

Anthropic का तर्क जैविक खतरों की अनूठी प्रकृति पर आधारित है। साइबर हमले के विपरीत, जिसे पैच और सिस्टम शटडाउन के माध्यम से कम किया जा सकता है, एक बार फैलने के बाद जैविक एजेंट को "बंद करना" लगभग असंभव है। कंपनी ने इस सावधानी के पीछे कई उच्च-जोखिम वाली चिंताओं का हवाला दिया है, जिनमें शामिल हैं:

  • जैविक जोखिमों के संबंध में अमेरिकी खुफिया एजेंसियों का विश्लेषण।
  • शोध जो यह दर्शाता है कि AI का उपयोग पूरी तरह से सिंथेटिक वायरस डिजाइन करने के लिए किया जा सकता है।
  • मौजूदा LLMs से जैविक हथियार के निर्देश मांगने के लिए उपयोगकर्ताओं द्वारा किए गए दस्तावेजी प्रयास।

विशेष पहुंच के साथ सुरक्षा का संतुलन

AI लैब्स के लिए चुनौती खुले वैज्ञानिक विकास और विनाशकारी दुरुपयोग को रोकने के बीच के तनाव को प्रबंधित करने की है। Anthropic इसे विशेष पहुंच कार्यक्रम (specialized access programs) विकसित करके हल करने का प्रयास कर रहा है। ये कार्यक्रम सत्यापित शोधकर्ताओं को एक नियंत्रित और ऑडिट किए गए वातावरण के भीतर प्रतिबंधित सुविधाओं—जैसे कि वायरोलॉजी या आणविक मॉडलिंग से जुड़ी सुविधाओं—तक पहुंच प्रदान करने के लिए डिज़ाइन किए गए हैं।

हानिरहित चिकित्सा पूछताछ और खतरनाक दोहरे उपयोग वाले अनुसंधान के बीच अंतर करके, Anthropic इस बात का एक उदाहरण सेट करने का प्रयास कर रहा है कि फ्रंटियर मॉडल "जैविक सीमा" (biological frontier) को कैसे संभालते हैं, यह सुनिश्चित करते हुए कि आधुनिक चिकित्सा के उपकरण अनजाने में जैव-आतंकवाद (bioterrorism) के उपकरण न बन जाएं।

मुख्य बातें

  • फॉल्स पॉजिटिव में 85% की कमी: Anthropic ने वैध जीव विज्ञान प्रश्नों के लिए बाधाओं को काफी कम कर दिया है, जिससे उपयोगकर्ता डाउनग्रेड किए गए Opus 5 से दूर हो गए हैं।
  • उच्च-जोखिम वाले क्षेत्रों पर सख्त सुरक्षा घेरा: जैविक हथियार बनाने को रोकने के लिए वायरोलॉजी, टॉक्सिकोलॉजी और आणविक डिजाइन के लिए सख्त प्रतिबंध लागू हैं।
  • शोधकर्ताओं के लिए नियंत्रित पहुंच: Anthropic विशिष्ट पहुंच कार्यक्रम बना रहा है ताकि जांचे-परखे वैज्ञानिकों को वैध अनुसंधान के लिए आवश्यक प्रतिबंधित क्षमताएं प्रदान की जा सकें।

Anthropic ने अपने Fable 5 मॉडल में हानिरहित जीव विज्ञान प्रश्नों पर फॉल्स-पॉजिटिव ब्लॉकों को लगभग 85 प्रतिशत तक कम कर दिया है, जिससे शोधकर्ताओं के लिए मॉडल की पूर्ण तर्क क्षमताओं तक पहुंच बहाल हो गई है। यह परिवर्तन दोहरे उपयोग वाले जैविक विषयों पर सख्त सुरक्षा उपायों को बनाए रखता है, जिससे मॉडल को ऐसे निर्देश प्रदान करने से रोका जाता है जो जैविक हथियार बनाने में सक्षम हो सकते हैं।

यह अपडेट क्यों महत्वपूर्ण है

Fable 5 के सुरक्षा स्तर को मूल रूप से सावधानी बरतने के लिए कैलिब्रेट किया गया था, जो वैध वैज्ञानिक प्रश्नों के एक बड़े हिस्से को उच्च-जोखिम के रूप में चिह्नित करता था। जो उपयोगकर्ता नियमित लैब-परिणाम व्याख्या या नैदानिक लक्षण विश्लेषण के लिए पूछते थे, उन्हें नियमित रूप से कम सक्षम Opus 5 मॉडल पर भेज दिया जाता था। अत्यधिक ब्लॉकिंग से वैज्ञानिक समुदाय की आलोचना हुई, जिसका तर्क था कि इस बाधा ने वास्तविक अनुसंधान में बाधा डाली और चिकित्सा निर्णय लेने की प्रक्रिया को धीमा कर दिया। फॉल्स-पॉजिटिव दर को लगभग चार-पांचवें हिस्से तक कम करके, Anthropic का लक्ष्य मॉडल की उन्नत तर्क क्षमता को डॉक्टरों, जीवविज्ञानियों और अन्य पेशेवरों के हाथों में वापस लाना है जिन्हें इसकी दैनिक कार्यों के लिए आवश्यकता होती है।

फिल्टर कैसे बदले गए

यह सुधार एक पुनर्गठित (retuned) क्लासिफायर से आता है जो सामान्य बायोमेडिकल प्रश्नों और उन प्रश्नों के बीच अंतर करता है जो "दोहरे उपयोग" (dual-use) वाले शोध से संबंधित हैं—ऐसी जानकारी जिसका दुरुपयोग नुकसान पहुँचाने के लिए किया जा सकता है। नया क्लासिफायर अभी भी वायरोलॉजी, टॉक्सिकोलॉजी और उन्नत मॉलिक्यूलर डिज़ाइन से जुड़े अनुरोधों को रोकता है, लेकिन यह मानक डायग्नोस्टिक्स, लक्षणों के वर्गीकरण (symptom triage) और डेटा व्याख्या से संबंधित प्रश्नों को अनुमति देता है।

Anthropic के इंजीनियरों ने उल्लेख किया कि जैविक खतरे साइबर खतरों से भिन्न होते हैं: एक बार जब कोई रोगजनक (pathogen) फैल जाता है, तो उसे पैच या बंद नहीं किया जा सकता है। इसी वास्तविकता ने उच्च-जोखिम वाले क्षेत्रों पर सख्त रुख बनाए रखने और नियमित चिकित्सा पूछताछ के दायरे को थोड़ा ढीला करने का निर्णय लेने के लिए प्रेरित किया।

क्या वर्जित बना हुआ है

मॉडल उन अनुरोधों को अस्वीकार करना जारी रखेगा जो हानिकारक एजेंटों के निर्माण में सहायता कर सकते हैं। विशेष रूप से, कोई भी प्रॉम्प्ट जो निम्नलिखित की मांग करता है:

  • विस्तृत वायरोलॉजी प्रोटोकॉल जो वायरस संश्लेषण (synthesis) में सहायता कर सकते हैं,
  • हथियार बनाने योग्य रसायनों के लिए टॉक्सिकोलॉजी मार्ग, या
  • चरण-दर-चरण मॉलिक्यूलर इंजीनियरिंग निर्देश।

Anthropic ने अपनी सावधानी के लिए तीन स्रोतों का हवाला दिया: जैविक जोखिम को उजागर करने वाली अमेरिकी खुफिया एजेंसियों के विश्लेषण, शोध जो दिखाते हैं कि AI पूरी तरह से सिंथेटिक वायरस डिज़ाइन कर सकता है, और मौजूदा लैंग्वेज मॉडल से जैविक हथियार (bioweapon) के निर्देश प्राप्त करने के लिए उपयोगकर्ताओं द्वारा किए गए दस्तावेजी प्रयास।

प्रमाणित वैज्ञानिकों के लिए एक्सेस प्रोग्राम

खुले शोध और सुरक्षा के बीच संतुलन बनाने के लिए, Anthropic एक विशेष एक्सेस प्रोग्राम शुरू कर रहा है। सत्यापित शोधकर्ता एक नियंत्रित वातावरण के लिए आवेदन कर सकते हैं जहाँ ऑडिट के तहत प्रतिबंधित क्षमताओं को अनलॉक किया जा सकता है। यह प्रोग्राम वैध वैज्ञानिकों को उच्च-जोखिम वाले विषयों—जैसे कि नए वैक्सीन प्लेटफॉर्म या रोगजनक मॉडलिंग (pathogen modeling)—का पता लगाने की अनुमति देने के लिए डिज़ाइन किया गया है, बिना व्यापक जनता को खतरनाक मार्गदर्शन के संपर्क में लाए।

निष्कर्ष

सख्त दोहरे उपयोग प्रतिबंधों को बनाए रखते हुए फॉल्स-पॉजिटिव (false-positive) ब्लॉकों को 85% तक कम करके, Anthropic का लक्ष्य जैविक हथियार डिज़ाइन के द्वार खोले बिना शोधकर्ताओं को अपने सबसे सक्षम मॉडल की शक्ति प्रदान करना है। इस कैलिब्रेटेड सुरक्षा रणनीति की सफलता इस बात का एक टेम्पलेट सेट कर सकती है कि कैसे फ्रंटियर AI मॉडल अन्य उच्च-जोखिम वाले वैज्ञानिक क्षेत्रों को संभालते हैं।