OpenAI એ આજે GPT-Red લોન્ચ કર્યું છે, જે એક લાર્જ-લેંગ્વેજ મોડલ છે જે ઓટોમેટેડ રેડ-ટીમ હેકર તરીકે કામ કરે છે. આ સિસ્ટમ કંપનીના લેટેસ્ટ GPT-5.6 મોડલને પહેલેથી જ વધુ સુરક્ષિત બનાવી રહી છે, જેનાથી સિમ્યુલેટેડ હુમલાઓના સફળતાનો દર 90% થી વધુથી ઘટાડીને 23% થી ઓછો કરી દીધો છે.
GPT-Red કેવી રીતે રેડ-ટીમ કાર્યને ઓટોમેટ કરે છે
રેડ-ટીમ ટેસ્ટિંગ—કોઈ સિસ્ટમને જાણીજોઈને તોડવાનો અથવા હાઇજેક કરવાનો પ્રયાસ કરવો—પરંપરાગત રીતે સુરક્ષા નિષ્ણાતો પર આધારિત રહ્યું છે. જેમ જેમ LLMs વેબ બ્રાઉઝ કરતા, કોડ રન કરતા અને થર્ડ-પાર્ટી સેવાઓનો ઉપયોગ કરતા શીખે છે, તેમ તેમ તેનો દુરુપયોગ કરવાની રીતો માનવ ટીમ દ્વારા શોધવામાં આવે તેટલી ઝડપ કરતાં વધુ ઝડપથી વધતી જાય છે.
OpenAI એ "સેલ્ફ-પ્લે લૂપ" (self-play loop) દ્વારા આનો જવાબ આપ્યો છે, જે સંશોધકો દ્વારા 'ડોજો' (dojo) કહેવામાં આવતા સિમ્યુલેટેડ વાતાવરણમાં એક મોડલની બીજી નકલ સામે લડાવે છે. આ સેન્ડબોક્સમાં, GPT-Red હુમલાખોરની ભૂમિકા ભજવે છે જ્યારે એક અથવા વધુ ડિફેન્ડર મોડલ્સ તેનો પ્રતિકાર કરવાનો પ્રયાસ કરે છે. આ બંને પક્ષો અસંખ્ય રાઉન્ડ રમે છે; દરેક ઇટરેશન હુમલાખોરને વધુ સૂક્ષ્મ ખામીઓ શોધવા અને ડિફેન્ડરને નવી સુરક્ષા પદ્ધતિઓ શીખવા માટે મજબૂર કરે છે. OpenAI એ આ પ્રક્રિયાને GPT-5.6 બનાવતા ટ્રેનિંગ પાઇપલાઇનમાં સામેલ કરી છે, જેને કંપની તેના અત્યાર સુધીના સૌથી મજબૂત રિલીઝ તરીકે રજૂ કરે છે.
હુમલાનો એક નવો પ્રકાર: ફેક ચેઇન ઓફ થોટ (fake chain of thought)
સેલ્ફ-પ્લે રન દ્વારા એક આશ્ચર્યજનક "ફેક ચેઇન ઓફ થોટ" (fake chain of thought) હુમલો સામેલ આવ્યો છે. LLMs ઘણીવાર સ્ટેપ-બાય-સ્ટેપ તર્કનો ટ્રેસ—એક "ચેઇન ઓફ થોટ"—મુક્ત કરે છે જે અંતિમ જવાબ તરફ દોરી જાય છે. GPT-Red એ તે ટ્રેસમાં ખોટી એન્ટ્રીઓ ઉમેરવાનું શીખ્યું છે, જેનાથી મોડલને એવું લાગે કે તેણે પહેલેથી જ ખોટા તર્કની ચકાસણી કરી લીધી છે. ઉદાહરણ તરીકે, હુમલાખોર મોડલને એવું માનવા માટે મજબૂર કરી શકે છે કે "1 + 1 = 3" ની ચકાસણી થઈ ગઈ છે, જેનાથી સિસ્ટમ બનાવટી પરિણામના આધારે આઉટપુટ આપવા પ્રેરાય છે.
આ હુમલો માત્ર ટેક્સ્ટ જનરેટર્સ પૂરતો મર્યાદિત નથી. એક બાહ્ય લેબ દ્વારા બનાવવામાં આવેલા "Vendy" (વેન્ડિંગ-મશીન-સ્ટાઇલ એજન્ટ) સામેના ટેસ્ટમાં, GPT-Red એ કિંમતની વિગતોમાં ફેરફાર કર્યો અને ઓર્ડર રદ કર્યા, જે સાબિત કરે છે કે આ ટેકનિક યુઝરના કમાન્ડ પર કામ કરતા સ્પેશિયલાઇઝ્ડ એજન્ટ્સ સામે પણ કામ કરે છે.
માપી શકાય તેવો સુરક્ષા વધારો
OpenAI એ આંકડા બહાર પાડ્યા છે જે GPT-Red સામેના તાલીમની અસર દર્શાવે છે. જ્યારે નવા મોડલ દ્વારા જનરેટ કરવામાં આવેલા સૌથી શક્તિશાળી હુમલાઓ ઓગસ્ટમાં રિલીઝ થયેલા GPT-5 સામે કરવામાં આવ્યા, ત્યારે 90% થી વધુ સફળતા મળી હતી. જ્યારે GPT-5.6 સામે આ જ હુમલાઓ 23% થી પણ ઓછા સમયમાં સફળ થયા.
2025 ના એક પ્રયોગમાં જેમાં GPT-Red ને માનવ રેડ-ટીમર્સ સામે લડાવવામાં આવ્યા હતા, તેમાં AI એ માનવો કરતાં વધુ કાર્યક્ષમ રીતે હુમલાના વિવિધ પ્રકારો શોધ્યા અને સુધાર્યા, જે સૂચવે છે કે એક એડવર્સરીયલ મોડલ ઓછા સમયમાં નબળાઈઓના વ્યાપક ક્ષેત્રને શોધી શકે છે.
મર્યાદાઓ અને માનવ નિષ્ણાતતાની સતત જરૂરિયાત
GPT-Red માનવ સુરક્ષા વિશ્લેષકોનું સ્થાન લેતું નથી. તે હજુ પણ મલ્ટી-ટર્ન કન્વર્સેશનલ હુમલાઓ (જ્યાં હુમલાખોર અનેક વાતચીતો દ્વારા એક વાર્તા બનાવે છે) અને વિઝ્યુઅલ પ્રોમ્પ્ટ ઇન્જેક્શન (જે છબીઓની અંદર દૂષિત ટેક્સ્ટ છુપાવે છે) પર અટકી જાય છે. OpenAI આ મોડલનો ઉપયોગ પ્રથમ-લાઇન પ્રોબ (first-line probe) તરીકે કરવાનું આયોજન કરી રહ્યું છે, જે માનવ નિષ્ણાતો દ્વારા તપાસવા અને વિસ્તૃત કરવા માટે આકર્ષક હુમલાના વિચારો રજૂ કરશે.
આ સાધન પ્રોપ્રાઇટરી (proprietary) છે, તેથી બાહ્ય સંશોધકો તેની ક્ષમતાઓનું સીધું પરીક્ષણ કરી શકતા નથી અથવા અહેવાલ મુજબના ફાયદાઓની ચકાસણી કરી શકતા નથી.
