OpenAI’s GPT-5.5 Codex મુશ્કેલીમાં મુકાયું છે. GitHub અને Hacker News પરના ડેવલપર્સ તાજેતરના અઠવાડિયામાં એક વિચિત્ર વર્તણૂક પેટર્ન વિશે નોંધ કરી રહ્યા છે. જટિલ કોડિંગ અને રીઝનિંગ (reasoning) કાર્યો હેન્ડલ કરવા માટે બનાવવામાં આવેલ આ મોડેલ એવી બાબતમાં અટકી રહ્યું છે જેને તેના વપરાશકર્તાઓ reasoning-token clustering કહી રહ્યા છે. તેનું પરિણામ એવું આઉટપુટ છે જે વિખરાયેલું લાગે છે, તર્ક જે સ્ટેપ્સ સ્કીપ કરે છે, અને જવાબો જે લક્ષ્ય ચૂકી જાય છે, ભલે તેની ઉપરની વ્યાકરણ રચના સંપૂર્ણ દેખાતી હોય. સોફ્ટવેર એન્જિનિયરિંગ માટે એક ગંભીર સહાયક તરીકે જોવામાં આવતા સાધન માટે, આ પ્રકારની ખામી માત્ર એક નાની અગવડતા કરતાં વધુ છે.

વપરાશકર્તાઓ ખરેખર શું જોઈ રહ્યા છે

આ અહેવાલો અસ્પષ્ટ ફરિયાદો તરીકે આવ્યા નથી. વપરાશકર્તાઓએ ચોક્કસ નિષ્ફળતાઓનું વર્ણન કર્યું છે. એક ડેવલપર મોડેલને કોઈ ફંક્શન રિફેક્ટર કરવા, મલ્ટીપલ ફાઇલોમાં બગ ટ્રેસ કરવા અથવા ચોક્કસ ડિઝાઇન પેટર્ન લાગુ કરવા માટે કહી શકે છે, અને મોડેલ મજબૂત રીતે શરૂઆત કરશે પરંતુ પછી માર્ગ ભટકી જશે. તે માત્ર ખોટા જવાબો જ આપી રહ્યું નથી. તે મલ્ટી-સ્ટેપ વિચાર પ્રક્રિયાની વચ્ચે જ વિચારધારા ગુમાવી દેતું હોય તેવું લાગે છે. એક ફંક્શન જેને પાંચ તાર્કિક સ્ટેપ્સ લેવા જોઈએ તે ત્રીજા સ્ટેપ પર જ પડી શકે છે, અથવા એવો કોડ જનરેટ કરી શકે છે જે માળખાગત રીતે યોગ્ય લાગે છે પરંતુ મહત્વપૂર્ણ edge cases ને અવગણે છે. આ સમસ્યામાં એક ખાસ લક્ષણ હતું: મોડેલ ભાષામાં નિષ્ફળ જતું નથી; તે તેના પોતાના તર્કનું સંચાલન કરવામાં નિષ્ફળ જાય છે.

reasoning-token clustering ની કાર્યપદ્ધતિ

આ શા માટે મહત્વનું છે તે સમજવા માટે, થોડું પાછળ હટીને મોટા લેંગ્વેજ મોડેલ્સ ખરેખર કેવી રીતે વાંચે છે તે જોવું મદદરૂપ થશે. તેઓ માણસોની જેમ વાક્યો સ્કેન કરતા નથી. તેઓ ટેક્સ્ટને tokens માં વિભાજિત કરે છે—અક્ષરો, સિલેબલ અથવા ક્યારેક આખા શબ્દોના ટુકડાઓ. આ tokens મશીન માટે કાચો માલ છે, જે તેને જવાબોમાં ગોઠવવા માટે Lego bricks જેવું કામ કરે છે.

Reasoning-token clustering એ એવી પ્રક્રિયા છે જેના દ્વારા મોડેલ પૂર્વધારણાથી નિષ્કર્ષ સુધી પહોંચતી વખતે સંબંધિત tokens નું જૂથ બનાવે છે. એક સચોટ રન દરમિયાન, મોડેલ એક તાર્કિક વિચારધારા સાથે જોડાયેલા tokens ને એકસાથે રાખે છે, તે વિચારને ઉકેલે છે, અને પછી સ્પષ્ટ રીતે આગલા ક્લસ્ટર પર જાય છે. જ્યારે ક્લસ્ટરિંગ તૂટી જાય છે, ત્યારે વિવિધ રીઝનિંગ થ્રેડ્સના tokens એકબીજામાં ગૂંચવાઈ જાય છે. એક તાર્કિક વેરિએબલ બીજામાં ભળી જાય છે. સિન્ટેક્સ અકબંધ રહે છે, પરંતુ વિચારનું માળખું વિખરાઈ જાય છે.

તેને એવા રસોઈયા તરીકે વિચારો જે શાકભાજી કેવી રીતે સમારવા તે ભૂલી જાય છે. રસોડું સંપૂર્ણ રીતે સજ્જ છે, રેસીપી કાઉન્ટર પર ખુલ્લી છે, અને રસોઈયા પાસે વર્ષોનું તાલીમ છે. પરંતુ જો પાયાની તૈયારીનું કામ અસ્તવ્યસ્ત થઈ જાય—જો વર્કસ્પેસ વ્યવસ્થિત ન હોય તો કેકના ખીરામાં ડુંગળી નાખી દેવામાં આવે—તો રસોઈયો ગમે તેટલો કુશળ હોય તો પણ અંતિમ પરિણામ ખરાબ જ આવશે. GPT-5.5 Codex માટે, tokens એ સામગ્રી છે, અને reasoning clusters એ તૈયારીના સ્ટેશનો છે. જ્યારે તે સ્ટેશનો અસ્તવ્યસ્ત થાય છે, ત્યારે વાનગી બગડી જાય છે.

એક નક્કર ઉદાહરણ મદદરૂપ થશે. કલ્પના કરો કે તમે મોડેલને યુઝર ઓથેન્ટિકેશન હેન્ડલ કરતી Python સ્ક્રિપ્ટને debug કરવા માટે કહો છો. આ કાર્યમાં એકસાથે ત્રણ અલગ-અલગ થ્રેડ્સને સાચા રાખવાની જરૂર છે: password hashing, session management, અને database queries. જો reasoning clusters એકબીજામાં ભળી જાય, તો મોડેલ session logic ને hashing routine પર લાગુ કરી શકે છે, અથવા database variable ને યુઝર ઇનપુટ તરીકે ગણી શકે છે. જનરેટ થયેલો કોડ ઉપરછલ્લી નજરે જોતા સાચો લાગે પણ વાસ્તવિક લોડ હેઠળ નિષ્ફળ જાય અથવા સુરક્ષામાં ખામી ઊભી કરે. નિષ્ફળતા કોડના વ્યાકરણમાં નથી. તે તેને પેદા કરનાર વિચારના તર્કમાં છે.

આ આર્કિટેક્ચર શા માટે સંઘર્ષ કરી રહ્યું છે

મોડેલ્સની વર્તમાન પેઢીને વધુ માનવીય રીતે વર્તવા માટે પ્રેરાવવામાં આવી રહી છે. તે મહત્વાકાંક્ષા જટિલતા વધારે છે. સિસ્ટમ માત્ર તેના ટ્રેનિંગ ડેટામાંથી આંકડાકીય પેટર્ન પર આધારિત આગલો token અનુમાનિત નથી કરી રહી. તે એવી રીઝનિંગ શૈલીનું અનુકરણ કરવાનો પ્રયાસ કરી રહી છે જે કુદરતી, સંદર્ભિત અને વાતચીત જેવી લાગે.

તે બેવડી જવાબદારી ઘર્ષણ પેદા કરે છે. શુદ્ધ ભાષાને હેન્ડલ કરવી—લય, શૈલી, સૂક્ષ્મ તફાવત, વાતચીતનો પ્રવાહ—તે સચોટ, માળખાગત તર્ક કરતા અલગ કમ્પ્યુટેશનલ કાર્ય છે. બંનેને એકસાથે કરવાથી આર્કિટેક્ચર પર દબાણ આવે છે. વર્તમાન ડિઝાઇન reasoning અને ભાષા બંનેને એકસાથે હેન્ડલ કરવા માટે સંઘર્ષ કરી રહી છે. સ્વચ્છ, ક્રમિક તાર્કિક સાંકળોને બદલે, મોડેલ ક્યારેક એવું reasoning પેદા કરે છે જે આમ-તેમ ભટકતું હોય અથવા પોતાની જાત પર જ પાછું વળતું હોય, જે માનવીય લાગે છે પરંતુ કમ્પ્યુટે

એક વકીલની કલ્પના કરો જે કડક કરાર ડ્રાફ્ટ કરવાનો પ્રયાસ કરી રહ્યો છે અને સાથે સાથે સ્પોકન-વર્ડ કવિતાનું ઈમ્પ્રુવાઈઝેશન પણ કરી રહ્યો છે. બંને ભાષાના કાર્યો છે, પરંતુ તે અલગ-અલગ શિસ્તની માંગ કરે છે. જ્યારે મોડેલ વધુ પડતું પ્રવાહી, માનવ જેવી અભિવ્યક્તિ તરફ ઝૂકે છે, ત્યારે તેની કડક તાર્કિક માળખું જાળવવાની ક્ષમતા નબળી પડે છે. કુદરતી લાગે તેવો પ્રયાસ કરવાથી કોગ્નિટિવ ઓવરહેડ વધે છે, અને વધુ જટિલતા હંમેશા વધુ સારા પરિણામો તરફ દોરી જતી નથી. મોડેલને મૂળભૂત રીતે એકસાથે વિચારવા અને આકર્ષક બનવા માટે કહેવામાં આવે છે, અને અટેન્શન મિકેનિઝમનું હાર્ડવેર હજુ સુધી તે વિભાજિત માંગ સાથે સંપૂર્ણ રીતે મેળ ખાઈ શક્યું નથી.

આ પ્રયોગશાળાની બહાર કેમ મહત્વનું છે

આ ઘટના બે અલગ-અલગ કારણોસર મહત્વ ધરાવે છે.

પ્રથમ, તે એક સ્પષ્ટ સ્મૃતિ અપાવે છે કે AI સંપૂર્ણ નથી. જ્યારે તે તેની મર્યાદાઓ પર પહોંચે છે ત્યારે શ્રેષ્ઠ મોડેલો પણ ભૂલો કરે છે. લાર્જ લેંગ્વેજ મોડેલ્સની આસપાસનું માર્કેટિંગ સાયકલ ઘણીવાર તેમને ઓરેકલ જેવા સિસ્ટમ તરીકે વેચે છે, પરંતુ તેઓ સંભવિતતા આધારિત એન્જિન (probabilistic engines) જ રહે છે. તેઓ અનુમાન લગાવે છે કે પછીનું ટોકન કયું આવશે, અને ક્યારેક તે અનુમાનો સુસંગત લાગે તેવા નિરર્થક શબ્દોમાં પરિણમે છે. GPT-5.5 Codex જેવા ફ્લેગશિપ કોડિંગ મોડેલને તેના પોતાના તર્ક પર લથડતા જોવું એ વાસ્તવિકતાનો એક સારો અનુભવ છે. તે પેટર્ન મેચિંગ અને વાસ્તવિક સમજ વચ્ચેની સીમા નક્કી કરે છે, અને તે સીમા હજુ પણ ખૂબ જ વાસ્તવિક છે.

બીજું, વ્યવસાયો આ મોડેલો પર આધાર રાખે છે. નબળું પ્રદર્શન પ્રોડક્ટ ડેવલપમેન્ટ અને ગ્રાહક સેવાને સીધી અને માપી શકાય તેવી રીતે અસર કરે છે. બેકએન્ડ ઇન્ફ્રાસ્ટ્રક્ચર જનરેટ કરવા માટે Codex નો ઉપયોગ કરતું સ્ટાર્ટઅપ સુરક્ષામાં ખામી (security hole) છોડી શકે છે કારણ કે મોડેલે બે ઓથેન્ટિકેશન લેયરને મિક્સ કરી દીધા હોય. સમાન આર્કિટેક્ચર દ્વારા સંચાલિત કસ્ટમર-સર્વિસ બોટ રિફંડ અથવા પોલિસી અપવાદોનું વચન આપી શકે છે જે તે ખરેખર પ્રોસેસ કરી શકતું નથી, જેનાથી કાનૂની જોખમ અને ગુસ્સે થયેલા વપરાશકર્તાઓ ઊભા થઈ શકે છે.

જ્યારે તમે સોફ્ટવેરથી આગળ જુઓ છો ત્યારે જોખમો વધુ વધી જાય છે. આ પ્રકારની ઘટનાઓ હેલ્થકેર અથવા કાર ચલાવવામાં AI ના ઉપયોગ વિશે ગંભીર પ્રશ્નો ઉભા કરે છે. જો મોડેલ SQL ક્વેરી લખતી વખતે ટોકન ક્લસ્ટર્સમાં મૂંઝવણ અનુભવી શકે છે, તો જ્યારે તે મેડિકલ સ્કેનનું અર્થઘટન કરે અથવા ઓટોનોમસ વ્હીકલ માટે રીઅલ-ટાઇમ સેન્સર ડેટાનું વિશ્લેષણ કરે ત્યારે શું થશે? તેની પાયાની મિકેનિક્સ—બિલિયન પેરામીટર્સમાં સ્ટેટિસ્ટિકલ પેટર્ન મેચિંગ—મૂળભૂત રીતે સમાન છે. ઉચ્ચ જોખમ ધરાવતા ક્ષેત્રોમાં આ સિસ્ટમો પર વિશ્વાસ કરવા માટે તર્કની એવી વિશ્વસનીયતાની જરૂર છે જેને ટોકન-ક્લસ્ટરિંગ નિષ્ફળતાઓ સીધી રીતે નબળી પાડે છે.

એક લથડામણ, પતન નહીં

આને નિષ્ફળતા કહેવી એ ભૂલ હશે. આ સમસ્યાઓ નવી ટેકનોલોજી બનાવવાનો એક ભાગ છે. AI ક્ષમતામાં દરેક નોંધપાત્ર છલાંગ પછી અસ્થિર વર્તનની અવધિ આવી છે. શરૂઆતના GPT મોડેલો અત્યંત આત્મવિશ્વાસ સાથે તથ્યોમાં ભ્રમ (hallucinate) પેદા કરતા હતા. ઇમેજ જનરેટર્સ એક સમયે માનવ હાથોને બગાડતા હતા. કોડ મોડેલ્સ અસ્પષ્ટ સૂચનાઓ સામે આવતા અવારનવાર ઇન્ફાઇનાઇટ લૂપ્સ આઉટપુટ કરે છે. દરેક ખામીએ એક સીમા ખુલ્લી પાડી, અને સંશોધકોએ તે સીમાઓનો ઉપયોગ વધુ સારા નકશા દોરવા માટે કર્યો.

સંશોધકો આ ભૂલોનો ઉપયોગ સિસ્ટમને સુધારવા અને વધુ સારી બનાવવા માટે કરે છે. GitHub થ્રેડ્સ અને Hacker News કોમેન્ટ સેક્શનમાંથી મળતો પ્રતિસાદ માત્ર ઘોંઘાટ નથી. તે વાસ્તવિક વિશ્વમાંથી મળતો કાચો ડાયગ્નોસ્ટિક ડેટા છે. જ્યારે સેંકડો ડેવલપર્સ હજારો અલગ-અલગ કાર્યોમાં મોડેલનું સ્ટ્રેસ-ટેસ્ટિંગ કરે છે, ત્યારે તેઓ એવા નિષ્ફળતાના પ્રકારો (failure modes) બહાર લાવે છે જે કોઈ આંતરિક ક્વોલિટી-એશ્યોરન્સ ટીમ સંપૂર્ણ રીતે નકલ કરી શકતી નથી. તે ક્રાઉડસોર્સ્ડ તપાસ ફીડબેક લૂપને મજબૂત બનાવે છે અને ઝડપી, વધુ લક્ષિત પેચ લાવવા માટે દબાણ કરે છે.

આ ઘટના કદાચ મોડેલના વધુ સારા વર્ઝન તરફ દોરી જશે. OpenAI એ ઐતિહાસિક રીતે એકવાર ખામી નોંધાઈ અને સમજાઈ જાય પછી ઝડપથી સુધારા કર્યા છે. ભલે તે સુધારો અટેન્શન મિકેનિઝમને એડજસ્ટ કરવામાં હોય, રીઝનિંગ લેયર્સને લેંગ્વેજ લેયર્સ સામે કેવી રીતે વજન આપવું તે રિફાઇન કરવામાં હોય, અથવા નવા વેલિડેશન સ્ટેપ્સ રજૂ કરવામાં હોય જે વપરાશકર્તા સુધી પહોંચતા પહેલા જ ગૂંચવાયેલા ટોકન ક્લસ્ટર્સને પકડી લે, તેનું પરિણામ વધુ ટકાઉ સિસ્ટમ તરફ જાય છે.

સાચો બોધપાઠ

કામ કરતા ડેવલપર્સ માટે, આ પાઠ વ્યવહારુ છે. AI-જનરેટેડ કોડ અને તર્કને પ્રથમ ડ્રાફ્ટ તરીકે ગણો, તૈયાર પ્રોડક્ટ તરીકે નહીં. તમારા ટેસ્ટ ચલાવો. તર્કને જાતે સ્ટેપ-બાય-સ્ટેપ તપાસો. એવું માની લો કે આઉટપુટ સપાટી પર પોલિશ્ડ દેખાતું હોવા છતાં મોડેલે તેના આંતરિક ટોકન ક્લસ્ટર્સને બગાડી નાખ્યા હોય શકે છે. સુંદર સિન્ટેક્સ કદાચ ગૂંચવાયેલા વિચારને છુપાવી રહ્યો હોઈ શકે છે.

સમગ્ર ઉદ્યોગ માટે, આ ઘટના એ વાત પર ભાર મૂકે છે કે આર્ટિફિશિયલ ઇન્ટેલિજન્સમાં પ્રગતિ સીધી રેખામાં નથી હોતી. તે રિલીઝ, બ્રેક, ડાયગ્નોઝ અને રિપેરનું એક લૂપ છે. GPT-5.5 Codex લથડ્યું હતું, પરંતુ તે લથડામણ જ એ છે જેના દ્વારા આગામી વર્ઝન વધુ સીધું ચાલતા શીખે છે.

વૈકલ્પિક લર્નિંગ કોમ્યુનિટી: [