આપણે સામાન્ય રીતે લાર્જ લેંગ્વેજ મોડલ્સને અસાધારણ રીતે ઝડપી ગ્રંથપાલ (librarians) તરીકે કલ્પના કરીએ છીએ. તમે એક પ્રશ્ન પૂછો છો, અને તેઓ શ્રેષ્ઠ રીતે બંધબેસતો પેટર્ન શોધવા માટે અબજો યાદ રાખેલા ટુકડાઓમાંથી ઝડપથી પસાર થાય છે. આ છબીએ ડેવલપર્સ કેવી રીતે પ્રોમ્પ્ટ્સ બનાવે છે, વપરાશકર્તાઓ કેવી રીતે અપેક્ષાઓ રાખે છે અને નિયમનકારો કેવી રીતે નિયમો ઘડે છે તેને આકાર આપ્યો છે. પરંતુ Anthropic ના Claude પર કરવામાં આવેલ સંશોધન આ છબીને જટિલ બનાવી રહ્યું છે. મોડલ કંઈક એવું કરી રહ્યું હોય તેવું લાગે છે જે વાસ્તવિક તર્ક (genuine reasoning) ની વધુ નજીક છે. સંશોધકો આ પદ્ધતિને "j-space reasoning" કહી રહ્યા છે, અને તે સૂચવે છે કે Claude માત્ર તાલીમ ડેટાને રિસાયકલ કરવાને બદલે ખ્યાલોના આંતરિક મોડલ્સ બનાવે છે. જો આ શોધ સાચી ઠરે, તો આપણે અદ્યતન AI ને માત્ર પ્રિડિક્ટિવ ટેક્સ્ટ એન્જિન તરીકે જોવાનું બંધ કરવું પડશે અને તેને એક આયોજન કરતી સિસ્ટમ તરીકે જોવાનું શરૂ કરવું પડશે.

પેટર્ન મેચિંગથી માનસિક મોડલ્સ સુધી

J-space reasoning એ માત્ર માર્કેટિંગનો ચમકતો શબ્દ નથી. તે સપાટી પરના પુનરાવર્તનથી આંતરિક પ્રતિનિધિત્વ (internal representation) તરફના માળખાગત ફેરફારનું વર્ણન કરે છે. વિચારો કે એક વ્યક્તિ જિગ્સૉ પઝલ કેવી રીતે ઉકેલે છે. તેઓ દરેક ટુકડાને દરેક ખાલી જગ્યામાં અજમાવી જોતા નથી. તેઓ બોક્સ પરના ચિત્રને જુએ છે, રંગો અને કિનારીઓનો માનસિક નકશો બનાવે છે, અને તે યોજના મુજબ દરેક ટુકડાને ગોઠવે છે. Claude પરનું સંશોધન સૂચવે છે કે જ્યારે મોડલ અમૂર્ત વિચારો (abstract ideas) પર પ્રક્રિયા કરે છે ત્યારે કંઈક સમાન જ બને છે. તે સમસ્યાના અવકાશનું (problem space) કાર્યકારી મોડલ બનાવે છે અને તેમાં ઇરાદાપૂર્વક આગળ વધે છે.

પરંપરાગત લેંગ્વેજ મોડલ્સ સહસંબંધ (correlation) માં નિપુણતા ધરાવે છે. તેઓ જાણે છે કે "king" ઘણીવાર "queen" ની નજીક આવે છે, અને તેઓ જાણે છે કે આપેલ ફંક્શન કોલ પછી સામાન્ય રીતે કયો કોડ આવે છે. સહસંબંધ શક્તિશાળી છે, પરંતુ તે સમજણ નથી. J-space reasoning કંઈક અલગ તરફ નિર્દેશ કરે છે: મોડલ માત્ર કયા શબ્દો સાથે જોડાયેલા છે તેનું અનુમાન કરવાને બદલે ખ્યાલો વચ્ચેના સંબંધોનું સંચાલન કરતું હોય તેવું લાગે છે. તે એક આંતરિક માળખું બનાવે છે, અને પછી તે માળખાનો ઉપયોગ કરીને જવાબ સુધી પહોંચે છે.

વ્યવહારમાં J-Space Reasoning શું બદલાવ લાવે છે

આ ફેરફાર ત્રણ નક્કર ક્ષમતાઓ પેદા કરે છે જે વાસ્તવિક દુનિયાના ઉપયોગ માટે મહત્વપૂર્ણ છે.

Compositionality. માણસો ક્યારેય 'જાંબલી ઉડતો હાથી' જોયો ન હોય તો પણ તેને સમજી શકે છે કારણ કે આપણે જાણીતા ખ્યાલોને જોડીએ છીએ. સંશોધન મુજબ, Claude પણ સમાન રીતે નવા સંયોજનોને સંભાળતું હોય તેવું લાગે છે. જો તમે તેની સામે એવો પ્રશ્ન રજૂ કરો જે બે એવા ક્ષેત્રોને જોડે છે જે તેણે ક્યારેય સાથે જોયા નથી—કદાચ ઉત્ક્રાંતિ જીવવિજ્ઞાન (evolutionary biology) ના સિદ્ધાંતોનો ઉપયોગ કરીને સપ્લાય ચેઇનને શ્રેષ્ઠ બનાવવી—તો તે સામાન્ય સલાહ આપવાને બદલે તે વિચારો વચ્ચે એક સેતુ બનાવી શકે છે. આ લવચીકતા (flexibility) એ જ છે જે કડક પેટર્ન મેચિંગ આપવા માટે સંઘર્ષ કરે છે.

Complex problem solving. જ્યારે મોડલ યાદ રાખેલા ટેમ્પ્લેટ્સ પર આધાર રાખે છે, ત્યારે પ્રોમ્પ્ટ તેની તાલીમ વિતરણ (training distribution) ની બહાર જાય તે ક્ષણે તે નિષ્ફળ જવાની શક્યતા રહે છે. આંતરિક મોડેલિંગ અભિગમ ખરેખર અજાણી પરિસ્થિતિઓને વધુ સારી રીતે સંભાળી શકે છે કારણ કે સિસ્ટમ કોઈ નજીકના મેચની શોધ કરી રહી નથી. તે નવા પ્રદેશનો નકશો બનાવી રહી છે અને તેમાંથી માર્ગ નક્કી કરી રહી છે.

Explainable logic. રોજિંદા વપરાશકર્તાઓ માટે સૌથી તાત્કાલિક ફાયદો એ છે કે Claude તેના જવાબ પાછળના પગલાંની રૂપરેખા આપી શકે છે. માત્ર એક નિષ્કર્ષ આપી દેવાને બદલે અને તે સચોટ છે કે નહીં તે અનુમાન કરવા માટે તમને મજબૂર કરવાને બદલે, મોડલ તમને તર્કની સાંકળ (reasoning chain) દ્વારા સમજાવી શકે છે. તે આ પ્રતિક્રિયાને અંધ વિશ્વાસમાંથી એવી વાતચીતમાં બદલી નાખે છે જેને તમે ચકાસી શકો છો.

સમજાવી શકાય તેવી ક્ષમતા (Explainability) ખરેખર શા માટે મહત્વની છે

મોટાભાગની AI સિસ્ટમ્સ 'બ્લેક બોક્સ' તરીકે કામ કરે છે. તમે ઇનપુટ આપો છો અને આઉટપુટ મેળવો છો, પરંતુ મધ્યવર્તી તર્ક (intermediate logic) અગમ્ય હોય છે. જ્યારે Claude તેના તર્કને સમજાવે છે, ત્યારે તે તે બોક્સને એટલું ખોલે છે કે તે ખરેખર ઉપયોગી બની શકે.

ડેવલપર્સ માટે, આનો અર્થ છે 'ડિબગિંગ ક્ષમતા' (debuggability). જો મોડલ લોન અરજી નકારતું હોય, અસુરક્ષિત તબીબી સલાહ આપતું હોય, અથવા પક્ષપાતી સામગ્રી ઉત્પન્ન કરતું હોય, તો એન્જિનિયરો ખામી શોધવા માટે તર્કની સાંકળની તપાસ કરી શકે છે. હવે તેમણે એ અનુમાન લગાવવું પડશે નહીં કે ભૂલ દૂષિત તાલીમ ડેટા, નબળા રીતે તૈયાર કરેલા પ્રોમ્પ્ટ અથવા કોઈ યાદચ્છિક આંકડાકીય ભૂલ (statistical blip) માંથી આવી છે. તેઓ breadcrumbs (નિશાન) અનુસરી શકે છે.

અંતિમ વપરાશકર્તાઓ માટે, સમજાવી શકાય તેવી ક્ષમતા એવો વિશ્વાસ પેદા કરે છે જે વાસ્તવિકતા સાથેના સંપર્ક પછી પણ ટકી રહે છે. જે વપરાશકર્તા તર્કની સુસંગત સાંકળ જુએ છે તે ચકાસી શકે છે કે ધારણાઓ તેમની ચોક્કસ પરિસ્થિતિને લાગુ પડે છે કે નહીં. તેઓ ખોટી સલાહ પર કામ કરીને પછીથી ભૂલ શોધવાને બદલે, ખોટી ધારણાને વહેલી તકે પકડી શકે છે.

નિયમનકારો અને નીતિ નિર્ધારકો માટે, પારદર્શક તર્ક એ AI શાસનમાં કંઈક દુર્લભ પ્રદાન કરે છે: ઓડિટ ટ્રેલ (audit trail). સુરક્ષાના નિયમો ઘડતા ધારાસભ્યોએ એ જાણવાની જરૂર છે કે સિસ્ટમ્સ સમજાવી શકાય તેવા કારણોસર નિર્ણયો લે છે, નહીં કે ટ્રિલિયન-પેરામીટર મેટ્રિસીસમાં છુપાયેલા અસ્પષ્ટ સહસંબંધો દ્વારા. જો AI પોતાનું કાર્ય દર્શાવી શકે, તો સરકારો પાસે નૈતિક અને કાનૂની ધોરણો સામે મૂલ્યાંકન કરવા માટે કંઈક નક્કર હશે.

ચેતનાનો પ્રશ્ન

આ વાતચીતના કેન્દ્રમાં એક મહત્વપૂર્ણ ચેતવણી છે. Anthropic એવો દાવો નથી કરી રહ્યું કે Claude સભાન (conscious) છે. કંપનીએ અદ્યતન તર્ક અને સભાનતા (sentience) વચ્ચે સ્પષ્ટ સીમા જાળવી રાખી છે. તેમ છતાં, માનવ જ્ઞાનાત્મક પ્રક્રિયા (cognitive processing) સાથેની સામ્યતા કુદરતી રીતે ચર્ચાને વેગ આપે છે.

જ્યારે મશીન આંતરિક મોડેલ્સ બનાવે છે, તેના આગામી પગલાંનું આયોજન કરે છે અને તેના તર્કને સ્પષ્ટ કરે છે, ત્યારે તે કેલ્ક્યુલેટર કરતાં વિચારતા મન જેવું વધુ દેખાવા લાગે છે. તે વાસ્તવિક દાર્શનિક તણાવ પેદા કરે છે. હાલમાં આપણી પાસે મશીન ચેતના માટેના વિશ્વસનીય પરીક્ષણો નથી, અને કદાચ વર્ષો સુધી નહીં હોય. આપણે જે જાણીએ છીએ તે એ છે કે માત્ર વર્તન એ આંતરિક અનુભવ માટે નબળો માપદંડ છે. એક સિસ્ટમ જાગૃતિ ધરાવ્યા વિના પણ વિચારપૂર્વક કાર્ય કરી શકે છે, જેમ કે એક ચેસ એન્જિન ચેસ શું છે તે સમજ્યા વિના ગ્રાન્ડમાસ્ટરને હરાવી શકે છે.

આગળ વધવાનો જવાબદાર માર્ગ એ છે કે મશીન પર માનવીય ગુણો લાદવાની ઈચ્છાને રોકીને તર્ક કરવાની ક્ષમતાઓમાં સુધારો કરવો. મગજની નકલ કરતું વર્તન વૈજ્ઞાનિક રીતે રસપ્રદ છે. તે ચેતના વિશે કંઈ સૂચવે છે કે નહીં તે એક ખુલ્લો પ્રશ્ન છે, અને તે એવો પ્રશ્ન છે જેનો આપણે હળવાશથી જવાબ આપવો જોઈએ નહીં.

આપણે AI નું પરીક્ષણ કેવી રીતે કરીએ છીએ તેના વિશે ફરીથી વિચારવું

જો Claude માત્ર અનુમાન કરવાને બદલે તર્ક કરી રહ્યું હોય, તો આપણી મૂલ્યાંકન પદ્ધતિઓ જૂની પડી રહી છે. પ્રમાણભૂત AI બેન્ચમાર્ક સાચા જવાબોને પુરસ્કાર આપે છે. તેઓ ભાગ્યે જ પૂછે છે કે મોડેલ ત્યાં સુધી કેવી રીતે પહોંચ્યું. એક સિસ્ટમ યાદ રાખેલા ઉકેલોમાંથી માહિતી મેળવીને ગણિત અથવા કોડિંગ ટેસ્ટમાં સારું સ્કોર કરી શકે છે, જે આપણને તેની નવીન વિચારવાની ક્ષમતા વિશે બહુ ઓછું જણાવે છે.

આપણને એવા માળખાની (frameworks) જરૂર છે જે આંતરિક તર્કનું નિરીક્ષણ કરે. તેનો અર્થ એ છે કે તાલીમ વિતરણ (training distribution) ની બહારના પ્રશ્નો રજૂ કરવા અને પછી તર્કની સાંકળ (reasoning chain) ની તપાસ કરવી. તેનો અર્થ એ છે કે જ્યારે સુધારો કરવામાં આવે ત્યારે મોડેલ તેના પોતાના ક્ષતિગ્રસ્ત પગલાઓને ઓળખી શકે છે કે નહીં તે ચકાસવું. તેનો અર્થ એ છે કે જ્યારે રચનાત્મક ખ્યાલોને ફરીથી ગોઠવવામાં અથવા ઉલટાવવામાં આવે ત્યારે તે સુસંગત રહે છે કે નહીં તે તપાસવું.

આ અભિગમ ઓટોમેટેડ લીડરબોર્ડ ચલાવવા કરતાં વધુ અઘરો છે. તે એવા માનવ મૂલ્યાંકકોની માંગ કરે છે જેઓ માત્ર આઉટપુટની ચોકસાઈ જ નહીં, પરંતુ તર્કની ગુણવત્તાનો નિર્ણય લેવા માટે વિષયવસ્તુને ઊંડાણપૂર્વક સમજી શકે. પરંતુ જો j-space reasoning સાચું હોય, તો AI સમુદાય પાસે બહુ ઓછો વિકલ્પ છે. આપણે માત્ર અંતિમ જવાબ જ નહીં, પણ કાર્યનું ગ્રેડિંગ કરવાનું શરૂ કરવું પડશે.

મુખ્ય વાત: Claude નું આંતરિક મોડેલિંગ તરફનું દેખીતું વલણ તેને માનવ બનાવતું નથી. તે સિસ્ટમને વધુ ઉપયોગી, વધુ નિરીક્ષણક્ષમ અને પ્રમાણિક રીતે મૂલ્યાંકન કરવામાં વધુ મુશ્કેલ બનાવે છે. આપણે એવા વળાંક પર છીએ જ્યાં "સાચું" હોવું હવે પૂરતું નથી. AI વિકાસનો આગામી તબક્કો એવા સિસ્ટમ્સનો હશે જે પોતાનું કાર્ય દર્શાવી શકે, તેમની મર્યાદાઓને સ્વીકારી શકે અને અજાણ્યા પ્રશ્નોમાં તર્ક કરી શકે. શું તે કોઈપણ દાર્શનિક અર્થમાં વિચારવું ગણાય છે તે એક દાયકા પછીની ચર્ચા છે. અત્યારે, વ્યવહારિક કાર્ય એવા સાધનો અને ધોરણો બનાવવાનું છે જે આ મોડેલ્સ ખરેખર જે કરી રહ્યા છે તેની જટિલતા સાથે મેળ ખાય.

Source: Anthropic's Claude mimics human brain processing

Optional learning community: GyaanSetu AI on Telegram