Claude ના સ્વાયત્ત પ્રોટીન-બાઈન્ડર અભિયાને 27% હિટ રેટ નોંધાવ્યો છે, જે માનવ સંચાલિત લેબના સામાન્ય 10-15% કરતા વધુ છે અને સમાન લક્ષ્ય પરના સમાંતર માનવ પ્રયાસો કરતા પણ આગળ છે. આ પરિણામ દર્શાવે છે કે એક વિશાળ, સુવ્યવસ્થિત પ્રોમ્પ્ટ લેંગ્વેજ મોડલને વર્ચ્યુઅલ બાયોટેક વર્કફ્લોમાં બદલી શકે છે, પરંતુ તે એ પણ દર્શાવે છે કે જ્યારે મોડલના કોન્ફિડન્સ મેટ્રિક્સ ખોટા પડે છે ત્યારે તે અભિગમ કેટલો નાજુક રહે છે.
આંકડાઓમાં પ્રયોગ
Anthropic એ તેના Claude મોડલને પૂર્ણ-સ્તરનું પ્રોટીન ડિઝાઇન પ્રોટોકોલ અને નિશ્ચિત GPU બજેટ આપ્યું, અને પછી તેને 16 પ્રોટીન લક્ષ્યો પર એન્ડ-ટુ-એન્ડ અભિયાન ચલાવવા દીધું. લેબ-સાઇડની નિષ્ફળતા પછી એક લક્ષ્યને પડતું મૂકવામાં આવ્યું હતું, જેનાથી 15 વ્યવહારુ અભિયાનો બાકી રહ્યા. તેમાંથી Claude એ 1,320 ઉમેદવાર સિક્વન્સ જનરેટ કર્યા; લેબોરેટરી પરીક્ષણે 354 ને સાચા બાઈન્ડર્સ તરીકે પુષ્ટિ કરી, જેનાથી 26.8% સફળતાનો દર મળ્યો.
તુલના માટે, મોટાભાગના માનવ-નિર્દેશિત બાઈન્ડર પ્રોજેક્ટ્સ 10% થી 15% વચ્ચે હિટ રેટ રિપોર્ટ કરે છે. RBX1 લક્ષ્ય પર સીધી સ્પર્ધામાં, માનવ સહભાગીઓએ 3.7% હિટ રેટ હાંસલ કર્યો જ્યારે Claude ની ડિઝાઇનોએ 31.1% હિટ રેટ નોંધાવ્યો. મોડલ સેલ્ફ-રેન્કિંગમાં પણ સક્ષમ સાબિત થયું: Claude એ જે સિંગલ ડિઝાઇનને શ્રેષ્ઠ તરીકે દર્શાવી હતી તે 49% વખત સફળ રહી હતી, અને ટોચની દસ ડિઝાઇનો 39% વખત સફળ રહી હતી.
સિસ્ટમ ક્યાં નિષ્ફળ ગઈ
આ આંકડા બે સ્પષ્ટ ખામીઓ છુપાવે છે. Claude MBP લક્ષ્ય પર સંપૂર્ણપણે નિષ્ફળ રહ્યું અને TNFα લક્ષ્ય પર નબળું પ્રદર્શન કર્યું, છતાં તે રન માટે તેના આંતરિક કોન્ફિડન્સ સ્કોર્સ ઊંચા રહ્યા હતા. બીજા શબ્દોમાં કહીએ તો, જ્યારે વેટ-લેબ રીડઆઉટ્સ અલગ વાર્તા કહેતા હતા ત્યારે મોડલને ખાતરી હતી કે તે સફળ થઈ રહ્યું છે. તે ખોટી રીતે કેલિબ્રેટ થયેલા સિગ્નલો એક જોખમ તરફ નિર્દેશ કરે છે: એક સ્વાયત્ત પાઇપલાઇન જે તેના પોતાના મેટ્રિક્સ પર વિશ્વાસ કરે છે તે નિષ્ફળ પ્રયોગો પર સંસાધનોનો બગાડ કરી શકે છે.
પ્રોમ્પ્ટ એન્જિનિયરિંગ એક નવા લેબ નોટબુક તરીકે
અભ્યાસનું સૌથી આકર્ષક પાસું જીવવિજ્ઞાન નથી પરંતુ તેને ચલાવનાર પ્રોમ્પ્ટ છે. એક સીનિયર વૈજ્ઞાનિક સામાન્ય રીતે કયા પ્રોટીન પ્રદેશોનું સંશોધન કરવું, કયા કમ્પ્યુટેશનલ ટૂલ્સનો ઉપયોગ કરવો અને કમ્પ્યુટ સમય કેવી રીતે ફાળવવો તે નક્કી કરવામાં અઠવાડિયા વિતાવે છે. Anthropic એ તે કુશળતાને 16,000 શબ્દોના પ્રોમ્પ્ટમાં સંકુચિત કરી દીધી—જે લગભગ એક ટૂંકી નવલકથા જેટલી લાંબી છે. લખાણના લગભગ બે તૃતીયાંશ ભાગમાં કાર્યકારી ચિંતાઓ હતી: સમયગાળો, બજેટ મોનિટરિંગ અને એક્સટર્નલ સોફ્ટવેરને કોલ કરતા સબ-એજન્ટ્સનું સંચાલન.
Claude એ RFdiffusion (એક ડિફ્યુઝન-આધારિત સ્ટ્રક્ચર જનરેટર) અને ProteinMPNN (એક સિક્વન્સ ડિઝાઇન નેટવર્ક) જેવા ઓપન-સોર્સ ડિઝાઇન એન્જિન્સનો ઉપયોગ કર્યો. લેંગ્વેજ મોડલે એક શેડ્યુલર તરીકે કામ કર્યું, જે આ ટૂલ્સ વચ્ચે મધ્યવર્તી પરિણામો પહોંચાડતું, પેરામીટર્સ એડજસ્ટ કરતું અને ડિઝાઇન સાયકલ ક્યારે રોકવી તેનો નિર્ણય લેતું. અસરકારક રીતે, પ્રોમ્પ્ટ એક વર્ચ્યુઅલ લેબોરેટરી મેનેજર બની ગયો, જે માનવ વૈજ્ઞાનિકોને વર્કફ્લો સંકલનના ઝીણવટભર્યા કામોમાંથી મુક્ત કરે છે.
બાઈન્ડર્સ ખરેખર શું છે
તમામ 354 પુષ્ટિ થયેલ હિટ્સ એવા અણુઓ છે જે તેમના લક્ષ્ય પ્રોટીન સાથે ભૌતિક રીતે જોડાય છે. પેપર બાઈન્ડિંગ એસેઝ વિશે રિપોર્ટ કરે છે પરંતુ કાર્યકારી ડેટા પૂરો પાડતું નથી—કોઈપણ બાઈન્ડર પ્રવૃત્તિમાં ફેરફાર કરે છે, કન્ફોર્મેશનને સ્થિર કરે છે અથવા થેરાપ્યુટિક ક્ષમતા દર્શાવે છે તેનો કોઈ પુરાવો નથી. તેવી જ રીતે, સ્ટ્રક્ચરલ વેલિડેશન (દા.ત., X-ray crystallography અથવા cryo-EM) ગેરહાજર છે, તેથી ચોક્કસ બાઈન્ડિંગ મોડ માત્ર અનુમાનિત છે. તેથી આ અભિયાન ઝડપી બાઈન્ડર શોધ માટે પ્રૂફ-ઓફ-કન્સેપ્ટ દર્શાવે છે, નહીં કે ડ્રગ કેન્ડિડેટ્સ પહોંચાડતી પાઇપલાઇન.
બાયોટેક અને AI સંશોધન માટેના જોખમો અને તકો
જો પ્રોમ્પ્ટ-સંચાલિત મોડલ વિશ્વસનીય રીતે માનવ હિટ રેટને ફરીથી પેદા કરી શકે અથવા તેનાથી વધી શકે, તો બાયોટેક કંપનીઓ પ્રારંભિક તબક્કાના સંશોધનના ખર્ચ અને સમયમાં મોટો ઘટાડો કરી શકે છે. જો કે, MBP અને TNFα પર ખોટી રીતે કેલિબ્રેટ થયેલા કોન્ફિડન્સ સ્કોર્સ દર્શાવે છે કે સંપૂર્ણપણે માનવ હસ્તક્ષેપ વગરની સિસ્ટમ હજુ ઉત્પાદન માટે તૈયાર નથી. કંપનીઓને કોન્ફિડન્સ મેટ્રિક્સના અર્થઘટન અને કાર્યકારી સુસંગતતાના પ્રમાણ માટે હજુ પણ માનવ દેખરેખની જરૂર પડશે.
AI દ્રષ્ટિકોણથી, આ કાર્ય "ટૂલ" અને "એજન્ટ" વચ્ચેની સીમાને ધૂંધળી કરે છે. Claude એ નવો પ્રોટીન-ડિઝાઇન અલ્ગોરિધમ નથી; તે એક જનરલ-પર્પઝ લેંગ્વેજ મોડલ છે જે પૂરતી વિગતવાર સૂચનાઓ આપવા પર અસ્તિત્વમાં રહેલા વિશિષ્ટ ટૂલ્સનું સંચાલન કરી શકે છે. પ્રયોગ સૂચવે છે કે ભવિષ્યમાં AI કોઈપણ સિંગલ ઘટકને બદલે ઓપન-સોર્સ સાયન્ટિફિક સોફ્ટવેરના મોડ્યુલર ઇકોસિસ્ટમને એકસાથે જોડતા ગુંદર (glue) તરીકે કામ કરશે.
વિરોધ પક્ષ: પ્રોમ્પ્ટની જટિલતાનો છુપો ખર્ચ
જ્યારે અભ્યાસ 16,000 શબ્દોના પ્રોમ્પ્ટને જ્ઞાનના કેપ્ચરની સફળતા તરીકે દર્શાવે છે, ત્યારે તે પ્રોમ્પ્ટનું કદ જ વ્યવહારુ ચિંતાઓ ઊભી કરે છે. આવા દસ્તાવેજ તૈયાર કરવા માટે ઊંડી ડોમેન એક્સપર્ટાઇઝ, પાયાના ટૂલ્સ સાથેની પરિચિતતા અને એજ કેસીસનું અનુમાન લગાવવાની ક્ષમતાની જરૂર છે. બીજા શબ્દોમાં કહીએ તો, કુશળતા અદૃશ્ય થઈ નથી—તે બેન્ચ સાયન્ટિસ્ટ્સથી પ્રોમ્પ્ટ એન્જિનિયર્સ તરફ સ્થળાંતરિત થઈ છે.
તદુપરાંત, નિશ્ચિત GPU બજેટ પરની નિર્ભરતા શોધની ઊંડાઈ પર એક કડક મર્યાદા લાદે છે. માનવ ટીમો વચગાળાના પરિણામોના આધારે સંસાધનોનું ગતિશીલ રીતે પુનઃવિતરણ કરી શકે છે, જ્યારે Claude નું અભિયાન પહેલેથી નક્કી કરેલા બજેટનું પાલન કરે છે, જે સંભવતઃ સેમ્પલ કરેલ સીક્વન્સ સ્પેસની વ્યાપકતાને મર્યાદિત કરી શકે છે.
આગળ શું જોવું
Anthropic નો લેખ કેટલાક ખુલ્લા પ્રશ્નો છોડી જાય છે. ભવિષ્યના કાર્યમાં કોન્ફિડન્સ કેલિબ્રેશન પર ધ્યાન આપવાની જરૂર પડશે જેથી મોડેલનું સ્વ-મૂલ્યાંકન પ્રાયોગિક પરિણામો સાથે સુસંગત રહે. ફંક્શનલ એસેઝ—જેમ કે એન્ઝાઇમેટિક ઇન્હિબિશન અથવા કોષીય પ્રવૃત્તિ—ને સ્વાયત્ત લૂપમાં સંકલિત કરવાથી આ ટેકનોલોજી માત્ર બાઈન્ડર ઓળખવાને બદલે દવા શોધ (drug discovery) ની વધુ નજીક પહોંચશે. અંતે, વિવિધ બજેટ શરતો હેઠળ અને લક્ષ્યોના વ્યાપક સેટ પર આ અભિગમનું બેન્ચમાર્કિંગ એ દર્શાવશે કે અવલોકન કરેલ હિટ રેટ પુનરાવર્તિત કરી શકાય તેવું છે કે તે માત્ર એક આઉટલાયર છે.
નિષ્કર્ષ સ્પષ્ટ છે: વિગતવાર પ્રોમ્પ્ટ ઓર્કેસ્ટ્રેશન એક લેંગ્વેજ મોડેલને વર્ચ્યુઅલ બાયોટેક લેબમાં ફેરવી શકે છે, જે માનવ સરેરાશ કરતા વધુ બાઈન્ડર હિટ રેટ્સ આપી શકે છે. તેમ છતાં, આ અભિગમ હજુ પણ નિષ્ણાત પ્રોમ્પ્ટ લેખન પર નિર્ભર છે અને કોન્ફિડન્સ મિસફાયરથી પીડાય છે જે ખર્ચાળ પ્રયોગોને નિષ્ફળ બનાવી શકે છે. જેમ જેમ સમુદાય આ પાઈપલાઈન્સને સુધારે છે, તેમ તેમ AI સ્વાયત્તતા અને માનવ દેખરેખ વચ્ચેનું સંતુલન નક્કી કરશે કે આવા સિસ્ટમ્સ સામાન્ય સાધનો બનશે કે માત્ર પ્રાયોગિક વિષય બની રહેશે.
