Claude-ന്റെ സ്വയംഭരണാധികാരമുള്ള പ്രോട്ടീൻ-ബൈൻഡർ (protein-binder) ക്യാമ്പയിൻ 27% വിജയനിരക്ക് (hit rate) രേഖപ്പെടുത്തി. ഇത് മനുഷ്യർ നടത്തുന്ന ലാബുകളിൽ സാധാരണയായി കാണാറുള്ള 10-15% വിജയനിരക്കിനേക്കാൾ കൂടുതലും, ഒരേ ലക്ഷ്യത്തിനായി നടത്തിയ സമാന്തരമായ മനുഷ്യപ്രയത്നത്തേക്കാൾ മികച്ചതുമാണ്. ഒരു വലിയതും കൃത്യമായി തയ്യാറാക്കിയതുമായ ഒരു പ്രോംപ്റ്റ് (prompt), ഒരു ലാംഗ്വേജ് മോഡലിനെ ഒരു വെർച്വൽ ബയോടെക് വർക്ക്ഫ്ലോയായി മാറ്റാൻ കഴിയുമെന്ന് ഈ ഫലം കാണിച്ചുതരുന്നു. എന്നാൽ മോഡലിന്റെ കോൺഫിഡൻസ് മെട്രിക്സുകൾ (confidence metrics) തെറ്റായിപ്പോകുമ്പോൾ ആ സമീപനം എത്രത്തോളം ദുർബലമാണെന്നും ഇത് എടുത്തുകാണിക്കുന്നു.
കണക്കുകളിലെ പരീക്ഷണം
Anthropic അതിന്റെ Claude മോഡലിന് ഒരു പൂർണ്ണമായ പ്രോട്ടീൻ ഡിസൈൻ പ്രോട്ടോക്കോളും നിശ്ചിത GPU ബജറ്റും നൽകി, തുടർന്ന് 16 പ്രോട്ടീൻ ടാർഗെറ്റുകളിൽ എൻഡ്-ടു-എൻഡ് ക്യാമ്പയിൻ നടത്താൻ അനുവദിച്ചു. ലാബ് പരാജയപ്പെട്ടതിനെത്തുടർന്ന് ഒരു ടാർഗെറ്റ് ഒഴിവാക്കി, അങ്ങനെ 15 വിജയകരമായ ക്യാമ്പയിനുകൾ അവശേഷിച്ചു. അവയിൽ നിന്ന് Claude 1,320 ഉദ്യോഗാർത്ഥി സീക്വൻസുകൾ (candidate sequences) നിർമ്മിച്ചു; ലാബ് പരിശോധനയിൽ 354 എണ്ണം യഥാർത്ഥ ബൈൻഡറുകളാണെന്ന് സ്ഥിരീകരിക്കപ്പെട്ടു, ഇത് 26.8% വിജയനിരക്ക് നൽകുന്നു.
താരതമ്യേന, മനുഷ്യർ നയിക്കുന്ന ഭൂരിഭാഗം ബൈൻഡർ പ്രോജക്റ്റുകളും 10% നും 15% നും ഇടയിലുള്ള വിജയനിരക്കാണ് റിപ്പോർട്ട് ചെയ്യുന്നത്. RBX1 ടാർഗെറ്റിൽ നേരിട്ടുള്ള മത്സരത്തിൽ, മനുഷ്യ പങ്കാളികൾ 3.7% വിജയനിരക്ക് കൈവരിച്ചപ്പോൾ Claude-ന്റെ ഡിസൈനുകൾ 31.1% വിജയിച്ചു. മോഡലിന് സ്വയം റാങ്ക് ചെയ്യാനുള്ള (self-ranking) ശേഷിയുമുണ്ടെന്ന് തെളിയിക്കപ്പെട്ടു: Claude ഏറ്റവും മികച്ചതെന്ന് അടയാളപ്പെടുത്തിയ ഒരൊറ്റ ഡിസൈൻ 49% തവണ വിജയിച്ചു, ആദ്യ പത്ത് ഡിസൈനുകൾ 39% തവണ വിജയിച്ചു.
സിസ്റ്റം പരാജയപ്പെട്ട ഇടങ്ങൾ
ഈ കണക്കുകൾ രണ്ട് വലിയ പോരായ്മകളെ മറച്ചുവെക്കുന്നുണ്ട്. MBP ടാർഗെറ്റിൽ Claude പൂർണ്ണമായും പരാജയപ്പെടുകയും TNFα ടാർഗെറ്റിൽ മോശം പ്രകടനം കാഴ്ചവെക്കുകയും ചെയ്തു, എന്നിരുന്നാലും അവയുടെ ആന്തരിക കോൺഫിഡൻസ് സ്കോറുകൾ ഉയർന്ന നിലയിൽ തുടർന്നു. മറ്റൊരു വിധത്തിൽ പറഞ്ഞാൽ, വെറ്റ്-ലാബ് (wet-lab) ഫലങ്ങൾ വിപരീതമായിരിക്കുമ്പോഴും താൻ വിജയിക്കുകയാണെന്ന് മോഡൽ വിശ്വസിച്ചു. തെറ്റായ ഈ സിഗ്നലുകൾ ഒരു അപകടസാധ്യത വെളിപ്പെടുത്തുന്നു: സ്വന്തം മെട്രിക്സുകളെ വിശ്വസിക്കുന്ന ഒരു സ്വയംഭരണാധികാര പൈപ്പ്ലൈൻ, ഫലമില്ലാത്ത പരീക്ഷണങ്ങൾക്കായി വിഭവങ്ങൾ പാഴാക്കാൻ ഇടയാക്കും.
പ്രോംപ്റ്റ് എഞ്ചിനീയറിംഗ്: പുതിയ ലാബ് നോട്ട്ബുക്ക്
ഈ പഠനത്തിലെ ഏറ്റവും ശ്രദ്ധേയമായ വശം ബയോളജി അല്ല, മറിച്ച് അതിനെ നയിച്ച പ്രോംപ്റ്റ് ആണ്. ഏത് പ്രോട്ടീൻ മേഖലകൾ പര്യവേക്ഷണം ചെയ്യണം, ഏത് കമ്പ്യൂട്ടേഷണൽ ടൂളുകൾ ഉപയോഗിക്കണം, കമ്പ്യൂട്ട് സമയം എങ്ങനെ വിനിയോഗിക്കണം എന്നിവ തീരുമാനിക്കാൻ ഒരു മുതിർന്ന ശാസ്ത്രജ്ഞൻ സാധാരണയായി ആഴ്ചകൾ ചെലവഴിക്കുന്നു. Anthropic ആ വൈദഗ്ധ്യത്തെ ഒരു ചെറിയ നോവലിന്റെ ദൈർഘ്യമുള്ള 16,000 വാക്കുകളുള്ള ഒരു പ്രോംപ്റ്റിലേക്ക് ചുരുക്കി. ഇതിൽ മൂന്നിൽ രണ്ട് ഭാഗവും പ്രവർത്തനപരമായ കാര്യങ്ങളുമായിരുന്നു: സമയം ക്രമീകരിക്കുക, ബജറ്റ് നിരീക്ഷിക്കുക, ബാഹ്യ സോഫ്റ്റ്വെയറുകൾ ഉപയോഗിക്കുന്ന സബ്-ഏജന്റുകളെ (sub-agents) നിയന്ത്രിക്കുക എന്നിവയായിരുന്നു അവ.
Claude, RFdiffusion (ഒരു ഡിഫ്യൂഷൻ അധിഷ്ഠിത സ്ട്രക്ചർ ജനറേറ്റർ), ProteinMPNN (ഒരു സീക്വൻസ് ഡിസൈൻ നെറ്റ്വർക്ക്) തുടങ്ങിയ ഓപ്പൺ സോഴ്സ് ഡിസൈൻ എഞ്ചിനുകളെ ഉപയോഗിച്ചു. ലാംഗ്വേജ് മോഡൽ ഒരു ഷെഡ്യൂളർ (scheduler) ആയി പ്രവർത്തിച്ചു, ഈ ടൂളുകൾക്കിടയിൽ ഇടക്കാല ഫലങ്ങൾ കൈമാറുകയും, പാരാമീറ്ററുകൾ ക്രമീകരിക്കുകയും, ഒരു ഡിസൈൻ സൈക്കിൾ എപ്പോൾ നിർത്തണമെന്ന് തീരുമാനിക്കുകയും ചെയ്തു. ഫലത്തിൽ, പ്രോംപ്റ്റ് ഒരു വെർച്വൽ ലബോറട്ടറി മാനേജറായി മാറുകയും, വർക്ക്ഫ്ലോ ഏകോപനത്തിന്റെ സൂക്ഷ്മമായ ജോലികളിൽ നിന്ന് മനുഷ്യ ശാസ്ത്രജ്ഞരെ മോചിപ്പിക്കുകയും ചെയ്തു.
ബൈൻഡറുകൾ യഥാർത്ഥത്തിൽ എന്താണ്?
സ്ഥിരീകരിച്ച 354 ഹിറ്റുകളും അവയുടെ ടാർഗെറ്റ് പ്രോട്ടീനുകളുമായി ശാരീരികമായി ഒട്ടിപ്പിടിക്കുന്ന തന്മാത്രകളാണ്. പേപ്പർ ബൈൻഡിംഗ് അസ്സേകളെക്കുറിച്ച് (binding assays) റിപ്പോർട്ട് ചെയ്യുന്നുണ്ടെങ്കിലും ഫങ്ഷണൽ ഡാറ്റ (functional data) നൽകുന്നില്ല—അതായത് ഏതെങ്കിലും ബൈൻഡർ പ്രവർത്തനങ്ങളെ നിയന്ത്രിക്കുന്നുണ്ടെന്നോ, ഒരു കോൺഫോർമേഷൻ സ്ഥിരപ്പെടുത്തുന്നുണ്ടെന്നോ, അല്ലെങ്കിൽ ചികിത്സാപരമായ സാധ്യത പ്രകടിപ്പിക്കുന്നുണ്ടെന്നോ ഉള്ള തെളിവുകളില്ല. അതുപോലെ തന്നെ, സ്ട്രക്ചറൽ വാലിഡേഷൻ (ഉദാഹരണത്തിന്, X-ray crystallography അല്ലെങ്കിൽ cryo-EM) ലഭ്യമല്ല, അതിനാൽ കൃത്യമായ ബൈൻഡിംഗ് രീതി ഊഹങ്ങൾ മാത്രമാണ്. അതിനാൽ, ഈ ക്യാമ്പയിൻ വേഗത്തിലുള്ള ബൈൻഡർ കണ്ടെത്തലിനുള്ള ഒരു പ്രൂഫ്-ഓഫ്-കോൺസെപ്റ്റ് (proof-of-concept) മാത്രമാണ്, മറിച്ച് മരുന്ന് ഉദ്യോഗാർത്ഥികളെ (drug candidates) നൽകുന്ന ഒരു പൈപ്പ്ലൈൻ അല്ല.
ബയോടെക്, AI ഗവേഷണങ്ങൾ നേരിടുന്ന വെല്ലുവിളികൾ
പ്രോംപ്റ്റ് അധിഷ്ഠിത മോഡലിന് മനുഷ്യരുടെ വിജയനിരപ്പ് വിശ്വസനീയമായി പുനരാവിഷ്കരിക്കാനോ അതിനേക്കാൾ മികച്ചതാക്കാനോ കഴിയുമെങ്കിൽ, ബയോടെക് കമ്പനികൾക്ക് ആദ്യഘട്ട കണ്ടെത്തലുകളുടെ ചിലവും സമയവും കുറയ്ക്കാൻ കഴിയും. എന്നിരുന്നാലും, MBP, TNFα എന്നിവയിലെ തെറ്റായ കോൺഫിഡൻസ് സ്കോറുകൾ കാണിക്കുന്നത് പൂർണ്ണമായും മനുഷ്യസഹായമില്ലാത്ത ഒരു സിസ്റ്റം ഇനിയും പ്രൊഡക്ഷന് തയ്യാറല്ല എന്നാണ്. കോൺഫിഡൻസ് മെട്രിക്സുകൾ വ്യാഖ്യാനിക്കാനും ഫങ്ഷണൽ പ്രസക്തി പരിശോധിക്കാനും കമ്പനികൾക്ക് ഇപ്പോഴും മനുഷ്യ മേൽനോട്ടം ആവശ്യമായി വരും.
AI കാഴ്ചപ്പാടിൽ, ഈ പ്രവർത്തനം "ടൂൾ" (tool), "ഏജന്റ്" (agent) എന്നിവ തമ്മിലുള്ള അതിർവരമ്പുകൾ ഇല്ലാതാക്കുന്നു. Claude എന്നത് പുതിയൊരു പ്രോട്ടീൻ ഡിസൈൻ അൽഗോരിതമല്ല; മറിച്ച് മതിയായ നിർദ്ദേശങ്ങൾ നൽകിയാൽ നിലവിലുള്ള പ്രത്യേക ടൂളുകളെ ഏകോപിപ്പിക്കാൻ കഴിയുന്ന ഒരു ജനറൽ പർപ്പസ് ലാംഗ്വേജ് മോഡലാണ്. ഒരു ഘടകത്തെ മാറ്റിസ്ഥാപിക്കുന്നതിന് പകരം, ഓപ്പൺ സോഴ്സ് ശാസ്ത്രീയ സോഫ്റ്റ്വെയറുകളുടെ ഒരു മൊഡുലാർ ഇക്കോസിസ്റ്റത്തെ ഒന്നിപ്പിക്കുന്ന ഒരു പശയായി (glue) AI പ്രവർത്തിക്കുന്ന ഒരു ഭാവിയിലേക്കാണ് ഈ പരീക്ഷണം വിരൽ ചൂണ്ടുന്നത്.
വിപരീത വാദം: പ്രോംപ്റ്റ് സങ്കീർണ്ണതയുടെ മറഞ്ഞിരിക്കുന്ന ചിലവ്
ഈ പഠനം 16,000 വാക്കുകളുള്ള പ്രോംപ്റ്റിനെ അറിവിന്റെ വിജയമായി വാഴ്ത്തുമ്പോഴും, ആ പ്രോംപ്റ്റിന്റെ വലിപ്പം പ്രായോഗികമായ ആശങ്കകൾ ഉയർത്തുന്നു. ഇത്തരമൊരു രേഖ തയ്യാറാക്കുന്നതിന് ആഴത്തിലുള്ള ഡൊമെയ്ൻ വൈദഗ്ധ്യവും (domain expertise), ഉപയോഗിക്കുന്ന ടൂളുകളെക്കുറിച്ചുള്ള അറിവും, അപ്രതീക്ഷിത സാഹചര്യങ്ങളെ മുൻകൂട്ടി കാണാനുള്ള കഴിവും ആവശ്യമാണ്. മറ്റൊരു വിധത്തിൽ പറഞ്ഞാൽ, വൈദഗ്ധ്യം ഇല്ലാതായിട്ടില്ല—അത് ലാബിലെ ശാസ്ത്രജ്ഞരിൽ നിന്ന് പ്രോംപ്റ്റ് എഞ്ചിനീയർമാരിലേക്ക് മാറി എന്ന് മാത്രം.
കൂടാതെ, ഒരു നിശ്ചിത GPU ബജറ്റിലുള്ള ആശ്രയത്വം പര്യവേക്ഷണത്തിന്റെ ആഴത്തിന്മേൽ (exploration depth) ഒരു കടുത്ത നിയന്ത്രണം ഏർപ്പെടുത്തുന്നു. ഇടക്കാല ഫലങ്ങളുടെ അടിസ്ഥാനത്തിൽ വിഭവങ്ങൾ ചലനാത്മകമായി പുനർവിന്യസിക്കാൻ മനുഷ്യസംഘങ്ങൾക്ക് കഴിയും, എന്നാൽ Claude-ന്റെ കാമ്പെയ്ൻ മുൻകൂട്ടി നിശ്ചയിച്ച ഒരു ബജറ്റിന് വിധേയമായിരുന്നു, ഇത് സാമ്പിൾ ചെയ്ത സീക്വൻസ് സ്പേസിന്റെ വ്യാപ്തിയെ പരിമിതപ്പെടുത്തിയേക്കാം.
അടുത്തതായി ശ്രദ്ധിക്കേണ്ടവ
Anthropic-ന്റെ ഗവേഷണ പ്രബന്ധം നിരവധി ചോദ്യങ്ങൾ അവശേഷിപ്പിക്കുന്നു. മോഡലിന്റെ സ്വയം വിലയിരുത്തൽ പരീക്ഷണ ഫലങ്ങളുമായി പൊരുത്തപ്പെടുന്ന രീതിയിൽ കോൺഫിഡൻസ് കാലിബ്രേഷൻ (confidence calibration) ഭാവിയിലെ പ്രവർത്തനങ്ങളിൽ പരിഗണിക്കേണ്ടതുണ്ട്. എൻസൈമാറ്റിക് ഇൻഹിബിഷൻ അല്ലെങ്കിൽ സെല്ലുലാർ ആക്റ്റിവിറ്റി പോലുള്ള ഫങ്ഷണൽ അസ്സേകൾ (functional assays) ഓട്ടോണമസ് ലൂപ്പിൽ ഉൾപ്പെടുത്തുന്നത്, സാങ്കേതികവിദ്യയെ വെറും ബൈൻഡർ തിരിച്ചറിയലിൽ നിന്ന് മരുന്ന് കണ്ടുപിടുത്തത്തിലേക്ക് (drug discovery) കൂടുതൽ അടുപ്പിക്കും. അവസാനമായി, വിവിധ ബജറ്റ് സാഹചര്യങ്ങളിൽ കൂടുതൽ ലക്ഷ്യങ്ങൾക്കായി ഈ രീതി ബെഞ്ച്മാർക്ക് ചെയ്യുന്നത്, നിരീക്ഷിച്ച ഹിറ്റ് റേറ്റ് പുനരാവർത്തിക്കാവുന്നതാണോ അതോ ഒരു ഔട്ട്ലയർ ആണോ എന്ന് വെളിപ്പെടുത്തും.
ഇതിലെ പ്രധാന പാഠം വ്യക്തമാണ്: വിശദമായ പ്രോംപ്റ്റ് ഓർക്കസ്ട്രേഷൻ (prompt orchestration) ഒരു ലാംഗ്വേജ് മോഡലിനെ ഒരു വെർച്വൽ ബയോടെക് ലാബായി മാറ്റാൻ സഹായിക്കും, ഇത് മനുഷ്യശരാശരിയേക്കാൾ ഉയർന്ന ബൈൻഡർ ഹിറ്റ് റേറ്റ് നൽകുന്നു. എന്നിരുന്നാലും, ഈ രീതി ഇപ്പോഴും വിദഗ്ധരായ പ്രോംപ്റ്റ് രചയിതാക്കളെ ആശ്രയിച്ചിരിക്കുന്നു, കൂടാതെ ചെലവേറിയ പരീക്ഷണങ്ങളെ തകിടം മറിച്ചേക്കാവുന്ന കോൺഫിഡൻസ് പിഴവുകൾ (confidence misfires) ഇതിനുണ്ട്. കമ്മ്യൂണിറ്റി ഈ പൈപ്പ്ലൈനുകൾ പരിഷ്കരിക്കുന്തോറും, AI ഓട്ടോണമിയും മനുഷ്യ മേൽനോട്ടവും തമ്മിലുള്ള സന്തുലിതാവസ്ഥ, ഇത്തരം സംവിധാനങ്ങൾ സാധാരണ ഉപകരണങ്ങളായി മാറുമോ അതോ പരീക്ഷണാത്മകമായ കൗതുകങ്ങളായി അവശേഷിക്കുമോ എന്ന് തീരുമാനിക്കും.
