Kampeni ya Claude ya kiotomatiki ya kutafuta viunganishi vya protini (protein-binders) ilirekodi kiwango cha mafanikio cha 27%, ikizidi kiwango cha kawaida cha 10-15% cha maabara zinazoendeshwa na binadamu na kuipita juhudi sambamba ya binadamu kwenye lengo lile lile. Matokeo haya yanaonyesha kuwa prompt kubwa na iliyoundwa vyema inaweza kuigeuza modeli ya lugha kuwa mtiririko wa kazi wa kibayoteknolojia wa kidijitali, lakini pia yanaangazia jinsi mbinu hiyo inavyobaki kuwa dhaifu wakati vipimo vya ujasiri vya modeli vinapokosea.
Majaribio kwa namba
Anthropic ilimpa modeli yake ya Claude itifaki kamili ya usanifu wa protini na bajeti maalum ya GPU, kisha ikaiacha ifanye kampeni kuanzia mwanzo hadi mwisho kwenye malengo 16 ya protini. Lengo moja liliachwa baada ya kushindwa upande wa maabara, na kuacha kampeni 15 zinazoweza kufanyika. Kutokana na hizo, Claude ilizalisha mfuatano 1,320 za kipaumbele (candidate sequences); majaribio ya maabara yalithibitisha 354 kama viunganishi halisi, ikitoa kiwango cha mafanikio cha 26.8%.
Kwa kulinganisha, miradi mingi ya viunganishi inayoongozwa na binadamu inaripoti viwango vya mafanikio kati ya 10% na 15%. Katika shindano la moja kwa moja kwenye lengo la RBX1, washiriki wa kibinadamu walifikia kiwango cha mafanikio cha 3.7% huku usanifu wa Claude ukifikia 31.1%. Modeli hiyo pia ilithibitisha uwezo wa kujipanga mwenyewe: usanifu mmoja tu ambao Claude aliutaja kama bora zaidi ulifanikiwa kwa 49% ya wakati, na usanifu kumi bora zaidi ulifanikiwa kwa 39% ya wakati.
Pale ambapo mfumo ulishindwa
Namba hizo zinaficha mapungufu makubwa mawili. Claude ilishindwa kabisa kwenye lengo la MBP na ilifanya vibaya kwenye lengo la TNFα, lakini bado alama zake za ndani za ujasiri zilikuwa juu kwa majaribio hayo. Kwa maneno mengine, modeli ilikuwa na hakika kuwa ilikuwa ikifanikiwa wakati matokeo ya wet-lab yalitoa simulizi tofauti. Ishara hizo zisizopimwa kwa usahihi zinaonyesha hatari: mtiririko wa kazi wa kiotomatiki unaoamini vipimo vyake wenyewe unaweza kupoteza rasilimali kwenye majaribio yasiyo na matokeo.
Uhandisi wa prompt kama daftari jipya la maabara
Upande wa kusisimua zaidi wa utafiti huu si biolojia bali ni prompt iliyoiongoza. Mwanasayansi mwandamizi kwa kawaida hutumia wiki kadhaa kuamua ni maeneo gani ya protini ya kuchunguza, ni zana gani za kikokotozi za kutumia, na jinsi ya kutenga muda wa kukokotoa. Anthropic ilidhibiti utaalamu huo katika prompt yenye maneno 16,000—takriban urefu wa riwaya fupi. Takriban sehemu mbili ya tatu ya maandishi hayo yalijihusisha na masuala ya kiutendaji: muda, ufuatiliaji wa bajeti, na kuratibu sub-agents zilizotumia programu za nje.
Claude ilitumia injini za usanifu za chanzo huru kama vile RFdiffusion (injini ya kutengeneza muundo inayotumia mbinu ya diffusion) na ProteinMPNN (mtandao wa usanifu wa mfuatano). Modeli ya lugha ilifanya kazi kama mpangaji ratiba (scheduler), ikipitisha matokeo ya kati kati ya zana hizi, ikirekebisha vigezo, na kuamua wakati wa kusitisha mzunguko wa usanifu. Kwa kiasi fulani, prompt hiyo ikawa meneja wa maabara wa kidijitali, ikiewapunguzia wanasayansi binadamu mzigo wa uratibu wa mambo madogo madogo ya mtiririko wa kazi.
Viunganishi hivi ni nini hasa
Mafanikio yote 354 yaliyothibitishwa ni molekuli ambazo huungana kimwili na protini zake lengo. Makala yanaripoti majaribio ya uunganishaji (binding assays) lakini hayatoi data za utendaji—hakuna ushahidi kwamba kiunganishi chochote kinarekebisha shughuli, kinaimarisha muundo (conformation), au kinaonyesha uwezo wa matibabu. Vivyo hivyo, uhakiki wa muundo (kama vile X-ray crystallography au cryo-EM) haupo, hivyo namna kamili ya uunganishaji inabaki kuwa ya kukisia. Kwa hivyo, kampeni hii inadhihirisha uthibitisho wa dhana (proof-of-concept) kwa ugunduzi wa haraka wa viunganishi, na si mtiririko wa kazi unaotoa dawa zinazoweza kutumika.
Athari kwa bioteknolojia na utafiti wa AI
Ikiwa modeli inayoendeshwa na prompt inaweza kuiga au kuzidi viwango vya mafanikio vya binadamu kwa uhakika, makampuni ya bioteknolojia yanaweza kupunguza kwa kiasi kikubwa gharama na muda wa ugunduzi wa hatua za awali. Hata hivyo, alama zisizopimwa kwa usahihi za ujasiri kwenye MBP na TNFα zinaonyesha kuwa mfumo unaojiendesha kabisa bado hauko tayari kwa uzalishaji. Makampuni bado yatahitaji usimamizi wa binadamu ili kutafsiri vipimo vya ujasiri na kuhakiki umuhimu wa utendaji.
Kutoka mtazamo wa AI, kazi hii inapunguza mpaka kati ya "zana" na "agent". Claude si algorithm mpya ya usanifu wa protini; ni modeli ya lugha ya matumizi ya jumla inayoweza kuratibu zana maalum zilizopo wakati ikipewa seti ya maelekezo ya kina ya kutosha. Jaribio hili linashiria mustakabali ambapo AI inafanya kazi kama kiungo kinachounganish
Zaidi ya hayo, utegemezi wa bajeti maalum ya GPU huleta kizuizi kikubwa katika kina cha uchunguzi. Timu za binadamu zinaweza kugawanya upya rasilimali kwa njia ya mabadiliko kulingana na matokeo ya muda, wakati kampeni ya Claude ilizingatia bajeti iliyopangwa mapema, jambo ambalo linaweza kuwa limezuia upana wa nafasi ya mfuatano (sequence space) iliyochunguzwa.
Nini cha kufuatilia baadaye
Makala ya Anthropic inaacha maswali kadhaa ambayo hayajajibiwa. Kazi za baadaye zitahitaji kushughulikia urekebishaji wa ujasiri (confidence calibration) ili tathmini ya binafsi ya modeli iendane na matokeo ya majaribio. Kuunganisha uchunguzi wa utendaji (functional assays)—kama vile kuzuia vimeng'enya (enzymatic inhibition) au shughuli za seli—katika mzunguko wa kiotomatiki kutaleta teknolojia hii karibu zaidi na ugunduzi wa dawa badala ya utambuzi wa binder pekee. Hatimaye, kulinganisha (benchmarking) mbinu hii katika seti pana zaidi ya malengo (targets) na chini ya hali tofauti za bajeti kutafichua ikiwa kiwango cha mafanikio (hit rate) kilichoonekana kinaweza kurudiwa au ni cha kipekee tu (outlier).
Hitimisho ni wazi: uongozaji wa kina wa prompt (prompt orchestration) unaweza kugeuza modeli ya lugha kuwa maabara ya kibayoteknolojia ya kidijitali, ikitoa viwango vya mafanikio vya binder vinavyozidi wastani wa binadamu. Hata hivyo, mbinu hii bado inategemea uandishi wa kitaalamu wa prompt na inakumbwa na makosa ya ujasiri (confidence misfires) ambayo yanaweza kuvuruga majaribio ya gharama kubwa. Wakati jamii inapoboresha mifumo hii (pipelines), uwiano kati ya uhuru wa AI na uangalizi wa binadamu utaamua ikiwa mifumo kama hiyo itakuwa zana za kawaida au itabaki kuwa vitu vya kustaajabisha vya majaribio tu.
