Claude యొక్క స్వయంప్రతిపత్తి కలిగిన ప్రోటీన్-బైండర్ క్యాంపెయిన్ 27% హిట్ రేటును నమోదు చేసింది, ఇది మానవ నిర్వహణ ల్యాబ్లలో సాధారణంగా ఉండే 10-15% కంటే మెరుగ్గా ఉంది మరియు అదే లక్ష్యంపై జరిగిన సమాంతర మానవ ప్రయత్నాన్ని అధిగమించింది. ఒక భారీ, చక్కగా రూపొందించబడిన ప్రాంప్ట్ ఒక లాంగ్వేజ్ మోడల్ను వర్చువల్ బయోటెక్ వర్క్ఫ్లోగా మార్చగలదని ఈ ఫలితం చూపుతోంది, అయితే మోడల్ యొక్క కాన్ఫిడెన్స్ మెట్రిక్స్ తప్పుగా ఉన్నప్పుడు ఆ విధానం ఎంత బలహీనంగా ఉంటుందో కూడా ఇది నొక్కి చెబుతోంది.
గణాంకాల ప్రకారం ప్రయోగం
Anthropic తన Claude మోడల్కు పూర్తి స్థాయి ప్రోటీన్ డిజైన్ ప్రోటోకాల్ మరియు నిర్ణీత GPU బడ్జెట్ను ఇచ్చింది, ఆపై 16 ప్రోటీన్ టార్గెట్లపై ఎండ్-టు-ఎండ్ క్యాంపెయిన్ను నడపడానికి అనుమతించింది. ల్యాబ్ వైపు వైఫల్యం కారణంగా ఒక టార్గెట్ను తొలగించగా, 15 సాధ్యమయ్యే క్యాంపెయిన్లు మిగిలాయి. వాటి నుండి Claude 1,320 అభ్యర్థి సీక్వెన్సులను రూపొందించింది; ప్రయోగశాల పరీక్షలు 354లను నిజమైన బైండర్లుగా ధృవీకరించాయి, దీనివల్ల 26.8% విజయ రేటు లభించింది.
పోలిక కోసం చూస్తే, మానవ నేతృత్వంలోని మెజారిటీ బైండర్ ప్రాజెక్టులు 10% నుండి 15% మధ్య హిట్ రేట్లను నివేదిస్తాయి. RBX1 టార్గెట్పై జరిగిన ప్రత్యక్ష పోలికలో, మానవ పాల్గొనేవారు 3.7% హిట్ రేటును సాధించగా, Claude యొక్క డిజైన్లు 31.1% హిట్ రేటును సాధించాయి. మోడల్ స్వయంగా ర్యాంకింగ్ చేయగల సామర్థ్యాన్ని కూడా నిరూపించుకుంది: Claude తన ఉత్తమమైనదిగా గుర్తించిన ఏకైక డిజైన్ 49% సార్లు విజయవంతమైంది, మరియు మొదటి పది డిజైన్లు 39% సార్లు విజయవంతమయ్యాయి.
వ్యవస్థ ఎక్కడ విఫలమైంది
ఈ గణాంకాలు రెండు స్పష్టమైన లోపాలను దాచిపెట్టాయి. Claude, MBP టార్గెట్పై పూర్తిగా విఫలమైంది మరియు TNFα టార్గెట్పై తక్కువ పనితీరు కనబరిచింది, అయినప్పటికీ ఆ రన్ల కోసం దాని అంతర్గత కాన్ఫిడెన్స్ స్కోర్లు ఎక్కువగా ఉన్నాయి. మరో మాటలో చెప్పాలంటే, వెట్-ల్యాబ్ రీడౌట్లు వేరే కథ చెబుతున్నప్పటికీ, మోడల్ తాను విజయవంతమవుతున్నానని నమ్మింది. ఆ తప్పుగా అంచనా వేయబడిన సంకేతాలు ఒక ప్రమాదాన్ని వెల్లడిస్తున్నాయి: తన స్వంత మెట్రిక్స్ను నమ్మే స్వయంప్రతిపత్తి కలిగిన పైప్లైన్, నిష్ఫలమైన ప్రయోగాలపై వనరులను వృథా చేయవచ్చు.
కొత్త ల్యాబ్ నోట్బుక్గా ప్రాంప్ట్ ఇంజనీరింగ్
ఈ అధ్యయనం యొక్క అత్యంత ఆకర్షణీయమైన అంశం బయాలజీ కాదు, దానిని నడిపించిన ప్రాంప్ట్. ఒక సీనియర్ సైంటిస్ట్ సాధారణంగా ఏ ప్రోటీన్ ప్రాంతాలను అన్వేషించాలి, ఏ కంప్యూటేషనల్ టూల్స్ను ఉపయోగించాలి మరియు కంప్యూట్ సమయాన్ని ఎలా కేటాయించాలి అనే అంశాలను నిర్ణయించడానికి వారాల సమయం తీసుకుంటారు. Anthropic ఆ నైపుణ్యాన్ని 16,000 పదాల ప్రాంప్ట్లోకి కుదించింది—ఇది సుమారుగా ఒక చిన్న నవల పొడవుతో సమానం. టెక్స్ట్లోని సుమారు మూడింట రెండు వంతులు కార్యాచరణ అంశాలకు సంబంధించినవి: టైమింగ్, బడ్జెట్ మానిటరింగ్ మరియు బాహ్య సాఫ్ట్వేర్లను పిలిచే సబ్-ఏజెంట్ల సమన్వయం.
Claude, RFdiffusion (ఒక డిఫ్యూజన్-ఆధారిత స్ట్రక్చర్ జనరేటర్) మరియు ProteinMPNN (ఒక సీక్వెన్స్ డిజైన్ నెట్వర్క్) వంటి ఓపెన్-సోర్స్ డిజైన్ ఇంజన్లను ఉపయోగించింది. లాంగ్వేజ్ మోడల్ ఒక షెడ్యూలర్గా వ్యవహరించింది, ఈ టూల్స్ మధ్య మధ్యంతర ఫలితాలను అందించడం, పారామితులను సర్దుబాటు చేయడం మరియు డిజైన్ సైకిల్ను ఎప్పుడు ఆపాలో నిర్ణయించడం వంటివి చేసింది. వాస్తవానికి, ఆ ప్రాంప్ట్ ఒక వర్చువల్ లాబొరేటరీ మేనేజర్గా మారింది, దీనివల్ల మానవ శాస్త్రవేత్తలు వర్క్ఫ్లో సమన్వయంలోని సూక్ష్మ అంశాల నుండి విముక్తి పొందారు.
బైండర్లు నిజానికి ఏమిటి
ధృవీకరించబడిన 354 హిట్లన్నీ వాటి టార్గెట్ ప్రోటీన్లకు భౌతికంగా అతుక్కునే అణువులు. ఈ పేపర్ బైండింగ్ అసేల గురించి నివేదిస్తుంది కానీ ఫంక్షనల్ డేటాను అందించదు—ఏ బైండర్ అయినా క్రియాశీలతను క్రమబద్ధీకరించడం, కన్ఫర్మేషన్ను స్థిరీకరించడం లేదా చికిత్సా సామర్థ్యాన్ని ప్రదర్శించడం వంటి ఆధారాలు ఏవీ లేవు. అదేవిధంగా, స్ట్రక్చరల్ వాలిడేషన్ (ఉదాహరణకు, X-ray క్రిస్టలోగ్రఫీ లేదా cryo-EM) లేదు, కాబట్టి ఖచ్చితమైన బైండింగ్ మోడ్ ఊహ మాత్రమే. అందువల్ల, ఈ క్యాంపెయిన్ వేగవంతమైన బైండర్ ఆవిష్కరణకు ఒక ప్రూఫ్-ఆఫ్-కాన్సెప్ట్ను చూపుతుంది తప్ప, డ్రగ్ కాండిడేట్లను అందించే పైప్లైన్ కాదు.
బయోటెక్ మరియు AI పరిశోధనల ప్రాముఖ్యత
ప్రాంప్ట్-డ్రివెన్ మోడల్ నమ్మదగిన రీతిలో మానవ హిట్ రేట్లను పునరుత్పత్తి చేయగలిగితే లేదా అధిగమించగలిగితే, బయోటెక్ సంస్థలు ప్రారంభ దశ ఆవిష్కరణల ఖర్చు మరియు సమయాన్ని తగ్గించవచ్చు. అయితే, MBP మరియు TNFα పై తప్పుగా అంచనా వేయబడిన కాన్ఫిడెన్స్ స్కోర్లు, పూర్తిగా స్వయంప్రతిపత్తి కలిగిన వ్యవస్థ ఇంకా ఉత్పత్తి దశకు సిద్ధంగా లేదని వివరిస్తున్నాయి. కాన్ఫిడెన్స్ మెట్రిక్స్ను అర్థం చేసుకోవడానికి మరియు ఫంక్షనల్ రిలెవెన్స్ను ధృవీకరించడానికి కంపెనీలకు ఇంకా మానవ పర్యవేక్షణ అవసరమవుతుంది.
AI దృక్కోణం నుండి, ఈ పని "టూల్" మరియు "ఏజెంట్" మధ్య ఉన్న గీతను అస్పష్టం చేస్తుంది. Claude అనేది కొత్త ప్రోటీన్-డిజైన్ అల్గారిథమ్ కాదు; ఇది తగినంత వివరణాత్మక సూచనల సెట్ను ఇచ్చినప్పుడు ఇప్పటికే ఉన్న ప్రత్యేక టూల్స్ను సమన్వయం చేయగల ఒక జనరల్-పర్పస్ లాంగ్వేజ్ మోడల్. AI అనేది ఏదైనా ఒక విడి భాగాన్ని భర్తీ చేయడం కంటే, ఓపెన్-సోర్స్ సైంటిఫిక్ సాఫ్ట్వేర్ యొక్క మాడ్యులర్ ఎకోసిస్టమ్ను కలిపి ఉంచే గ్లూ (అతుకు) వలె పనిచేసే భవిష్యత్తును ఈ ప్రయోగం సూచిస్తోంది.
ప్రతిపాదనకు విరుద్ధంగా: ప్రాంప్ట్ సంక్లిష్టత యొక్క దాగి ఉన్న ఖర్చు
ఈ అధ్యయనం 16,000 పదాల ప్రాంప్ట్ను జ్ఞాన సేకరణ యొక్క విజయం అని ప్రకటించినప్పటికీ, ఆ ప్రాంప్ట్ పరిమాణం ప్రాక్టికల్ ఆందోళనలను కలిగిస్తుంది. అటువంటి పత్రాన్ని రూపొందించడానికి లోతైన డొమైన్ నైపుణ్యం, అంతర్లీన టూల్స్పై అవగాహన మరియు ఎడ్జ్ కేసులను ఊహించే సామర్థ్యం అవసరం. మరో మాటలో చెప్పాలంటే, నైపుణ్యం అంతరించిపోలేదు—అది బెంచ్ సైంటిస్టుల నుండి ప్రాంప్ట్ ఇంజనీర్ల వైపు మళ్లింది.
అంతేకాకుండా, స్థిరమైన GPU బడ్జెట్పై ఆధారపడటం అన్వేషణ లోతుపై ఒక కఠినమైన పరిమితిని విధిస్తుంది. మానవ బృందాలు మధ్యంతర ఫలితాల ఆధారంగా వనరులను డైనమిక్గా తిరిగి కేటాయించగలవు, అయితే Claude యొక్క ప్రక్రియ ముందుగా నిర్ణయించిన బడ్జెట్కు కట్టుబడి ఉంది, ఇది నమూనా సేకరించిన సీక్వెన్స్ స్పేస్ యొక్క వెడల్పును పరిమితం చేసే అవకాశం ఉంది.
తదుపరి ఏమి గమనించాలి
Anthropic యొక్క పరిశోధనా పత్రం కొన్ని అపరిష్కృత ప్రశ్నలను వదిలివేసింది. మోడల్ యొక్క స్వీయ అంచనా ప్రయోగాత్మక ఫలితాలతో సరిపోలేలా చేయడానికి, భవిష్యత్తు పరిశోధనలు కాన్ఫిడెన్స్ కాలిబ్రేషన్ను (confidence calibration) పరిష్కరించాల్సి ఉంటుంది. ఎంజైమాటిక్ ఇన్హిబిషన్ లేదా కణాల చర్య వంటి ఫంక్షనల్ అసేస్లను (functional assays) స్వయంప్రతిపత్తి కలిగిన లూప్లోకి చేర్చడం వల్ల, ఈ సాంకేతికత కేవలం బైండర్ గుర్తింపుకే పరిమితం కాకుండా ఔషధ ఆవిష్కరణకు (drug discovery) మరింత దగ్గరవుతుంది. చివరగా, వివిధ బడ్జెట్ పరిస్థితులలో మరియు విస్తృతమైన లక్ష్యాల (targets) పై ఈ విధానాన్ని బెంచ్మార్కింగ్ చేయడం ద్వారా, గమనించిన హిట్ రేట్ పునరుత్పత్తి చేయదగినదా లేదా అది ఒక అసాధారణ అంశమా (outlier) అనేది తెలుస్తుంది.
దీని సారాంశం స్పష్టంగా ఉంది: వివరణాత్మక ప్రాంప్ట్ ఆర్కెస్ట్రేషన్ (prompt orchestration) ఒక లాంగ్వేజ్ మోడల్ను వర్చువల్ బయోటెక్ ల్యాబ్గా మార్చగలదు, ఇది మానవ సగటు కంటే మెరుగైన బైండర్ హిట్ రేట్లను అందిస్తుంది. అయినప్పటికీ, ఈ విధానం ఇంకా నిపుణుల ప్రాంప్ట్ రచనపైనే ఆధారపడి ఉంది మరియు ఖరీదైన ప్రయోగాలను దెబ్బతీసే అవకాశం ఉన్న కాన్ఫిడెన్స్ లోపాలను (confidence misfires) కలిగి ఉంది. కమ్యూనిటీ ఈ పైప్లైన్లను మెరుగుపరిచే కొద్దీ, AI స్వయంప్రతిపత్తి మరియు మానవ పర్యవేక్షణ మధ్య సమతుల్యత ఈ వ్యవస్థలు సాధారణ సాధనాలుగా మారుతాయా లేదా కేవలం ప్రయోగాత్మక ఆసక్తికర అంశాలుగా మిగిలిపోతాయా అనేది నిర్ణయిస్తుంది.
