Claude-இன் தன்னாட்சி புரத-பிணைப்பாளர் (protein-binder) பிரச்சாரம் 27% வெற்றி விகிதத்தைப் (hit rate) பதிவு செய்துள்ளது. இது மனிதர்களால் இயக்கப்படும் ஆய்வகங்களின் வழக்கமான 10-15% வெற்றி விகிதத்தை விடவும், அதே இலக்கை நோக்கி மனிதர்கள் மேற்கொண்ட இணையான முயற்சியை விடவும் சிறப்பானது. ஒரு பிரம்மாண்டமான, நுணுக்கமாக வடிவமைக்கப்பட்ட ப்ராம்ப்ட் (prompt), ஒரு மொழி மாதிரியை (language model) ஒரு மெய்நிகர் உயிரித் தொழில்நுட்ப பணிப்பாய்வாக (virtual biotech workflow) மாற்ற முடியும் என்பதை இந்த முடிவு காட்டுகிறது; அதே சமயம், மாதிரியின் நம்பிக்கை அளவீடுகள் (confidence metrics) தவறாகும்போது அந்த அணுகுமுறை எவ்வளவு பலவீனமாக இருக்கும் என்பதையும் இது எடுத்துக்காட்டுகிறது.

எண்களின் அடிப்படையில் பரிசோதனை

Anthropic நிறுவனம் தனது Claude மாதிரிக்கு முழுமையான புரத வடிவமைப்பு நெறிமுறை (protein design protocol) மற்றும் ஒரு குறிப்பிட்ட GPU வரவுறுதியை (budget) வழங்கியது, பின்னர் 16 புரத இலக்குக across ஒரு முழுமையான பிரச்சாரத்தை நடத்த அனுமதித்தது. ஆய்வகத் தோல்வியின் காரணமாக ஒரு இலக்கு கைவிடப்பட்டது, இதனால் 15 சாத்தியமான பிரச்சாரங்கள் எஞ்சின. அவற்றிலிருந்து Claude 1,320 வேட்பாளர் தொடர்களை (candidate sequences) உருவாக்கியது; ஆய்வகச் சோதனைகள் 354 அவற்றை உண்மையான பிணைப்பாளர்களாக (true binders) உறுதிப்படுத்தின, இது 26.8% வெற்றி விகிதத்தைத் தந்தது.

ஒப்பீட்டிற்கு, மனிதத் தலைமையிலான பெரும்பாலான பிணைப்பாளர் திட்டங்கள் 10% முதல் 15% வரையிலான வெற்றி விகிதத்தைப் புகாரளிக்கின்றன. RBX1 இலக்கில் நேரடிப் போட்டியின் போது, மனிதப் பங்கேற்பாளர்கள் 3.7% வெற்றி விகிதத்தைப் பெற்றனர், அதே சமயம் Claude-இன் வடிவமைப்புகள் 31.1% வெற்றி பெற்றன. இந்த மாதிரி சுய-தரவரிசைப்படுத்தும் (self-ranking) திறனையும் நிரூபித்தது: Claude தனது சிறந்த வடிவமைப்பாகக் குறிப்பிட்ட ஒற்றை வடிவமைப்பு 49% நேரமும் வெற்றி பெற்றது, மேலும் முதல் பத்து வடிவமைப்புகள் 39% நேரமும் வெற்றி பெற்றன.

அமைப்பு எங்கே குறைவடைந்தது

இந்த எண்கள் இரண்டு தெளிவானக் குறைகளை மறைக்கின்றன. Claude, MBP இலக்கில் முற்றிலும் தோல்வியடைந்தது மற்றும் TNFα இலக்கில் மோசமாகச் செயல்பட்டது, இருப்பினும் அந்த ஓட்டங்களின் போது அதன் உள் நம்பிக்கை மதிப்பெண்கள் (internal confidence scores) உயர்வாகவே இருந்தன. வேறு வார்த்தைகளில் கூறுவதானால், ஆய்வக முடிவுகள் வேறொரு கதையைச் சொல்லும் போது, தான் வெற்றி பெற்று வருவதாக அந்த மாதிரி நம்பிக் கொண்டிருந்தது. அந்தத் தவறாகக் கணக்கிடப்பட்ட சமிக்ஞைகள் ஒரு ஆபத்தை வெளிப்படுத்துகின்றன: தனது சொந்த அளவீடுகளை நம்பும் ஒரு தன்னாட்சிப் பாதை (autonomous pipeline), பயனற்ற சோதனைகளில் வளங்களை வீணடிக்கக்கூடும்.

புதிய ஆய்வகக் குறிப்பேடாக ப்ராம்ப்ட் இன்ஜினியரிங் (Prompt engineering)

இந்த ஆய்வின் மிகவும் வியக்கத்தக்க அம்சம் உயிரியல் அல்ல, மாறாக அதை இயக்கிய ப்ராம்ப்ட் ஆகும். ஒரு மூத்த விஞ்ஞானி பொதுவாக எந்த புரதப் பகுதிகளை ஆராய வேண்டும், எந்தக் கணக்கீட்டு கருவிகளைப் பயன்படுத்த வேண்டும் மற்றும் கணக்கீட்டு நேரத்தை எவ்வாறு ஒதுக்கீடு செய்வது என்பதைத் தீர்மானிக்க வாரக்கணக்கில் செலவிடுவார். Anthropic அந்த நிபுணத்துவத்தை 16,000 சொற்கள் கொண்ட ஒரு ப்ராம்ப்ட்டில் சுருக்கியது—இது ஏறக்குறைய ஒரு சிறு நாவலின் நீளத்திற்குச் சமம். உரையின் மூன்றில் இரண்டு பங்கு செயல்பாட்டுத் தேவைகளைக் கையாண்டன: நேரம், வரவுறுதி கண்காணிப்பு மற்றும் வெளிப்புற மென்பொருள்களை அழைக்கும் துணை முகவர்களை (sub-agents) ஒருங்கிணைத்தல்.

Claude, RFdiffusion (ஒரு பரவல் அடிப்படையிலான அமைப்பு உருவாக்கி) மற்றும் ProteinMPNN (ஒரு தொடர் வடிவமைப்பு நெட்வொர்க்) போன்ற திறந்த மூல வடிவமைப்பு இயந்திரங்களை அழைத்தது. இந்த மொழி மாதிரி ஒரு திட்டமிடுபவராக (scheduler) செயல்பட்டு, இந்த கருவிகளுக்கு இடையே இடைநிலை முடிவுகளை அளித்தது, அளவுருக்களை (parameters) சரிசெய்தது மற்றும் ஒரு வடிவமைப்பு சுழற்சியை எப்போது நிறுத்த வேண்டும் என்பதைத் தீர்மானித்தது. நடைமுறையில், அந்த ப்ராம்ப்ட் ஒரு மெய்நிகர் ஆய்வக மேலாளராக மாறியது, இது பணிப்பாய்வு ஒருங்கிணைப்பின் நுணுக்கங்களிலிருந்து மனித விஞ்ஞானிகளை விடுவித்தது.

பிணைப்பாளர்கள் உண்மையில் என்ன

உறுதிப்படுத்தப்பட்ட 354 பிணைப்பாளர்களும் அவற்றின் இலக்கு புரதங்களுடன் உடல் ரீதியாகத் தங்களை இணைத்துக் கொள்ளும் மூலக்கூறுகள் ஆகும். இந்த ஆய்வறிக்கை பிணைப்பு ஆய்வுகளைப் (binding assays) புகாரளிக்கிறது, ஆனால் செயல்பாட்டுத் தரவை (functional data) வழங்கவில்லை—எந்தவொரு பிணைப்பாளர் செயல்பாட்டை மாற்றியமைக்கிறது, ஒரு அமைப்பை நிலைப்படுத்துகிறது அல்லது சிகிச்சைத் திறன் கொண்டது என்பதற்கான ஆதாரங்கள் இல்லை. அதேபோல், கட்டமைப்பு சரிபார்ப்பு (உதாரணமாக, X-ray crystallography அல்லது cryo-EM) இல்லை, எனவே துல்லியமான பிணைப்பு முறை ஊகமாகவே உள்ளது. எனவே, இந்த பிரச்சாரம் விரைவான பிணைப்பாளர் கண்டுபிடிப்பிற்கான ஒரு கருத்தியல் நிரூபணத்தை (proof-of-concept) மட்டுமே காட்டுகிறது, மருந்து வேட்பாளர்களை வழங்கும் ஒரு பாதையல்ல.

உயிரித் தொழில்நுட்பம் மற்றும் AI ஆராய்ச்சிக்கான முக்கியத்துவம்

இந்த ப்ராம்ப்ட் மூலம் இயக்கப்படும் மாதிரி, மனிதர்களின் வெற்றி விகிதத்தை நம்பகமான முறையில் மீண்டும் உருவாக்கினால் அல்லது விடலாம் என்றால், உயிரித் தொழில்நுட்ப நிறுவனங்கள் ஆரம்பக்கட்ட கண்டுபிடிப்புகளுக்கான செலவு மற்றும் நேரத்தைக் குறைக்க முடியும். இருப்பினும், MBP மற்றும் TNFα ஆகியவற்றில் தவறாகக் கணக்கிடப்பட்ட நம்பிக்கை மதிப்பெண்கள், முழுமையான தன்னாட்சி அமைப்பு இன்னும் பயன்பாட்டிற்குத் தயாராக இல்லை என்பதை விளக்குகின்றன. நம்பிக்கை அளவீடுகளைப் புரிந்துகொள்ளவும், செயல்பாட்டுத் தொடர்பை உறுதிப்படுத்தவும் நிறுவனங்களுக்கு இன்னும் மனித மேற்பார்வை தேவைப்படும்.

AI பார்வையில், இந்த வேலை "கருவி" (tool) மற்றும் "முகவர்" (agent) ஆகியவற்றிற்கு இடையிலான எல்லையை மங்கலாக்குகிறது. Claude என்பது ஒரு புதிய புரத வடிவமைப்பு அல்காரிதம் அல்ல; இது போதுமான விரிவான அறிவுறுத்தல் தொகுப்பைக் கொடுக்கப்பட்டால், ஏற்கனவே உள்ள சிறப்புத் கருவிகளை ஒருங்கிணைக்கக்கூடிய ஒரு பொது நோக்கத்திற்கான மொழி மாதிரி ஆகும். இந்தச் சோதனை, AI என்பது எந்த ஒரு தனிப்பகுதியையும் மாற்றுவதற்குப் பதிலாக, திறந்த மூல அறிவியல் மென்பொருள்களின் தொகுதியை ஒன்றிணைக்கும் ஒரு பிணைப்பாகச் செயல்படும் எதிர்காலத்தைக் காட்டுகிறது.

முரண்பாட்டு கருத்து: ப்ராம்ப்ட் சிக்கலின் மறைமுகச் செலவு

இந்த ஆய்வு 16,000 சொற்கள் கொண்ட ஒரு ப்ராம்ப்ட்டை அறிவுத் திரட்டலின் வெற்றியாகப் போற்றினாலும், அந்த ப்ராம்ப்ட்டின் அளவு நடைமுறைச் சிக்கல்களை எழுப்புகிறது. இத்தகைய ஆவணத்தை உருவாக்குவதற்கு ஆழமான துறை சார்ந்த நிபுணத்துவம், அடிப்படை கருவிகள் பற்றிய பரிச்சயம் மற்றும் விளிம்பு நிலைச் சூழல்களைக் (edge cases) கணிக்கும் திறன் தேவைப்படுகிறது. வேறு வார்த்தைகளில் கூறுவதானால், நிபுணத்துவம் மறைந்துவிடவில்லை—அது ஆய்வக விஞ்ஞானிகளிடமிருந்து ப்ராம்ப்ட் இன்ஜினியர்களிடம் இடம்பெயர்ந்துள்ளது.

Moreover, the reliance on a fixed GPU budget introduces a hard constraint on exploration depth. Human teams can reallocate resources dynamically based on interim results, whereas Claude’s campaign adhered to a pre-set budget, potentially limiting the breadth of sequence space sampled.

What to watch next

Anthropic’s paper leaves several open questions. Future work will need to address confidence calibration so that the model’s self-assessment aligns with experimental outcomes. Integrating functional assays—such as enzymatic inhibition or cellular activity—into the autonomous loop would move the technology closer to drug discovery rather than just binder identification. Finally, benchmarking the approach across a broader set of targets and under varying budget conditions will reveal whether the observed hit rate is reproducible or an outlier.

The takeaway is clear: detailed prompt orchestration can turn a language model into a virtual biotech lab, delivering binder hit rates that outstrip human averages. Yet the approach still hinges on expert prompt authorship and suffers from confidence misfires that could derail costly experiments. As the community refines these pipelines, the balance between AI autonomy and human oversight will determine whether such systems become routine tools or remain experimental curiosities.