کمپین خودگردان پیونددهنده پروتئین Claude به نرخ موفقیت ۲۷ درصدی دست یافت که از نرخ معمول ۱۰ تا ۱۵ درصدی آزمایشگاه‌های تحت مدیریت انسان فراتر رفته و از تلاش‌های انسانی موازی روی همان هدف نیز پیشی گرفته است. این نتیجه نشان می‌دهد که یک پرامپت عظیم و دقیق می‌تواند یک مدل زبانی را به یک گردش کار زیست‌فناوری مجازی تبدیل کند، اما در عین حال نشان می‌دهد که این رویکرد زمانی که معیارهای اطمینان مدل دچار خطا می‌شوند، تا چه حد شکننده باقی می‌ماند.

آزمایش در اعداد

Anthropic پروتکل طراحی پروتئین در مقیاس کامل و بودجه مشخصی از GPU را در اختیار مدل Claude خود قرار داد و سپس اجازه داد یک کمپین سرتاسری را روی ۱۶ هدف پروتئینی اجرا کند. یکی از اهداف پس از شکست در آزمایشگاه کنار گذاشته شد و ۱۵ کمپین قابل اجرا باقی ماند. از میان آن‌ها، Claude تعداد ۱,۳۲۰ توالی کاندید تولید کرد؛ آزمایش‌های آزمایشگاهی ۳۵۴ مورد را به عنوان پیونددهنده‌های واقعی تأیید کردند که منجر به نرخ موفقیت ۲۶.۸ درصدی شد.

برای مقایسه، اکثر پروژه‌های پیونددهنده تحت هدایت انسان، نرخ موفقیت بین ۱۰ تا ۱۵ درصد را گزارش می‌کنند. در یک رقابت مستقیم روی هدف RBX1، شرکت‌کنندگان انسانی به نرخ موفقیت ۳.۷ درصدی دست یافتند، در حالی که طراحی‌های Claude به ۳۱.۱ درصد رسید. این مدل همچنین توانایی خود-رتبه‌بندی را نشان داد: تنها طراحی‌ای که Claude به عنوان بهترین خود علامت‌گذاری کرده بود، ۴۹ درصد موفقیت داشت و ده طراحی برتر ۳۹ درصد موفقیت داشتند.

نقاط ضعف سیستم

اعداد دو نقطه کور آشکار را پنهان می‌کنند. Claude در هدف MBP کاملاً شکست خورد و در هدف TNFα عملکرد ضعیفی داشت، با این حال امتیازات اطمینان داخلی آن برای آن اجراها بالا باقی ماند. به عبارت دیگر، مدل متقاعد شده بود که در حال موفقیت است، در حالی که نتایج آزمایشگاه واقعی داستان متفاوتی را روایت می‌کردند. این سیگنال‌های کالیبره‌نشده یک خطر را آشکار می‌کنند: یک خط لوله خودگردان که به معیارهای خود اعتماد می‌کند، می‌تواند منابع را در آزمایش‌های بی‌نتیجه هدر دهد.

مهندسی پرامپت به عنوان دفترچه آزمایشگاه جدید

چشمگیرترین جنبه این مطالعه، بیولوژی نیست، بلکه پرامپتی است که آن را هدایت کرد. یک دانشمند ارشد معمولاً هفته‌ها وقت صرف می‌کند تا تصمیم بگیرد کدام نواحی پروتئین را بررسی کند، از کدام ابزارهای محاسباتی استفاده کند و زمان محاسبات را چگونه تخصیص دهد. Anthropic آن تخصص را در یک پرامپت ۱۶,۰۰۰ کلمه‌ای فشرده کرد—تقریباً به اندازه یک رمان کوتاه. حدود دو سوم متن به مسائل عملیاتی مربوط می‌شد: زمان‌بندی، نظارت بر بودجه و هماهنگی زیر-عامل‌هایی که نرم‌افزارهای خارجی را فراخوانی می‌کردند.

Claude موتورهای طراحی متن‌باز مانند RFdiffusion (یک مولد ساختار مبتنی بر انتشار) و ProteinMPNN (یک شبکه طراحی توالی) را فراخوانی کرد. مدل زبانی به عنوان یک زمان‌بند عمل کرد، نتایج میانی را بین این ابزارها جابجا کرد، پارامترها را تنظیم کرد و تصمیم گرفت چه زمانی یک چرخه طراحی را متوقف کند. در واقع، پرامپت به یک مدیر آزمایشگاه مجازی تبدیل شد و دانشمندان انسانی را از جزئیات خسته‌کننده هماهنگی گردش کار رها کرد.

پیونددهنده‌ها در واقع چه هستند

تمام ۳۵۴ مورد تأیید شده، مولکول‌هایی هستند که به طور فیزیکی به پروتئین‌های هدف خود متصل می‌شوند. مقاله سنجش‌های اتصال را گزارش می‌دهد اما داده‌های عملکردی ارائه نمی‌کند—هیچ شواهدی مبنی بر اینکه آیا پیونددهنده فعالیت را تعدیل می‌کند، یک کنفورماسیون را تثبیت می‌کند یا پتانسیل درمانی نشان می‌دهد، وجود ندارد. به همین ترتیب، اعتبارسنجی ساختاری (مانند بلورنگاری اشعه ایکس یا cryo-EM) وجود ندارد، بنابراین حالت دقیق اتصال در حد حدس و گمان باقی می‌ماند. بنابراین، این کمپین یک اثبات مفهوم برای کشف سریع پیونددهنده است، نه یک خط لوله که کاندیداهای دارویی ارائه می‌دهد.

مخاطرات برای زیست‌فناوری و تحقیقات هوش مصنوعی

اگر مدل مبتنی بر پرامپت بتواند به طور قابل اعتماد نرخ موفقیت انسان را بازتولید کند یا از آن فراتر رود، شرکت‌های زیست‌فناوری می‌توانند هزینه و زمان کشف در مراحل اولیه را به شدت کاهش دهند. با این حال، امتیازات اطمینان کالیبره‌نشده در MBP و TNFα نشان می‌دهد که یک سیستم کاملاً بدون دخالت انسان هنوز برای تولید آماده نیست. شرکت‌ها همچنان برای تفسیر معیارهای اطمینان و تأیید ارتباط عملکردی، به نظارت انسانی نیاز خواهند داشت.

از منظر هوش مصنوعی، این کار مرز بین «ابزار» و «عامل» را کمرنگ می‌کند. Claude یک الگوریتم جدید طراحی پروتئین نیست؛ بلکه یک مدل زبانی همه‌منظوره است که می‌تواند در صورت دریافت مجموعه‌ای از دستورالعمل‌های به اندازه کافی دقیق، ابزارهای تخصصی موجود را سازماندهی کند. این آزمایش آینده‌ای را پیشنهاد می‌کند که در آن هوش مصنوعی به جای جایگزینی هر جزء واحد، به عنوان چسبی عمل می‌کند که یک اکوسیستم ماژولار از نرم‌افزارهای علمی متن‌باز را به هم متصل می‌سازد.

دیدگاه مخالف: هزینه پنهان پیچیدگی پرامپت

در حالی که این مطالعه یک پرامپت ۱۶,۰۰۰ کلمه‌ای را به عنوان پیروزی در ثبت دانش تبلیغ می‌کند، اندازه خود آن پرامپت نگرانی‌های عملی را ایجاد می‌کند. تدوین چنین سندی مستلزم تخصص عمیق در حوزه مربوطه، آشنایی با ابزارهای زیربنایی و توانایی پیش‌بینی حالات مرزی است. به عبارت دیگر، تخصص از بین نرفته است—بلکه از دانشمندان آزمایشگاهی به مهندسان پرامپت منتقل شده است.

علاوه بر این، اتکا به یک بودجه ثابت GPU، محدودیت سختی را در عمق کاوش ایجاد می‌کند. تیم‌های انسانی می‌توانند منابع را بر اساس نتایج میانی به‌طور پویا بازتخصیص دهند، در حالی که کمپین Claude به یک بودجه از پیش تعیین‌شده پایبند بود که پتانسیل محدود کردن وسعت فضای توالی نمونه‌برداری شده را دارد.

آنچه باید در ادامه دنبال کرد

مقاله Anthropic چندین سوال بی‌پاسخ باقی می‌گذارد. کارهای آینده باید به کالیبراسیون اطمینان بپردازند تا خودارزیابی مدل با نتایج تجربی همسو شود. ادغام آزمون‌های عملکردی — مانند مهار آنزیمی یا فعالیت سلولی — در حلقه خودگردان، این فناوری را به جای صرفاً شناسایی اتصال‌دهنده (binder)، به سمت کشف دارو سوق خواهد داد. در نهایت، ارزیابی این رویکرد در مجموعه‌ای گسترده‌تر از اهداف و تحت شرایط بودجه‌ای متفاوت، مشخص خواهد کرد که آیا نرخ موفقیت (hit rate) مشاهده‌شده تکرارپذیر است یا یک مورد استثنایی (outlier) است.

نتیجه‌گیری روشن است: سازماندهی دقیق پرامپت‌ها می‌تواند یک مدل زبانی را به یک آزمایشگاه بیوتکنولوژی مجازی تبدیل کند و نرخ موفقیت اتصال‌دهنده‌هایی را ارائه دهد که از میانگین‌های انسانی فراتر می‌رود. با این حال، این رویکرد همچنان به نگارش تخصصی پرامپت وابسته است و از خطاهای مربوط به ارزیابی اطمینان رنج می‌برد که می‌تواند آزمایش‌های پرهزینه را از مسیر خارج کند. همان‌طور که جامعه علمی این فرآیندها را اصلاح می‌کند، تعادل بین خودمختاری هوش مصنوعی و نظارت انسانی تعیین خواهد کرد که آیا چنین سیستم‌هایی به ابزارهای معمول تبدیل می‌شوند یا صرفاً به عنوان موارد آزمایشی خاص باقی می‌مانند.