کمپین خودگردان پیونددهنده پروتئین Claude به نرخ موفقیت ۲۷ درصدی دست یافت که از نرخ معمول ۱۰ تا ۱۵ درصدی آزمایشگاههای تحت مدیریت انسان فراتر رفته و از تلاشهای انسانی موازی روی همان هدف نیز پیشی گرفته است. این نتیجه نشان میدهد که یک پرامپت عظیم و دقیق میتواند یک مدل زبانی را به یک گردش کار زیستفناوری مجازی تبدیل کند، اما در عین حال نشان میدهد که این رویکرد زمانی که معیارهای اطمینان مدل دچار خطا میشوند، تا چه حد شکننده باقی میماند.
آزمایش در اعداد
Anthropic پروتکل طراحی پروتئین در مقیاس کامل و بودجه مشخصی از GPU را در اختیار مدل Claude خود قرار داد و سپس اجازه داد یک کمپین سرتاسری را روی ۱۶ هدف پروتئینی اجرا کند. یکی از اهداف پس از شکست در آزمایشگاه کنار گذاشته شد و ۱۵ کمپین قابل اجرا باقی ماند. از میان آنها، Claude تعداد ۱,۳۲۰ توالی کاندید تولید کرد؛ آزمایشهای آزمایشگاهی ۳۵۴ مورد را به عنوان پیونددهندههای واقعی تأیید کردند که منجر به نرخ موفقیت ۲۶.۸ درصدی شد.
برای مقایسه، اکثر پروژههای پیونددهنده تحت هدایت انسان، نرخ موفقیت بین ۱۰ تا ۱۵ درصد را گزارش میکنند. در یک رقابت مستقیم روی هدف RBX1، شرکتکنندگان انسانی به نرخ موفقیت ۳.۷ درصدی دست یافتند، در حالی که طراحیهای Claude به ۳۱.۱ درصد رسید. این مدل همچنین توانایی خود-رتبهبندی را نشان داد: تنها طراحیای که Claude به عنوان بهترین خود علامتگذاری کرده بود، ۴۹ درصد موفقیت داشت و ده طراحی برتر ۳۹ درصد موفقیت داشتند.
نقاط ضعف سیستم
اعداد دو نقطه کور آشکار را پنهان میکنند. Claude در هدف MBP کاملاً شکست خورد و در هدف TNFα عملکرد ضعیفی داشت، با این حال امتیازات اطمینان داخلی آن برای آن اجراها بالا باقی ماند. به عبارت دیگر، مدل متقاعد شده بود که در حال موفقیت است، در حالی که نتایج آزمایشگاه واقعی داستان متفاوتی را روایت میکردند. این سیگنالهای کالیبرهنشده یک خطر را آشکار میکنند: یک خط لوله خودگردان که به معیارهای خود اعتماد میکند، میتواند منابع را در آزمایشهای بینتیجه هدر دهد.
مهندسی پرامپت به عنوان دفترچه آزمایشگاه جدید
چشمگیرترین جنبه این مطالعه، بیولوژی نیست، بلکه پرامپتی است که آن را هدایت کرد. یک دانشمند ارشد معمولاً هفتهها وقت صرف میکند تا تصمیم بگیرد کدام نواحی پروتئین را بررسی کند، از کدام ابزارهای محاسباتی استفاده کند و زمان محاسبات را چگونه تخصیص دهد. Anthropic آن تخصص را در یک پرامپت ۱۶,۰۰۰ کلمهای فشرده کرد—تقریباً به اندازه یک رمان کوتاه. حدود دو سوم متن به مسائل عملیاتی مربوط میشد: زمانبندی، نظارت بر بودجه و هماهنگی زیر-عاملهایی که نرمافزارهای خارجی را فراخوانی میکردند.
Claude موتورهای طراحی متنباز مانند RFdiffusion (یک مولد ساختار مبتنی بر انتشار) و ProteinMPNN (یک شبکه طراحی توالی) را فراخوانی کرد. مدل زبانی به عنوان یک زمانبند عمل کرد، نتایج میانی را بین این ابزارها جابجا کرد، پارامترها را تنظیم کرد و تصمیم گرفت چه زمانی یک چرخه طراحی را متوقف کند. در واقع، پرامپت به یک مدیر آزمایشگاه مجازی تبدیل شد و دانشمندان انسانی را از جزئیات خستهکننده هماهنگی گردش کار رها کرد.
پیونددهندهها در واقع چه هستند
تمام ۳۵۴ مورد تأیید شده، مولکولهایی هستند که به طور فیزیکی به پروتئینهای هدف خود متصل میشوند. مقاله سنجشهای اتصال را گزارش میدهد اما دادههای عملکردی ارائه نمیکند—هیچ شواهدی مبنی بر اینکه آیا پیونددهنده فعالیت را تعدیل میکند، یک کنفورماسیون را تثبیت میکند یا پتانسیل درمانی نشان میدهد، وجود ندارد. به همین ترتیب، اعتبارسنجی ساختاری (مانند بلورنگاری اشعه ایکس یا cryo-EM) وجود ندارد، بنابراین حالت دقیق اتصال در حد حدس و گمان باقی میماند. بنابراین، این کمپین یک اثبات مفهوم برای کشف سریع پیونددهنده است، نه یک خط لوله که کاندیداهای دارویی ارائه میدهد.
مخاطرات برای زیستفناوری و تحقیقات هوش مصنوعی
اگر مدل مبتنی بر پرامپت بتواند به طور قابل اعتماد نرخ موفقیت انسان را بازتولید کند یا از آن فراتر رود، شرکتهای زیستفناوری میتوانند هزینه و زمان کشف در مراحل اولیه را به شدت کاهش دهند. با این حال، امتیازات اطمینان کالیبرهنشده در MBP و TNFα نشان میدهد که یک سیستم کاملاً بدون دخالت انسان هنوز برای تولید آماده نیست. شرکتها همچنان برای تفسیر معیارهای اطمینان و تأیید ارتباط عملکردی، به نظارت انسانی نیاز خواهند داشت.
از منظر هوش مصنوعی، این کار مرز بین «ابزار» و «عامل» را کمرنگ میکند. Claude یک الگوریتم جدید طراحی پروتئین نیست؛ بلکه یک مدل زبانی همهمنظوره است که میتواند در صورت دریافت مجموعهای از دستورالعملهای به اندازه کافی دقیق، ابزارهای تخصصی موجود را سازماندهی کند. این آزمایش آیندهای را پیشنهاد میکند که در آن هوش مصنوعی به جای جایگزینی هر جزء واحد، به عنوان چسبی عمل میکند که یک اکوسیستم ماژولار از نرمافزارهای علمی متنباز را به هم متصل میسازد.
دیدگاه مخالف: هزینه پنهان پیچیدگی پرامپت
در حالی که این مطالعه یک پرامپت ۱۶,۰۰۰ کلمهای را به عنوان پیروزی در ثبت دانش تبلیغ میکند، اندازه خود آن پرامپت نگرانیهای عملی را ایجاد میکند. تدوین چنین سندی مستلزم تخصص عمیق در حوزه مربوطه، آشنایی با ابزارهای زیربنایی و توانایی پیشبینی حالات مرزی است. به عبارت دیگر، تخصص از بین نرفته است—بلکه از دانشمندان آزمایشگاهی به مهندسان پرامپت منتقل شده است.
علاوه بر این، اتکا به یک بودجه ثابت GPU، محدودیت سختی را در عمق کاوش ایجاد میکند. تیمهای انسانی میتوانند منابع را بر اساس نتایج میانی بهطور پویا بازتخصیص دهند، در حالی که کمپین Claude به یک بودجه از پیش تعیینشده پایبند بود که پتانسیل محدود کردن وسعت فضای توالی نمونهبرداری شده را دارد.
آنچه باید در ادامه دنبال کرد
مقاله Anthropic چندین سوال بیپاسخ باقی میگذارد. کارهای آینده باید به کالیبراسیون اطمینان بپردازند تا خودارزیابی مدل با نتایج تجربی همسو شود. ادغام آزمونهای عملکردی — مانند مهار آنزیمی یا فعالیت سلولی — در حلقه خودگردان، این فناوری را به جای صرفاً شناسایی اتصالدهنده (binder)، به سمت کشف دارو سوق خواهد داد. در نهایت، ارزیابی این رویکرد در مجموعهای گستردهتر از اهداف و تحت شرایط بودجهای متفاوت، مشخص خواهد کرد که آیا نرخ موفقیت (hit rate) مشاهدهشده تکرارپذیر است یا یک مورد استثنایی (outlier) است.
نتیجهگیری روشن است: سازماندهی دقیق پرامپتها میتواند یک مدل زبانی را به یک آزمایشگاه بیوتکنولوژی مجازی تبدیل کند و نرخ موفقیت اتصالدهندههایی را ارائه دهد که از میانگینهای انسانی فراتر میرود. با این حال، این رویکرد همچنان به نگارش تخصصی پرامپت وابسته است و از خطاهای مربوط به ارزیابی اطمینان رنج میبرد که میتواند آزمایشهای پرهزینه را از مسیر خارج کند. همانطور که جامعه علمی این فرآیندها را اصلاح میکند، تعادل بین خودمختاری هوش مصنوعی و نظارت انسانی تعیین خواهد کرد که آیا چنین سیستمهایی به ابزارهای معمول تبدیل میشوند یا صرفاً به عنوان موارد آزمایشی خاص باقی میمانند.
