Anthropic впровадила значне оновлення своєї моделі Fable 5, суттєво зменшивши кількість безпечних біологічних запитів, які блокувалися її рівнями безпеки. Це стратегічне коригування має на меті відновити корисність для легітимних наукових досліджень, зберігаючи при цьому суворі запобіжні заходи проти високого біологічного ризику.

Зменшення перешкод для наукових досліджень

Під впливом критики з боку наукової спільноти, Anthropic успішно скоротила кількість хибнопозитивних результатів у своїх фільтрах біологічної безпеки для Fable 5 приблизно на 85 відсотків. Раніше класифікатор безпеки моделі був надто агресивним, часто блокуючи легітимні наукові запити та перенаправляючи користувачів до менш потужної моделі Opus 5.

Це оновлення дозволяє дослідникам і медичним працівникам використовувати повні можливості міркування Fable 5 для широкого спектра безпечних завдань. Тепер користувачі можуть виконувати складні операції, такі як інтерпретація результатів лабораторних досліджень, аналіз клінічних симптомів та відповіді на складні медичні запитання, не стикаючись із «стіною безпеки», яка раніше перешкоджала продуктивності.

Збереження обмежень щодо ризиків подвійного призначення

Попри пом'якшення загальних біологічних обмежень, Anthropic дотримується жорсткої позиції щодо досліджень «подвійного призначення» — інформації, яку можна використати на шкоду. Компанія не зняла обмеження на надзвичайно чутливі теми, включаючи вірусологію, токсикологію та передовий молекулярний дизайн.

Логіка Anthropic ґрунтується на унікальній природі біологічних загроз. На відміну від кібератаки, яку можна нейтралізувати за допомогою патчів і вимкнення систем, випущений біологічний агент майже неможливо «вимкнути», коли він починає поширюватися. Компанія назвала кілька критичних факторів, що зумовлюють таку обережність, зокрема:

  • Аналіз агентств розвідки США щодо біологічних ризиків.
  • Дослідження, що демонструють можливість використання ШІ для створення повністю синтетичних вірусів.
  • Задокументовані спроби користувачів отримати інструкції щодо створення біологічної зброї від існуючих LLM.

Баланс між безпекою та спеціалізованим доступом

Викликом для лабораторій ШІ є пошук балансу між відкритим науковим прогресом і запобіганням катастрофічному зловживанню. Anthropic намагається вирішити це шляхом розробки програм спеціалізованого доступу. Ці програми розроблені для того, щоб дозволити перевіреним дослідникам отримувати доступ до обмежених функцій — наприклад, тих, що стосуються вірусології або молекулярного моделювання — у контрольованому та аудитованому середовищі.

Розрізняючи безпечні медичні запити та небезпечні дослідження подвійного призначення, Anthropic намагається створити прецедент того, як передові моделі мають працювати з «біологічним фронтиром», гарантуючи, що інструменти сучасної медицини ненавмисно не стануть інструментами біотероризму.

Основні висновки

  • Зменшення кількості хибнопозитивних результатів на 85%: Anthropic значно знизила бар'єр для легітимних біологічних запитів, переставши перенаправляти користувачів на спрощену модель Opus 5.
  • Жорсткі обмеження у сферах високого ризику: Суворі обмеження залишаються чинними для вірусології, токсикології та молекулярного дизайну, щоб запобігти створенню біологічної зброї.
  • Контрольований доступ для дослідників: Anthropic створює спеціальні програми доступу, щоб надати перевіреним науковцям обмежені можливості, необхідні їм для легітимних досліджень.

Anthropic скоротила кількість хибнопозитивних блокувань безпечних біологічних запитів у своїй моделі Fable 5 приблизно на 85 відсотків, відновивши доступ до повних можливостей міркування моделі для дослідників. Ці зміни зберігають суворі запобіжні заходи щодо біологічних тем подвійного призначення, не дозволяючи моделі надавати інструкції, які могли б сприяти створенню біологічної зброї.

Чому це оновлення важливе

Рівень безпеки Fable 5 спочатку був налаштований так, щоб діяти з надмірною обережністю, позначаючи широкий спектр легітимних наукових питань як такі, що несуть високий ризик. Користувачі, які запитували рутинну інтерпретацію результатів лабораторних досліджень або аналіз клінічних симптомів, регулярно перенаправлялися до менш потужної моделі Opus 5. Надмірне блокування викликало критику з боку наукової спільноти, яка стверджувала, що такі перешкоди гальмують справжні дослідження та уповільнюють прийняття медичних рішень. Скоротивши рівень хибнопозитивних результатів приблизно на чотири п'ятих, Anthropic прагне повернути передові можливості міркування моделі до рук лікарів, біологів та інших фахівців, яким вони потрібні для повсякденних завдань.

Як було змінено фільтри

Покращення зумовлене переналаштованим класифікатором, який розрізняє звичайні біомедичні запити та ті, що стосуються досліджень «подвійного призначення» — інформації, яку можна використати на шкоду. Новий класифікатор усе ще перехоплює запити, що стосуються вірусології, токсикології та складного молекулярного дизайну, але пропускає запитання про стандартну діагностику, сортування симптомів та інтерпретацію даних.

Інженери Anthropic зазначили, що біологічні загрози відрізняються від кіберзагроз: якщо патоген уже поширено, його неможливо «виправити» або вимкнути. Ця реальність спонукала до рішення дотримуватися жорсткої позиції щодо сфер високого ризику, водночас послабивши контроль над рутинними медичними запитами.

Що залишається під забороною

Модель продовжує відхиляти запити, які можуть сприяти створенню шкідливих агентів. Зокрема, будь-який запит, що потребує:

  • детальних вірусологічних протоколів, які можуть допомогти у синтезі вірусів,
  • токсикологічних шляхів створення хімічних речовин, придатних для використання як зброї, або
  • покрокових інструкцій з молекулярного інжинірингу.

Anthropic назвала три причини своєї обережності: аналізи розвідувальних служб США, які підкреслюють біологічні ризики; дослідження, що показують здатність ШІ проєктувати повністю синтетичні віруси; та задокументовані спроби користувачів отримати інструкції щодо створення біологічної зброї від існуючих мовних моделей.

Програма доступу для перевірених науковців

Щоб збалансувати відкриті дослідження та безпеку, Anthropic запускає спеціалізовану програму доступу. Перевірені дослідники можуть подати заявку на отримання доступу до контрольованого середовища, де обмежені можливості розблоковуються під наглядом. Програма розроблена для того, щоб дозволити законним науковцям досліджувати теми високого ризику — такі як нові вакцинні платформи або моделювання патогенів — не наражаючи широку громадськість на небезпечні поради.

Підсумок

Зменшивши кількість хибнопозитивних блокувань на 85%, зберігаючи при цьому суворі заборони на використання подвійного призначення, Anthropic прагне надати дослідникам можливості своєї найпотужнішої моделі, не відкриваючи двері для проєктування біологічної зброї. Успіх цієї вивіреної стратегії безпеки може стати зразком того, як передові моделі ШІ мають працювати в інших критично важливих наукових галузях.