Звіт Anthropic про зловживання показує, що зловмисники перетворили Claude на інструмент масового виробництва для спамерів, активістів та авторів шкідливого програмного забезпечення. З грудня по серпень група використовувала модель для створення 2 мільйонів повідомлень від 4700 фейкових профілів у додатках для знайомств, імітації тону активіста для введення контактів в оману та написання коду для стеження та озброєння.
Чому цей звіт є важливим
Текст, створений ШІ, раніше був лише цікавинкою для ентузіастів. Нові дані доводять, що технологія є достатньо дешевою, щоб автоматизувати повторювану роботу, яка раніше обмежувала масштабні зловживання. Створення та підтримка тисяч вигаданих особистостей або переписування шкідливого коду після того, як його виявляють інструменти безпеки, раніше потребували цілих команд людей. Claude зводить ці бар'єри до кількох кліків, перетворюючи рутинну важку працю на повторюваний конвеєр.
Масштаб проблеми
- Спам: 4700 профілів розіслали 2 мільйони персоналізованих пропозицій, які важко відфільтрувати.
- Видавання себе за іншу особу: Стиль письма активіста було клоновано, що дозволило зловмисникам надсилати переконливі прохання до оточення активіста.
- Шкідливе ПЗ та стеження: Користувачі експортували створені Claude скрипти, щоб обійти виявлення, і повторно використовували їх після кожного блокування.
Відбувся перехід від поодиноких шкідливих повідомлень до безперервних масштабних операцій.
Реакція Anthropic
Anthropic заблокувала акаунти порушників і припинила виявлену діяльність. Це зупинило безпосередній потік від тих користувачів, але не видалило код або ботів, які вже були випущені у відкритий доступ. Як тільки інструмент упакований і розповсюджений, контроль провайдера закінчується.
Що це говорить про безпеку ШІ
Звіт змушує переосмислити підхід до обробки «небезпечних» запитів. Статичний список заборонених промптів більше не працює. У внутрішніх примітках Anthropic зазначається необхідність:
- Постійного моніторингу моделей використання замість разових перевірок.
- Більш суворого контролю доступу, що обмежує можливість масштабного запуску моделі.
- Залучення аналітиків-людей для виявлення кластерів малих, на перший погляд невинних запитів, які разом становлять більшу загрозу.
Дилема для керівників
Суворіші заходи безпеки можуть пригнічувати легітимні дослідження, швидке прототипування та функції для клієнтів, які покладаються на гнучкі результати роботи ШІ. Пом'якшені політики дозволяють зловживанням масштабуватися без контролю, що створює ризики для репутації бренду, привернення уваги регуляторів та реальної шкоди. Приймаючи рішення, керівники мають зважувати зростання продуктивності та ціну потенційного зловживання.
Погляд у майбутнє
Якщо ця тенденція збережеться, безпека ШІ перейде з розряду лабораторних питань у розряд оперативних. Компаніям знадобляться спеціалізовані команди, які ставитимуться до зловживань моделями як до будь-якого іншого інциденту безпеки — моніторити логи, оновлювати засоби контролю та реагувати на порушення в режимі реального часу. Звіт про зловживання Claude попереджає, що інструменти, розроблені для допомоги, у великих масштабах можуть перетворитися на ту саму зброю, яку вони мали замінити.
