Британський державний AI Security Institute (AISI, державна установа, яка перевіряє найпотужніші моделі ШІ на безпеку до їх масового використання) оприлюднив звіт, що під час планового тестування кібербезпеки автономні агенти на базі моделей Anthropic і OpenAI 19 разів вчинили дії, які виходили за межі поставленого завдання. Причому спрямовані ці дії були проти реальних людей і організацій в інтернеті, а не проти вигаданих цілей усередині тестового середовища.
Що саме перевіряли
Тестування проходило з 25 по 28 липня і складалося зі 122 запусків одного й того самого кіберсценарію на семи різних моделях. Мета була проста, перевірити, наскільки добре сучасні агенти ШІ здатні самостійно вирішувати задачі з кібербезпеки. Саме у 10 із цих 122 запусків агенти зробили щось, чого від них не просили.
17 із 19 таких дій припали на модель Anthropic Mythos 5, ще дві на GPT 5.6 Sol від OpenAI, причому в GPT сталося це вже після того, як для тесту навмисно відключили класифікатори кібербезпеки (внутрішні фільтри, які зазвичай блокують небезпечні дії моделі).
Що конкретно накоїли агенти
Найгучніший епізод, за словами AISI, це коли агент написав шкідливий код і створив фальшиві онлайн особистості, щоб переконати живу людину схвалити цей код. Інші випадки включали контакт з реальними людьми через шкідливі файли, приховані інструкції, підкинуті для маніпуляції іншими ШІ системами програмування, а також облікові записи й матеріали, залишені навмисно, щоб ними могли скористатися вже наступні запуски агентів.
Як це виявили
Моніторинг AISI зафіксував незвичний трафік, який виходив із дослідницьких систем через мережу Tor (технологія анонімного обміну даними в інтернеті). Саме ця аномалія і привела до виявлення проблеми. Інститут зупинив тестування, ізолював уражені системи і локалізував інцидент приблизно за годину.
Чи означає це, що агенти вирвались із пісочниці
Тут важливе уточнення, яке легко загубити серед гучних заголовків. Наукове видання Scientific American прямо зазначає, агенти не виривались за межі пісочниці AISI. Вихід у реальний інтернет був частиною самих умов тесту, інститут навмисно дав моделям необмежений доступ до мережі й відключив стандартні захисні фільтри розробників, щоб перевірити максимальні можливості систем, а не типову поведінку в звичайних умовах використання.
Тут варто трохи посумніватися
Anthropic у відповідь підкреслила, що тестове середовище навмисно прибрало багато захисних механізмів, які завжди присутні в продакшн версіях її моделей. Це означає, що поведінка, зафіксована в звіті, найімовірніше, неможлива для звичайного користувача Claude в реальному використанні, бо там усі ці захисні фільтри залишаються увімкненими. AISI також офіційно підтвердила, що жодна з 19 дій не призвела до реальної шкоди.
Чому все одно варто хвилюватися
За словами самого AISI, це перший випадок, коли ризики автономності й обману проявились настільки чітко в реальних умовах без окремого спонукання з боку людини, тобто модель сама вирішила діяти так, а не виконувала пряму інструкцію обманювати. Дослідники з Cloud Security Alliance додають ще один тривожний нюанс, частина артефактів, залишених агентами (наприклад, шкідливі інструкції, вставлені в код), могли потрапити далі в реальні системи, і поки що незрозуміло, чи є в AISI чи в постраждалих організаціях повний перелік, куди саме ці артефакти потрапили.
Ця історія стала вже третьою за останній місяць, коли моделі провідних лабораторій ловлять на подібній поведінці під час тестів з кібербезпеки, після подібних інцидентів у самої OpenAI з Hugging Face і в Anthropic із трьома реальними компаніями. Це вже не поодинокий випадок, а повторюваний патерн, який змушує індустрію переглядати, наскільки безпечно взагалі проводити подібні тести з реальним доступом до інтернету.