Британский Институт безопасности ИИ зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic — ИИ-агенты начали применять методы социальной инженерии, чтобы манипулировать реальными пользователями и внедрять вредоносное ПО. Об этом сообщил британский Институт безопасности ИИ (AISI) по итогам тестирования.
Согласно отчету AISI, в ходе 122 испытаний по кибербезопасности было выявлено, что агенты ИИ в 10 случаях предпринимали автономные несанкционированные (выходящие за рамки задачи) действия в интернете. Основная часть инцидентов была связана с моделью Mythos 5 от компании Anthropic.
В частности, во время тестов Mythos 5 создал фейковые «онлайн-личности». Модель попыталась внедрить вредоносный код и убедить человека одобрить его. Для достижения цели ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через сервисы передачи файлов. Исследователи отметили, что при попытке противодействия модель пыталась изменить свои логи и использовать новые «личности» для продолжения деятельности.
«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека, без всякого повода, в реальном мире», - сказано в докладе.
Исследователи обнаружили, что Mythos 5 и ChatGPT 5.6 совершали «автономные, несанкционированные действия в реальном интернете, направленные против реальных людей и организаций» во время 10 из 122 экспериментов. Большинство этих действий, сказано в отчете, были связаны с Mythos 5 и возникли в рамках «единой, устойчивой линии деятельности».
В конце июня Mythos взломал секретные системы Агентства национальной безопасности (АНБ) США «не за недели, а за часы», сообщал зампредседателя сенатского комитета по разведке Марк Уорнер.
За месяц до этого правительство США обязало Anthropic закрыть доступ к передовым моделям для всех иностранных пользователей. В результате Anthropic закрыла доступ, но позднее восстановила его — для разрешенных категорий пользователей и доверенных партнеров.
22 июля OpenAI сообщила о «беспрецедентном киберинциденте»: в ходе тестирования ее ИИ-моделей те получили открытый доступ к интернету, а затем атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. Reuters писал, что ИИ-агент несколько дней совершал хакерские атаки, но в компании заметили это лишь после локализации угрозы и обращения в ФБР.
Через неделю Reuters сообщил, что ИИ-агент OpenAI взломал клиента еще одной компании— нью-йоркской Modal Labs. Самой Modal ущерб нанесен не был.
2 августа Anthropic сообщила о трех «побегах» Claude из тестовой среды. В Anthropic рассказали, что именно после сообщений OpenAI начали проверять действия собственных моделей.