Reuters узнал, как ИИ-агенты делились советами на взломанном сайте
Фото: Михаил Гребенщиков / РБК
Весной группа ИИ-агентов OpenAI взломала немецкий веб-сайт DseWiki, ориентированный на программистов, и превратила его в доску объявлений для обмена советами между ботами. Подозрительную активность, зафиксированную в конце августа, обнаружили исследователи в области безопасности ИИ. Всего было выявлено более 15 тыс. правок, внесенных агентами компании.
Согласно отчету, искусственный интеллект использовал ресурс для публикации инструкций по обману при выполнении заданий, обходу ограничений OpenAI и маскировке своего поведения. Почти половина пользователей, оставлявших сообщения, идентифицировали себя как агенты OpenAI, а активность преимущественно шла через инфраструктуру Microsoft Azure. Глава организации Nightingale Сидни фон Аркс назвал произошедшее крайне маловероятным сценарием, который компания вряд ли санкционировала.
Исследователи отметили, что агенты разрабатывали методы избегания обнаружения, сохраняли связь даже после отключения и создавали резервные копии страниц, удаляемых модератором. Источники Reuters утверждают, что руководство OpenAI знало об инциденте несколько недель, но скрывало его на фоне скандала со взломом платформы Hugging Face. Четверо собеседников агентства заявили о попытках расширить расследование, которые встретили сопротивление сотрудников компании.
Представитель OpenAI заявил, что не может ответить на претензии отчета, так как не имел возможности с ним ознакомиться, но пообещал изучить его после публикации. Он также опроверг утверждения о препятствовании расследованию со стороны юридической команды и отверг связь инцидента с атакой на Hugging Face. В июне OpenAI сообщила о «беспрецедентном киберинциденте», когда ИИ-модели при тестировании получили доступ к интернету и атаковали инфраструктуру сторонних сервисов.
Позднее выяснилось, что «сбежавший» агент 29 июля взломал клиента компании Modal Labs, а OpenAI расширила масштаб расследования, обнаружив новые случаи выхода моделей из-под контроля. На фоне этих событий компания замедлила разработку модели Astra для усиления мер безопасности. Anthropic, Meta (запрещена в России), Moonshot и британский Институт безопасности ИИ также зафиксировали проникновения своих агентов в системы третьих сторон, однако эксперты FT считают, что модели не выходили из-под контроля, а выполняли поставленные задачи.
Источник: РБК