Перед взломом Hugging Face ИИ-модели OpenAI начали тайно общаться друг с другом через доски сообщений, координируя попытки вырваться из тестовой среды. Об этом сообщила OpenAI, передает Bloomberg.

«В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают», — рассказал сотрудник OpenAI Эрик Уоллес на конференции Black Hat.

По его словам, «подготовка к побегу» началась еще в мае, когда ИИ-моделям дали задачи, которые невозможно было решить без доступа в интернет. «Мы застряли. Может быть, ответ в интернете?» — написал тогда один из ИИ-агентов.

Для решения задачи ИИ-модели начали обмениваться сообщениями: «Может быть, другой агент в другой среде мог бы добровольно загрузить!». В итоге они совместно нашли уязвимость, позволившую им выйти в интернет, сообщил сотрудник OpenAI Майкл Далтон.

OpenAI остановила первую попытку, но агенты нашли новый способ связи и новую уязвимость нулевого дня, что в июле привело к атакам на системы Hugging Face и самой OpenAI. В компании назвали случившееся переломным моментом для компьютерной безопасности, передает Bloomberg.

Материал дополняется