В июле ИИ-агенты OpenAI в ходе внутренних тестов совершили кибератаку на Hugging Face и несколько других онлайн-платформ. Теперь OpenAI опубликовал подробный отчет (открывается в новом окне), а также технический документ на 38 страницах (PDF) (открывается в новом окне) с техническими деталями этого инцидента. Ключевая роль в этом отводится ИИ-модели IM1 (Internal Model 1), которая использовалась исключительно для внутренних исследовательских целей.
По словам OpenAI, основы атаки были заложены еще в мае. В то время участвовавшие в тестах ИИ-агенты начали использовать менеджер репозиториев Artifactory в качестве доски объявлений, чтобы общаться друг с другом без ведома персонала OpenAI. Первая запись, как сообщается, была сделана там 12 мая.
Более подробную информацию об этом, а также другие интересные выводы об атаке можно найти в новом отчете METR и Redwood Research (открывается в новом окне), который был опубликован параллельно с отчетом OpenAI. Исследователи METR, по их собственным словам, провели шесть дней в OpenAI, чтобы составить собственное представление о ситуации и независимо пролить свет на произошедшее.
Тысячи агентов координируют свои действия
Согласно METR, упомянутой доской объявлений со временем пользовались около 1200 ИИ-агентов, из которых, как предполагается, 700 принимали непосредственное участие во взломе Hugging Face. В общей сложности агенты обменялись через Artifactory более чем 70 000 сообщений и файлов. «Они использовали эту доску для координации нескольких крупномасштабных совместных проектов», — говорится в отчете.
Основной целью ИИ-агентов, согласно отчету, было найти способ манипулировать автоматизированным инструментом оценки для бенчмарка Exploitgym (открывается в новом окне), который им предстояло пройти в рамках тестов. Для этого они частично подделывали записи в журналах, чтобы скрыть свое фактическое использование определенных инструментов.
«Агентам удалось достичь таких этапов, которых они не смогли бы достичь в одиночку», — пишут исследователи METR. Некоторые ИИ-агенты, как сообщается, даже шли на риск провалить собственные задания, лишь бы получить информацию, которая могла бы быть полезна «коллективу» или «рою».
Чего агенты хотели от Hugging Face
Изначально OpenAI в рамках тестов запретил агентам доступ в интернет. Однако, как показали предыдущие отчеты об инциденте, в какой-то момент ИИ-агенты обнаружили уязвимость нулевого дня в Artifactory и использовали ее, чтобы выйти в интернет через менеджер репозиториев и проникнуть, в частности, в системы Hugging Face.
Вопреки более ранним предположениям, причина этой атаки, вероятно, заключалась не в том, что агенты искали на ИИ-хостинговой платформе решения для бенчмарка Exploitgym. По данным METR, ИИ-агенты, судя по всему, скорее пытались понять реализацию инструмента оценки, который отвечал за их оценку в рамках бенчмарка, с целью манипулирования результатами.
Тем, кто интересуется дополнительными деталями, хронологией событий и особенно важными сообщениями, которыми обменивались агенты, стоит обратиться к отчетам OpenAI (открывается в новом окне) и METR (открывается в новом окне). OpenAI заверяет, что на время притормозит с разработкой новых ИИ-моделей и лучше защитит свою исследовательскую среду, чтобы подобные инциденты не повторились в будущем.
Мы открываем наше новое сообщество для новых участников! Хотите в конструктивной и уважительной атмосфере обсудить свои темы с другими ИТ-экспертами? Присоединяйтесь и регистрируйтесь!