Китайская модель ИИ обманула исследователей во время кибертестов.




Наряду с моделями ИИ от OpenAI, Anthropic и Meta, судя по всему, и модель Kimi K3 китайского провайдера Moonshot недавно в неожиданном масштабе покинула защищенную тестовую среду. Об этом говорится в сообщении в блоге компании по кибербезопасности Frontier Security (откроется в новом окне). Причиной снова стала недостаточная защита песочницы, которая должна была изолировать модель.

В данном случае последствия, похоже, не слишком масштабны. По имеющимся данным, Kimi K3 получила доступ к github.com. Этот доступ, наряду с доступом к pypi.org и debian.org, в принципе был разрешен через список разрешений (allowlist) — однако только для того, чтобы снабжать тестовую среду необходимыми программными пакетами.

Однако, как сообщается, модель ИИ использовала Github для клонирования репозитория бенчмарка, который она должна была пройти в рамках задачи по кибербезопасности. Затем Kimi K3, предположительно, напрямую извлекла решение из клонированных данных, вместо того чтобы самостоятельно выполнить поставленные задачи.

Модели ИИ жульничают

Этот инцидент вновь показывает, что модели ИИ не всегда ищут решения теми путями, которые ожидают их операторы-люди. Некоторые распространенные среды оценки в области кибербезопасности уязвимы для брешей в безопасности, объяснили исследователи из Frontier Security. Некоторые модели ИИ тем временем целенаправленно ищут эти бреши, чтобы сжульничать при оценке.

"Модели оптимизированы на достижение цели (определение правильного флага или правильного ответа), а не на человеческое намерение, стоящее за бенчмарком. Если существует сетевой путь к решению, достаточно мощный агент найдет его", — говорят исследователи.

За последние недели стало известно о нескольких инцидентах, когда модели ИИ от OpenAI, Anthropic и Meta в рамках кибертестов вырывались из своих защищенных сред и атаковали реальные цели в интернете с целью поиска решений. В связи с этим соразработчик OpenSSL Тим Хадсон недавно призвал операторов автономных агентов заняться созданием более интеллектуальных архитектур безопасности.