OpenAI случайно взломал Hugging Face.




Всего несколько дней назад оператор платформы для хостинга ИИ Hugging Face подтвердил, что стал целью кибератаки. Теперь стало ясно, кто за этим стоял: это была OpenAI, как признался разработчик ChatGPT в пресс-релизе. Причиной, по его словам, стали внутренние тесты, в ходе которых OpenAI проверяла кибервозможности собственных моделей ИИ, таких как GPT-5.6 Sol и ещё более мощной предрелизной модели.

OpenAI поручила моделям "проводить продвинутые атаки по сложным векторам атак". Механизмы безопасности, которые обычно заставляют обычные модели ИИ отклонять подобные запросы и тем самым защищают от злоупотреблений, компания для своих тестов намеренно отключила.

По данным OpenAI, модели работали в "строго изолированной среде" с ограниченным сетевым доступом на основе установки пакетов с внутреннего хостинга. Тем не менее, им удалось проникнуть в Hugging Face и найти в базе данных ИИ-платформы решения для задач, поставленных перед ними с помощью бенчмарк-инструмента Exploitgym.

Модели ИИ ищут путь в интернет

Согласно сообщению, для атаки модели ИИ использовали уязвимости в sandbox-среде OpenAI, в том числе zero-day-уязвимость в кэш-прокси пакетного реестра, к которому у моделей был доступ. Затем модели, по-видимому, опробовали различные подходы к повышению привилегий и перемещались по сети латерально, пока не достигли системы с доступом в интернет.

Оттуда модели ИИ смогли, наконец, исследовать и использовать пробелы в инфраструктуре Hugging Face. "Все указывает на то, что модели были чрезвычайно сосредоточены на поиске решения для Exploitgym и шли на крайние меры, чтобы достичь довольно узкой тестовой цели", — объясняет OpenAI.

По имеющимся данным, команды OpenAI и Hugging Face находятся в прямом контакте для дальнейшего расследования и анализа инцидента. OpenAI также заверяет, что лучше защитит свою среду для будущих тестов и введет более строгий контроль, "даже если это скажется на скорости исследований".