OpenAI сообщила(открывается в новом окне), что новая модель ИИ пока не будет опубликована. Первые тесты модели, которая внутренне обозначается как Astra, дали результаты, которые оказались достаточно серьезными, чтобы нельзя было исключать критическую оценку в области кибербезопасности. Этот порог установлен в собственной системе Preparedness Framework.
OpenAI опубликовала Preparedness Framework(открывается в новом окне) еще в декабре 2023 года, в то время, когда ни одна собственная модель еще не приближалась к такому уровню в области биологии, химии, кибербезопасности или хакерских способностей. Эта система определяет, какие меры вступают в силу, как только модель приближается к определенному порогу. Другие актуальные системы, такие как GPT 5.6 Sol, были проверены в области киберспособностей и отнесены лишь к уровню «высокий», а не к уровню «критический», который является высшей оценкой.
Согласно системе, модель считается критической, если она может самостоятельно, без контроля со стороны человека, выявлять и создавать работающие эксплойты, включая ранее неизвестные уязвимости, в многочисленных хорошо защищенных реальных системах. Та же классификация применяется, если модель может спланировать и осуществить полную кибератаку на систему, имея лишь общую цель.
Тесты Astra продолжаются, по словам OpenAI. Первые результаты хотя и не являются окончательными, но достаточно явными, так что в настоящее время нельзя исключать критическую оценку. Компания подчеркнула, что Astra не имеет отношения к недавнему инциденту с безопасностью в Hugging Face.
Ужесточение мер безопасности
В ответ на это OpenAI расширила внутренние тесты безопасности. К ним относятся изолированные тестовые среды, более строгие ограничения на доступ к сетям и инструментам, улучшенная защита весов модели, а также более плотный мониторинг поведения модели при самостоятельном выполнении задач.
Согласно сообщению в блоге, часть внутренней работы над Astra была приостановлена там, где новые требования безопасности еще не выполнены. OpenAI также заявляет, что все агентные применения модели теперь отслеживаются, в том числе во время обучения и оценки. Автоматизированные проверки процессов рассуждения модели могут прерывать действия, отнесенные к категории рискованных.