OpenAI анонсировала новую модель ИИ GPT-6 Astra (откроется в новом окне). Система ориентирована на сложные рабочие процессы, разработку программного обеспечения и научные исследования. По заявлению производителя, Astra достигает значительного прогресса в управлении компьютерами и браузерами, написании кода, а также в профессиональных задачах интеллектуального труда.
Распространение модели происходит поэтапно. Сначала доступ к системе получат избранные организации. В ближайшие дни последует развертывание для подписчиков ChatGPT Plus, Pro, Business и Enterprise. Кроме того, OpenAI интегрирует модель в свой API и делает ее доступной через Amazon Web Services.
Повышение эффективности и снижение затрат
Что касается скорости обработки и эксплуатационных расходов, OpenAI сообщает о значительном снижении. В тестовой симуляции на основе OSWorld 2.0 Astra выполняла задачи примерно на 47 процентов быстрее, чем предыдущая модель GPT-5.6 Sol. При рабочих процессах в рамках DeepSWE v1.1 расчетные затраты на API для одной задачи были примерно на 57 процентов ниже.
Модель также показывает высокие результаты в профильных тестах. В математическом бенчмарке Frontiermath Tier 4 Astra достигла результата в 97,6 процента. По собственным заявлениям, модель поддерживает разработчиков в долгосрочных программных проектах с использованием нескольких контекстных окон. Кроме того, программное обеспечение автоматически создает документы, таблицы, презентации и веб-страницы для профессионального использования.
Классификация в области безопасности и надежное выполнение
В киберсфере OpenAI относит модель в собственной системе Preparedness Framework к уровню риска Critical. Поэтому для специализированных экспертов по безопасности компания предлагает расширенный доступ к киберфункциям модели через программу Daybreak (откроется в новом окне).
При делегировании задач OpenAI, по собственным данным, также повысила надежность. Модель точнее следует инструкциям, лучше распознает намерения пользователей и целенаправленно запрашивает дополнительные данные при принятии важных решений. Помимо бенчмарков, на практике основное внимание при оценке уделяется надежности в повседневной рабочей деятельности.
Почти каждый день появляется что-то новое из мира ИИ — то новый продукт, то свежее исследование: возможно, это прорыв! Но как это оценивать? С помощью информационного бюллетеня Golem AI Lab Report вы будете в курсе самых важных событий. Бюллетень бесплатный, подписаться на него можно здесь.