Исследователи из Принстона опубликовали бенчмарк (открывается в новом окне), в котором ИИ-агенты в течение 500 дней работали в роли виртуальных генеральных директоров. В ходе исследования (открывается в новом окне) был смоделирован стартап с реальным конкурентным давлением, динамикой клиентов и бюджетной ответственностью. Большинство ИИ-моделей обанкротились.
Сложная корпоративная реальность вместо отдельных задач
Предыдущие бенчмарки, такие как SWE-Bench или Webarena, проверяют, решает ли модель отдельную задачу. CEO-Bench устроен иначе. Агент получает Python-интерфейс, доступ к корпоративным базам данных и инструментам для работы с социальными сетями. Он должен устанавливать цены, распределять маркетинговые бюджеты, следить за конкурентами и разрабатывать долгосрочную стратегию. И всё это одновременно, на протяжении 500 симулированных дней.
Исследователи Хаожэ Чэнь, Картик Нарасимхан и Чжуан Лю выявили четыре слабых места, которые не учитываются существующими бенчмарками: долгосрочные горизонты в условиях неопределенности, извлечение информации из неточных источников данных, адаптация к меняющимся условиям и координация множества взаимозависимых решений.
Почти все модели терпят неудачу
Только пять из нескольких протестированных моделей завершили эксперимент с положительным остатком денежных средств. Начальный капитал в один миллион долларов США в итоге превзошли лишь Claude Opus 4.8 (около 27,8 миллиона долларов США) и GPT-5.5 (21,3 миллиона долларов США). Интересно, что базовая система, основанная на правилах и не использующая языковую модель, достигла показателя в 15,76 миллиона. Такие модели, как Grok 4.20, DeepSeek V4 Pro и Gemini 3 Flash, обанкротились во всех трёх прогонах. Grok 4.20 в среднем продержался всего 28 дней.
По словам исследователей, теоретический максимум составляет около 2,2 миллиарда долларов США. Таким образом, бенчмарк ещё далёк от исчерпания.
Конкретные различия в поведении
Исследователи наблюдали несколько конкретных различий в поведении. Claude Opus 4.8 построил симуляцию для прогнозирования будущих денежных потоков при различных сценариях. GPT-5.5 проанализировал историю переговоров в базе данных, чтобы выявить скрытые предпочтения клиентов. Обе модели замечали улучшения качества у конкурентов в среднем в течение недели, в то время как другим моделям на это требовалось около двух недель.
Ещё одним признаком более сильного планирования является частота использования слова «если» во внутренних заметках агента. Claude Opus 4.8 использовал его 8,57 раза в неделю, GPT-5.5 — 7,47 раза, а все остальные модели вместе взятые — 2,63 раза.
Кроме того, есть один вывод, который может быть важен для практического применения: если запускать Claude Opus 4.7 в среде Claude Code вместо простого Custom Harness, используемого исследователями, частота действий в день заметно снижается, а производительность значительно ухудшается. Исследователи предполагают, что такие среды оптимизированы для разработки программного обеспечения и не подходят для управленческих задач.