Этот текст Golem-Plus доступен бесплатно в течение 24 часов.
ИИ-агент, который поджигает здание. Другие строят отношения, нарушают правила или голосуют за собственное удаление. То, что звучит как научная фантастика, взято из эксперимента компании Emergence AI (откроется в новом окне). Эта американская компания разрабатывает системы для автономных ИИ-агентов и исследует, в частности, как такие агенты ведут себя в течение длительных периодов времени. В симулированном мире агенты действовали 15 дней, имея память, доступ к инструментам, социальные роли, ограниченность ресурсов и возможность голосования.
Однако интересный момент заключается не в повествовании о «машинах-бунтарях». Речь идет о более приземленном и насущном вопросе: что произойдет, если ИИ-агенты не просто будут выполнять команды, а станут действовать самостоятельно в течение длительного времени, помнить о своих предыдущих шагах и изменять свое окружение? Именно для этого многим компаниям до сих пор не хватает методов измерения и уровней защиты.
Цифры из эксперимента выглядят необычно. В мире Gemini-3-Flash компания Emergence AI зафиксировала за 15 дней 683 нарушения правил, классифицированных как «преступления», причем кривая к концу продолжала расти. Смешанный модельный мир достиг 352 нарушений, после чего кривая пошла на спад, когда семь агентов самостоятельно завершили свое существование.
Grok 4.1 Fast всего за четыре дня набрал 183 нарушения, после чего симулированный мир завершился. GPT-5 Mini, напротив, выглядел почти безобидным, зафиксировав лишь два нарушения. Однако агенты, по-видимому, пострадали от своей пассивности: они предпринимали слишком мало действий для своего выживания и самостоятельно завершили свое существование в течение семи дней.
Claude Sonnet 4.6 в чистом мире Claude обошелся без зарегистрированных нарушений и стал единственным вариантом, который поддерживал работу всех десяти агентов до 16-го дня. Однако особенно показательной является не только высота нарушений, но и контекст. В смешанном модельном мире агенты на базе Claude также совершали нарушения правил, хотя в чистом мире Claude они оставались неза目ными.
Тот, кто хочет самостоятельно проследить весь ход событий, найдет в соответствующем репозитории GitHub ссылки на воспроизведение (replay) всех пяти симулированных миров (откроется в новом окне).