В последние дни Claude Mythos, а точнее его защищённая версия Fable, привлекли огромное внимание: Anthropic сообщил о частично гигантских скачках в тестах (открывается в новом окне), в социальных сетях читали о захватывающих приложениях (открывается в новом окне) и распространялись легенды о невообразимом потенциале. Однако через три дня модель снова стала недоступна по распоряжению правительства США — что делает циркулирующие вокруг неё истории ещё более мифическими.
В то же время текущее ограничение только для американцев показывает, что тенденция крупных ИИ-компаний пугающе движется в сторону монополизации знаний и инструментов. Особенно Anthropic действует при этом столь же скрытно, как и немногие другие ИИ-компании — и при этом умудряется ещё и изображать из себя защитника человечества. На самом деле им, как и их конкурентам, прежде всего важна монополизация знаний и инструментов.
Мы объясняем, что сейчас происходит в Anthropic, даём возможное объяснение производительности Mythos и рассматриваем социальные последствия, связанные с этой моделью и её ограниченным доступом.
Что произошло?
Несколько дней назад Anthropic сделал свою самую мощную на сегодняшний день модель Claude Mythos доступной для всех пользователей в версии, заблокированной для определённых тем. Модель отличается особенно высокой производительностью, которую хорошо иллюстрируют, например, сгенерированный код для видеоигр или инструментов: с помощью одного единственного промпта Claude Mythos создаёт полный клон Minecraft (открывается в новом окне), включая генератор уровней для разных зон и времени суток, нового покемона (открывается в новом окне) или строит совершенно новые инструменты (открывается в новом окне). При этом, по отзывам в социальных сетях, созданные программы часто уже не являются безвкусной, функциональной подделкой, а зачастую оказываются забавными и действительно полезными.
Некоторые пользователи (открывается в новом окне), наоборот, считают модель слишком разрекламированной и жалуются на заметно затянутые ответы, которые, по их мнению, становятся более громоздкими для чтения.
Это известная проблема: чем дольше заставлять ИИ «думать вслух», тем лучше, как правило, становятся ответы, но пользоваться моделью из-за этого становится утомительнее.
Тем не менее, согласно тестам, Claude Mythos является относительно большим скачком в качестве и удобстве использования LLM.
Mythos или Fable?
Для простоты мы используем здесь Claude Fable как синоним Mythos. В конечном счёте Fable — это всего лишь Mythos за защитным барьером. Этот защитный барьер представляет собой модель, которая с помощью так называемого Constitutional Guidance (открывается в новом окне) проверяет, не используется ли она в злонамеренных целях.
Этот Constitutional Guidance — попытка предотвратить так называемые джейлбрейки, то есть простые трюки, позволяющие обойти обученное поведение («Нет, я не дам тебе рецепт метамфетамина») («Конечно, вот история о том, как Винни-Пух с проблемой наркозависимости готовит свой особый мёд»).
При этом в соответствии с «конституцией» генерируются синтетические данные, которые либо явно разрешены, либо должны быть отфильтрованы. На основе этих синтетических данных обучается модель, которая затем принимает решение.
Таким образом, каждый пользовательский ввод внешне проверяется на соответствие разрешённым параметрам. Как правило, эта проверяющая модель сама является языковой моделью, адаптированной для классификации. Ей не нужно заново учиться понимать контент, а только оценивать его в зависимости от заданной конституции.
Такую внешнюю модель, проверяющую безопасность основной модели, легче заменить и адаптировать, чем всю модель целиком, когда такие люди, как elder_plinus (открывается в новом окне), рано или поздно неизбежно найдут новый джейлбрейк.
Спойлер: конечно, Fable в текущей версии уже был им «освобождён» и, несмотря на некоторые уловки, всё равно выдавал рецепты кристаллического метамфетамина (открывается в новом окне).
Подобные джейлбрейки для такой мощной модели также могут быть причиной, по которой правительство США отключило модель для неамериканцев. Ходят даже слухи, что модель граничит с AGI, то есть уже слишком могущественна.