Немецкая система финансирования науки превратилась в тормоз для инноваций, поскольку она всё больше ориентируется на краткосрочные проекты и бюрократические требования, а не на долгосрочные фундаментальные исследования.




Этот текст Golem-Plus доступен бесплатно в течение 24 часов.

Германия хочет наконец играть ведущую роль в сфере ИИ и стать более независимой от крупных (американских) корпораций за счет собственных инноваций. Миллионы евро вкладываются в исследовательские проекты, такие как языковая модель Soofi. Когда была опубликована первая модель Soofi S (открывается в новом окне), многие приветствовали это как доказательство того, что Германия догоняет конкурентов. Она была обучена в Германии и показывает хорошие результаты в бенчмарках. Некоторые комментаторы в LinkedIn и других соцсетях даже называют эту модель первым шагом в погоне за международными конкурентами.

Однако при более внимательном рассмотрении модель оказывается менее инновационной, чем можно предположить по публичному впечатлению. Таким образом, Soofi — это не спаситель для немецкой технологической сцены: она вновь демонстрирует после посредственной модели Teuken (открывается в новом окне), что Германия не способна создавать модели высшего уровня — что, на мой взгляд и по моему опыту, в немалой степени обусловлено нынешней системой науки и финансирования. Мы анализируем ключевые проблемы Soofi, чтобы показать, почему Германия показывает скорее средние результаты и почему, возможно, дело в самом принципе финансирования ИИ.

Trained in Germany вместо Made in Germany

Чтобы показать, в чем проблема с ИИ в Германии, мы сначала рассмотрим в качестве актуального примера, почему Soofi — по крайней мере на данный момент — приносит мало пользы как для исследований, так и для продуктивного применения.

Soofi S, первый опубликованный результат исследовательского проекта, задумана как большая языковая модель (LLM), то есть служит основой для обработки текстов и выполнения задач — как ChatGPT, Claude или китайские лидеры рынка Deepseek и Kimi.

Уже при взгляде на бюджет финансирования в 25 миллионов евро возникает скепсис, поскольку только вычислительные мощности для обучения актуальной модели — согласно сайту, заявлена цель использования в промышленности — стоят гораздо больше. С 30 миллиардами параметров модель является небольшой и, следовательно, по своей конструкции значительно менее мощной, чем современные модели, чьи параметры достигают десятков миллиардов.

Soofi-S использует для лучшей развертываемости и воспроизводимости результатов существующую архитектуру от Nvidia, а именно Nemotron 3 Nano. Таким образом, модель была не разработана в Германии, а переобучена.

При чтении научной статьи обращает на себя внимание «новый» токенизатор, но здесь он применен к собственным данным: смесь данных была оптимизирована для немецкого и английского языков, например, путем перевода китайских текстов. Это приводит к тому, что при токенизации последовательности становятся более компактными и, следовательно, лучше масштабируются с нижележащим механизмом внимания (g+). Немецкие и английские тексты представлены более компактно и, вероятно, поэтому изучаются несколько лучше.

Результаты на первый взгляд выглядят приемлемо: есть сопоставимые с другими моделями среднего класса показатели и даже немного лучшая производительность, чем у базовой модели от Nvidia, которая была взята за основу. Благодаря той же основе команда Soofi-S с лучшей смесью данных даже достигла положительного результата. Однако при более внимательном рассмотрении все выглядит несколько иначе.