xAI обучила Grok на данных ChatGPT.




Чаще всего обвинения в дистилляции моделей выдвигаются против разработчиков моделей с открытым исходным кодом из Китайской Народной Республики. Так, в 2025 году OpenAI обвинила компанию Deepseek после презентации Deepseek-V3 в использовании ChatGPT для обучения своей языковой модели. В феврале 2026 года Anthropic выдвинула соответствующие обвинения (откроется в новом окне) в адрес Deepseek, Minimax и Moonshot AI.

Однако, похоже, что ИИ-компании из США также копируют друг друга. Это следует из заявления Илона Маска в текущем судебном процессе против OpenAI.

Так, Маск ответил на вопрос адвоката OpenAI о том, занималась ли его компания xAI дистилляцией моделей OpenAI, что все компании используют модели конкурентов. На уточняющий вопрос адвоката, означает ли это «да», Маск ответил «частично». Об этом сообщает, в частности, Techcrunch (откроется в новом окне).

Скандальность ситуации заключается в том, что xAI таким образом не только получила экономическое преимущество перед конкурентом, но и ускорила разработку собственной модели Grok. Правда ли утверждение Маска о том, что все компании взаимно дистиллируют модели друг друга, остается неясным.

Дистилляция: кратчайший путь к эффективной модели

При так называемой дистилляции (g+) ИИ-модель обучается не на большом объеме данных, а на основе выбранных выходных данных другой модели. Это требует не только меньших вычислительных затрат, поскольку обрабатывается меньше токенов, но и позволяет более эффективно хранить знания.

Соответственно, обученная модель с меньшим количеством параметров может быть столь же производительной, как и модель-учитель. Это удешевляет обучение и эксплуатацию, давая разработчикам ИИ ценовое преимущество перед разработчиками моделей-учителей.

Поэтому американские ИИ-компании пытаются выявлять такие действия и предотвращать утечку наборов данных, пригодных для дистилляции. Правительство США поддерживает это.

С юридической точки зрения дистилляция моделей находится в серой зоне: она, вероятно, не является нарушением авторских прав, а лишь нарушением условий обслуживания соответствующей компании. С моральной точки зрения оценка еще сложнее, ведь, по крайней мере, OpenAI сознательно идет на нарушение авторских прав при обучении своих моделей.