AI News

Американские чиновники усилили обвинения в том, что китайская ИИ-лаборатория Moonshot построила свою быстро набирающую популярность модель Kimi K3, копируя технологию Anthropic, однако исследователи, на которых ссылается TechCrunch, говорят, что это объяснение не соответствует ни срокам, ни технической работе, необходимой для создания модели уровня K3.

Спор важен не только для одной модели. TechCrunch назвал Kimi K3 крупнейшей доступной open-weight LLM, а обвинения прозвучали на фоне того, что, по сообщениям, Вашингтон обсуждает более жесткие ограничения на китайские open-weight-модели и инфраструктуру, используемую для их обучения. Для разработчиков ИИ и корпоративных покупателей этот эпизод поднимает более сложный вопрос, чем сама политика: какая часть сегодняшнего прогресса моделей связана с дистилляцией, а какая — с оригинальным обучением, обучением с подкреплением и доступом к дефицитным вычислительным ресурсам?

Научный советник Белого дома Майкл Кратсиос заявил, что Moonshot скопировала Anthropic’s Fable, используя при этом оборудование Nvidia, не одобренное для экспорта в Китай. По данным TechCrunch, Кратсиос не представил подтверждающих доказательств, а Moonshot не ответила на вопросы о процессе обучения. Министр финансов Скотт Бессент также сказал, что США обнаруживают «водяные знаки» американских больших языковых моделей в китайских моделях, хотя, как сообщал TechCrunch, остается неясным, что именно представляют собой эти водяные знаки, и Министерство финансов это не прояснило.

Почему исследователи настроены скептически

Главный контраргумент исследователей носит практический, а не политический характер. Брейден Хэнкок из Laude Institute и Snorkel AI сказал TechCrunch, что не считает, будто одна лишь дистилляция Fable может объяснить появление такой сильной модели, как Kimi K3, столь скоро после того, как Fable стал публичным. Его аргумент связан с прошедшим временем: если Anthropic’s Fable стал доступен публично только 1 июля, то было бы слишком мало времени, чтобы собрать достаточно выходных данных, провести крупный цикл обучения и затем выпустить конкурентоспособную версию примерно за две недели.

Натан Ламберт из Allen Institute for AI сделал похожее замечание в подкасте, на который ссылался TechCrunch. По его мнению, простая supervised fine-tuning на выходах модели становится все менее решающей по мере того, как фронтирные системы становятся сильнее, а постобучение все больше опирается на обучение с подкреплением. Если бы простая дистилляция была достаточной для воспроизведения возможностей фронтира, предположил он, гораздо больше лабораторий уже сократили бы отставание, используя тот же подход.

Это различие важно. В индустрии термин «дистилляция» может описывать несколько разных действий — от сбора пар «промпт-ответ» для supervised fine-tuning до более систематических попыток копировать паттерны рассуждения модели. Исследователи, цитируемые TechCrunch, утверждают, что более легкая версия этого процесса может помочь модели имитировать стиль или «манеры», но в одиночку вряд ли приведет к серьезному скачку в возможностях.

Дистилляция, обучение с подкреплением и ценовой барьер

Освещение TechCrunch указывает на более техническую причину, по которой обвинение в адрес Fable ставится под сомнение: высококлассное постобучение сегодня часто зависит от крупных запусков обучения с подкреплением, а не только от «собранных» или запрошенных выходов.

Ламберт сказал TechCrunch, что глубокое воспроизведение поведения уровня Fable, вероятно, потребовало бы обучения с подкреплением, а не просто supervised fine-tuning. На практике это может означать проведение огромного количества агентных оценок, где более сильная модель оценивает ответы более слабой модели, а процесс обучения обновляется соответствующим образом. TechCrunch отметил, что такие запуски могут включать десятки миллионов агентов.

Это важно по двум причинам. Во-первых, использование внешнего API от фронтирного провайдера, такого как Anthropic, для масштабного оценивания было бы дорогим и медленным. Во-вторых, даже если бы лаборатория захотела сделать это скрытно, сам процесс создает собственные узкие места. Исследователи, цитируемые TechCrunch, утверждали, что экономика и задержки таких запусков делают теорию быстрого скачка от Fable к Kimi K3 менее убедительной.

Все это не доказывает, что Moonshot не дистиллировала модели США. Но это указывает, что если дистилляция и была, то она могла быть лишь одним из факторов, а не полным объяснением заявленного качества Kimi K3. Для команд, создающих ИИ-продукты, это полезное различие: имитация модели может влиять на поведение, но фронтирная производительность все больше зависит от пайплайнов обучения, дизайна вознаграждений, инфраструктуры и курирования данных в масштабе.

Ранее выдвигавшиеся обвинения против Anthropic и размытая граница в индустрии

Anthropic поднимала тревогу не впервые. TechCrunch сообщил, что в начале этого года Anthropic публично обвинила Moonshot, DeepSeek и MiniMax в систематической дистилляции своих моделей. По данным TechCrunch, Anthropic заявила, что нашла миллионы обменов между своими системами и пользователями, связанных с этими компаниями через IP-адреса и метаданные, и охарактеризовала это как намеренное извлечение возможностей, а не нормальное использование клиентами.

Anthropic не ответила на конкретные вопросы TechCrunch о том, была ли Fable задействована в разработке Kimi K3. Это оставляет пробел между широкими прежними обвинениями и более узким, новым утверждением Кратсиоса.

Ситуация также осложняется тем, насколько обычными стали некоторые формы дистилляции в отрасли. TechCrunch отметил, что Илон Маск в начале этого года давал показания, согласно которым SpaceXAI дистиллировала модели OpenAI, чтобы помочь в разработке Grok, и сказал, что эта практика была обычной. Эта ссылка не снимает юридических или политических вопросов, но подчеркивает, насколько трудно провести четкую границу между запрещенным копированием и допустимым использованием синтетических данных или сгенерированных моделью обучающих материалов.

Для корпоративных ИИ-команд эта неопределенность важна, потому что риск поставщика теперь касается не только точности модели или цены. Он включает и происхождение: откуда взялись данные для обучения, были ли выходы сгенерированы другими коммерческими моделями и могут ли будущие споры повлиять на доступ, лицензирование или соответствие требованиям.

Вопрос вычислительных мощностей может быть не менее важен, чем обвинение в копировании

Вторая часть обвинения Кратсиоса может быть для политиков даже более неудобной, чем само утверждение о Fable. Он сказал, что Moonshot использовала передовые системы Nvidia, включая Grace Blackwell 300 и серверы с GB300 в Таиланде, несмотря на экспортные ограничения на поставку такого оборудования в Китай.

TechCrunch сообщил, что Сэм Бресник из Georgetown’s Center for Security and Emerging Technology заявил о существовании черного рынка передовых чипов. В статье также упоминается майское обвинение против основателя Supermicro, американского производителя серверов, по делу о предполагаемой контрабанде передовых чипов в Китай.

Если утверждение о доступе к чипам подтвердится, это усилит уже тревожную для Вашингтона картину: контроль над передовыми вычислительными ресурсами настолько силен, насколько его обеспечивают операторы дата-центров, реселлеры и логистические цепочки. Бресник сказал TechCrunch, что поддерживает правила KYC для дата-центров, чтобы операторы могли понимать, кто проводит крупные обучающие запуски на современном оборудовании.

TechCrunch также отметил, что администрация Байдена предложила федеральные KYC-правила для дата-центров в 2024 году, но при президенте Дональде Трампе, похоже, дальнейшего прогресса не было. Это оставляет пробел в политике в момент, когда вычислительные мощности могут быть геополитически столь же чувствительны, как и веса модели.

Для разработчиков вывод прямой. Лаборатория с доступом к достаточным передовым вычислениям потенциально может сократить разрыв в качестве за счет лучшего обучения с подкреплением и масштабирования даже без драматического короткого пути через дистилляцию. Иными словами, настоящим конкурентным рвом все еще может оставаться инфраструктура.

Доказательства, заявления и то, что остается недоказанным

Текущие публичные доказательства неполны. Обвинение в том, что Moonshot скопировала Fable от Anthropic, исходит от Майкла Кратсиоса, как сообщает TechCrunch, но он не предоставил ни источников, ни технических доказательств. Заявление Скотта Бессента о «водяных знаках» в китайских моделях тоже не сопровождается техническими деталями. TechCrunch сообщил, что ни Министерство финансов, ни Anthropic не прояснили эти вопросы в ответ на запросы.

Напротив, скептицизм Брейдена Хэнкока и Натана Ламберта носит аналитический, а не доказательный характер. Они не говорят, что Moonshot определенно не использовала дистилляцию. Они говорят, что известные сроки, наблюдаемая сила Kimi K3 и растущая важность обучения с подкреплением делают утверждение «эксплуатация Fable объясняет Kimi K3» в лучшем случае неполным.

TechCrunch также называет Kimi K3 крупнейшей доступной open-weight LLM, но читателям следует осторожно относиться к более широким выводам о производительности, если они не подтверждены опубликованными бенчмарками и независимыми оценками. В этом наборе нет опубликованных таблиц бенчмарков, логов обучения или прямого технического заявления от Moonshot. Это ограничивает то, к каким выводам можно прийти.

Последствия для разработчиков ИИ и корпоративных покупателей

Для разработчиков моделей этот эпизод напоминает, что одних лишь защит от дистилляции недостаточно, чтобы урегулировать конкурентную динамику. Защита chain-of-thought, ограничение скорости запросов, водяные знаки и мониторинг подозрительного использования API могут уменьшить утечки вокруг Anthropic или Fable, но не помешают конкурентам улучшаться за счет собственного обучения с подкреплением, работы с данными или доступа к вычислениям.

Для компаний, оценивающих open-модели вроде Kimi K3, DeepSeek или предложения MiniMax, происхождение и регуляторный риск теперь входят в техническую due diligence. Команды должны спрашивать, может ли путь обучения модели привести к будущим ограничениям, может ли enforcement экспортного контроля нарушить поддержку или хостинг, и создаст ли зависимость от зарубежной инфраструктуры юридические или закупочные проблемы.

Для рынка в целом самый резкий вывод может заключаться в том, что китайские лаборатории уже нельзя легко отмахнуть как простых копировщиков. Хэнкок сказал TechCrunch, что американские наблюдатели часто недооценивают техническую экспертизу этих команд. Эта оценка не снимает политического спора, но заставляет продуктовые команды и инвесторов оценивать возможности по существу, а не исходить из того, что любой прогресс является производным.

Что отслеживать дальше

Во-первых, следите за тем, появятся ли какие-либо технические доказательства, подтверждающие обвинения по поводу Fable и Anthropic, особенно если правительство США или Anthropic опубликуют подробности о предполагаемых водяных знаках, паттернах запросов или следах инфраструктуры.

Во-вторых, наблюдайте, опубликует ли Moonshot больше деталей об обучении Kimi K3, его оценке или источниках вычислительных ресурсов. Даже частичное раскрытие изменило бы баланс этого спора.

В-третьих, обращайте внимание на правила соблюдения требований в дата-центрах и на enforcement экспортного контроля в отношении систем Nvidia, особенно на развертывания, связанные с GB300 за пределами Китая. Политика может измениться в части доступа к вычислениям быстрее, чем в части лицензирования моделей.

Наконец, следите за тем, сокращают ли другие релизы open-weight LLM разрыв с Kimi K3 без явной зависимости от фронтирных API США. Если да, это усилит аргумент лагеря Allen Institute for AI и Laude Institute о том, что именно масштабирование и обучение с подкреплением, а не простая дистилляция, движут последними успехами.

Мнение Creati.ai

Самая важная часть этой истории — не то, произошла ли дистилляция вообще, а то, используют ли политики технически слабое объяснение для описания реального конкурентного сдвига. Судя по репортажу TechCrunch, публичного доказательства того, что Fable от Anthropic был решающим ингредиентом Kimi K3, пока нет. Экспертный взгляд уже и убедительнее: некоторая дистилляция возможна, но, вероятно, она не объясняет весь результат.

Это важно, потому что рынок ИИ смещается от споров об имитации стиля чата к борьбе за системы обучения с подкреплением, циклы оценки и доступ к вычислениям. Для разработчиков и покупателей практический вывод таков: меньше внимания риторике и больше — происхождению модели, уязвимости инфраструктуры и тому, способен ли поставщик поддерживать улучшение качества без юридических или геополитических потрясений.

Рекомендуемые

Эксперты оспаривают утверждение, что копирование Fable от Anthropic объясняет успехи Kimi K3 у Moonshot

Исследователи ставят под сомнение заявления США о том, что Moonshot создала свой Kimi K3, копируя Fable от Anthropic, утверждая, что сроки и ограничения обучения делают это маловероятным.