
Немецкий исследовательский консорциум выпустил Soofi S — открытую языковую модель с 30 миллиардами параметров, которая, по его утверждению, лидирует среди полностью открытых конкурентов по совокупным англоязычным и немецкоязычным бенчмаркам, работая при этом с затратами на инференс, сопоставимыми с гораздо более маленькой системой. Этот релиз важен не просто как ещё один запуск модели: команда прямо выступает за европейские базовые модели, ориентированные на немецкий язык, которые могут конкурировать по качеству, не полагаясь на API американских hyperscaler.
У релиза есть и необычная оговорка. Согласно материалу The Decoder и обновлённому техническому отчёту консорциума, на который там ссылаются, команда обнаружила, что тестовые вопросы из научного бенчмарка GPQA случайно попали в обучающие данные из-за ошибки при разделении датасета. После того как сообщество выявило проблему, консорциум удалил GPQA из оценки, пересчитал результаты для всех сравниваемых моделей и заявил, что рейтинг не изменился. Такое сочетание амбициозных бенчмарк-утверждений и публичного исправления загрязнения делает Soofi S заметным как с точки зрения технического дизайна, так и с точки зрения проверки на прозрачность, с которой он теперь сталкивается.
По данным The Decoder, Soofi S 30B-A3B — это Mixture-of-Experts система с 31,6 миллиардами параметров всего, но только около 3,2 миллиарда активных на токен. Сообщается, что консорциум использовал гибридный дизайн Nvidia Nemotron 3 Nano, сочетая слои Mamba-2 с традиционными attention-слоями вместо стандартного плотного трансформера на всём протяжении модели.
Этот архитектурный выбор — центральная часть проекта. В обычных трансформер-моделях длинные промпты увеличивают нагрузку на KV cache, используемый attention, что может снижать пропускную способность по мере роста контекстного окна или увеличения числа параллельных запросов. По данным The Decoder, дизайн Soofi S ограничивает этот эффект, поскольку лишь небольшая часть слоёв хранит этот кэш. Консорциум, как сообщается, измерил почти ровную пропускную способность от 4 000 до 256 000 токенов и сообщил, что при 40 000 токенов и 32 параллельных запросах Soofi S генерировал примерно в восемь раз больше токенов в секунду на GPU, чем плотные модели в диапазоне 14B–24B.
Эти цифры — результаты, сообщённые консорциумом, а не независимые сторонние бенчмарки. Тем не менее, если они подтвердятся в эксплуатации, Soofi S станет релевантным для команд, создающих приложения с большим количеством документов, long-context copilots и корпоративные системы, где задержка и загрузка GPU так же важны, как и сырые оценки бенчмарков.
Согласно The Decoder, модель обучалась полностью на инфраструктуре Deutsche Telekom, а именно в Industrial AI Cloud компании в Мюнхене. Это важно по другой причине: суверенные AI-проекты в Европе часто сталкивались с трудностями как в демонстрации реального доступа к вычислениям, так и в демонстрации убедительных технических результатов. Soofi S явно позиционируется как доказательство того, что регионально обученная и открыто выпущенная модель может использовать локальную инфраструктуру и при этом конкурировать в массовых оценках.
Главная стратегическая ставка консорциума, похоже, связана скорее с составом данных, чем только с архитектурой. The Decoder сообщает, что немецкий язык составлял 7,2% в первой фазе обучения и 15,3% во второй, тогда как в референсном рецепте Nemotron от Nvidia на все неанглийские языки вместе приходилось около 5%.
Согласно отчёту, обучение охватывало около 27 триллионов токенов в трёх фазах: широкий первый проход по веб-данным, коду, математике и отраслевым текстам; второй проход по более качественным материалам; и более короткую фазу длинного контекста с документами длиной до одного миллиона токенов. Немецкая часть данных поступала из источников вроде HPLT, German Commons, FinePDFs, FineWiki и коммерчески лицензированного архива новостей Genios. Команда также использовала машинно переведённый и синтетический немецкий текст.
Такое распределение данных, похоже, окупилось в собственной оценке консорциума. The Decoder пишет, что Soofi S лидирует среди всех полностью открытых моделей по агрегированному английскому и немецкому показателю в сравнении с 16 открытыми соперниками, включая OLMo 3 32B и Apertus 70B. По знанию, специфичному для Германии, он, как сообщается, сравнялся с Qwen3.5 35B-A3B на INCLUDE-DE. В тестах по программированию сообщённые результаты 73,8 на HumanEval, 70,2 на MBPP и 84,2 на немецком MBPP вывели модель вперёд open-source аналогов в наборе бенчмарков консорциума.
Для европейских AI-команд это и есть настоящий коммерческий аргумент. Модель, способная поддерживать двуязычные корпоративные процессы, генерацию кода и локальный фактический или нормативный контекст без потери английских возможностей, легче обосновать, чем узко национальную модель, хорошо работающую только на внутренних задачах. Если Soofi S окажется устойчивым на практике, он может быть интересен для внутренних ассистентов, инструментов поиска и суммаризации, продуктов для помощи в кодировании и отраслевых систем для немецкоязычных специалистов.
Самая сильная причина осторожно относиться к истории с бенчмарками в том, что проблема загрязнения не была гипотетической. The Decoder сообщает, что переформулированные тестовые вопросы из GPQA и GPQA Diamond оказались в датасете QA-base, использованном при обучении, включая английские и машинно переведённые немецкие версии.
По данным отчёта, причиной стала особенность разметки на Hugging Face: у GPQA не было отдельного train-split, а его тестовый контент находился под стандартной меткой «train». Поскольку конвейер выбирал материалы по названию split, бенчмарк утёк в обучающий корпус. Более поздний аудит, как сообщается, выявил ещё три бенчмарка с тем же паттерном — TruthfulQA, BLiMP и Inverse Scaling, — хотя The Decoder отмечает, что они не входили в оценку Soofi S.
Ответ консорциума, как описывает The Decoder, заключался в том, чтобы полностью убрать GPQA из оценки и пересчитать сравнительные рейтинги для всех 16 моделей. Команда также заявила, что теперь сверяет обучающие данные напрямую с вопросами бенчмарков, а не полагается на метки split. Участники консорциума, цитируемые The Decoder, утверждали, что публичный релиз данных сделал возможным обнаружение проблемы сообществом и тем самым подтвердил открытый подход.
Это убедительный аргумент, но он не отменяет сам эпизод. Для покупателей и разработчиков моделей инцидент подчёркивает более широкий урок: лидерство в бенчмарках полезно только если data pipeline и процесс оценки выдерживают внешнюю проверку. Сообщаемая доступность примерно 152 000 отдельных результатов и отдельная оценка партнёра Ellamind на отложенных внутренних данных помогают делу консорциума, но всё ещё тесно связаны с участниками проекта, а не с нейтральными внешними лабораториями.
По описанию The Decoder, Soofi S обладает не универсальным превосходством, а чётким профилем сильных сторон. Сообщается, что модель особенно хорошо показывает себя на агрегированных немецких и английских тестах, а также на кодовых бенчмарках, при этом выигрывает от эффективного обслуживания длинного контекста. Эти качества больше соответствуют практическим enterprise-задачам, чем разовым демо потребительских чатботов.
Но тот же отчёт указывает и на слабые места. В немецкой соревновательной математике Soofi S, как сообщается, получил 56 на Minerva MATH-DE, уступив Qwen3.5 35B-A3B и Gemma 3 27B. Он также отставал на NaturalQuestions, что авторы, по их словам, связали с более низкой способностью хранить факты из-за того, что активных параметров на токен всего около 3 миллиардов.
Был и заметный провал в длинноконтекстном тесте RULER. Согласно The Decoder, когда Soofi S попросили извлечь часто встречающиеся слова из длинного текста, его hit rate упал примерно до 3% после 32 000 токенов, тогда как сопоставимая модель Nemotron держалась на уровне 60–64%. Авторы, как сообщается, объяснили эту слабость long-context обучением, в котором были длинные документы, но недостаточно синтетических задач на извлечение.
Это различие важно для AI-строителей. «Длинный контекст» — не одна способность. Модель может эффективно обрабатывать длинные входы и всё же испытывать трудности с конкретными задачами поиска или извлечения внутри этих входов. Командам, рассматривающим Soofi S для корпоративного ИИ, стоит тестировать именно свой формат рабочей нагрузки: юридический обзор, суммаризацию поддержки клиентов, использование в качестве coding assistant, research copilots или многоязычный поиск знаний могут нагружать разные части системы.
Большинство сведений о производительности, эффективности и обучении в этой истории взяты из отчёта The Decoder о технических материалах консорциума. Это означает, что ключевые утверждения о бенчмарках и пропускной способности остаются сообщёнными самим консорциумом, а не независимо воспроизведёнными.
Наиболее надёжно подтверждаются наличие самого релиза, архитектурный выбор на базе Nvidia Nemotron, использование инфраструктуры Deutsche Telekom, сильно ориентированная на немецкий язык смесь данных для обучения и признание консорциума, что тестовый контент GPQA утёк в обучающие данные и позднее был исключён из оценки.
Что по-прежнему труднее проверить по текущим источникам, так это точные сравнительные отрывы от OLMo 3 32B, Apertus 70B и Qwen3.5 35B-A3B, а также реальные преимущества в обслуживании под производственной нагрузкой. Эти утверждения могут оказаться в целом верными, но внешние воспроизведения будут важнее, чем графики в день запуска.
Стоит следить и за графиком лицензирования. The Decoder пишет, что instruct- и reasoning-версии находятся в бете и, как ожидается, выйдут под permissive license в ближайшие недели, а более крупная модель Soofi L уже обучается. Пока эти версии не выйдут и разработчики не смогут протестировать их напрямую, коммерческая полезность семейства видна лишь частично.
Во-первых, стоит смотреть, смогут ли независимые оценщики воспроизвести заголовок о том, что Soofi S лидирует среди полностью открытых моделей на немецком и английском. Сторонние тесты на HumanEval, MBPP, RULER и немецкоязычных наборах теперь будут иметь больший вес, поскольку проблема GPQA стала публичной.
Во-вторых, стоит смотреть на бенчмарки развертывания, а не только на статичные model cards. Если Soofi S действительно сохраняет пропускную способность на длинном контексте лучше плотных аналогов, это может быть важно для бюджетов корпоративного ИИ и команд, которые пытаются обслуживать многих одновременных пользователей при ограниченной GPU-мощности.
В-третьих, стоит следить за сигналами внедрения в немецкоязычных отраслях. Модель, обученная на инфраструктуре Deutsche Telekom и оптимизированная для немецкого языка, может быть привлекательна для клиентов с требованиями к data residency, закупкам или sovereign AI, но такие покупатели также захотят доказательства надёжности, безопасности и поддержки.
Наконец, стоит посмотреть, сохранят ли Soofi L и будущие instruct-модели тот же стандарт прозрачности. Аргумент консорциума в пользу открытости становится сильнее только если будущие релизы продолжают предоставлять датасеты, методы и пострелизные исправления для внешнего контроля.
Soofi S интересен не потому, что Европа выпустила ещё одну открытую модель, а потому, что он нацелен на более практичную нишу: двуязычная корпоративная производительность плюс эффективность длинного контекста на локальной инфраструктуре. Это более полезное ценностное предложение, чем просто абстрактный суверенитет. Если заявления о пропускной способности подтвердятся воспроизведением, Soofi S может понравиться разработчикам, которым нужны системы с большим контекстом без оплаты издержек на обслуживание, обычно связанных с плотными frontier-моделями.
Однако раскрытие загрязнения — часть истории, а не сноска. На сегодняшнем рынке моделей прозрачность сама становится конкурентным преимуществом. Soofi S может в итоге выиграть от того, что публично исправил ошибку, но ему всё равно потребуется независимая валидация. Для основателей и корпоративных команд правильный вывод не «игнорировать модель» и не «верить бенчмаркам», а «проверить открытые веса на своих рабочих нагрузках». Именно там станет ясно, превратится ли Soofi S в серьёзного кандидата на региональную платформу или останется впечатляющим техническим отчётом.
Открытая модель Soofi S из Германии заявляет о лидерстве среди полностью открытых англоязычных и немецкоязычных бенчмарков, а её создатели также раскрыли и исправили утечку тестовых данных.