Base Labs, Hugging Face и Goodfire создают открытую инфраструктуру безопасности ИИ, стремясь сделать защитные механизмы более прозрачными по мере роста рисков моделей.

Base Labs, исследовательская группа, созданная компанией по инференсу ИИ Baseten, объединяется с Hugging Face и Goodfire AI для разработки инфраструктуры безопасности для моделей с открытыми весами. Инициатива призвана сделать оценку и мониторинг безопасности частью процесса разработки и развёртывания модели, а не отдельным слоем, который добавляется позже.
Объявление прозвучало на фоне споров между разработчиками и политиками о том, как управлять моделями, веса которых можно скачать, изменить и лишить встроенных защитных механизмов. Для создателей ИИ и корпоративных команд это партнёрство может стать ранним испытанием того, способны ли экосистемы открытых моделей выработать заслуживающие доверия практики безопасности без опоры на централизованный контроль со стороны небольшого числа поставщиков моделей.
Base Labs заявляет, что будет разрабатывать и публиковать методы обучения и мониторинга открытых моделей, а долгосрочная цель — создать прозрачный стандарт безопасности для экосистемы открытых весов. Hugging Face, крупная платформа хостинга для open-source и open-weight моделей, участвует в инициативе, а Goodfire AI вносит экспертизу в области интерпретируемости моделей.
Компании не раскрыли техническую архитектуру партнёрства. Из-за этого остаются открытыми базовые вопросы о том, будет ли работа создавать оценочные бенчмарки, инструменты развёртывания, методы обучения, системы мониторинга или комбинацию этих компонентов.
Заявленный Goodfire акцент на том, чтобы сделать поведение моделей более понятным, указывает на то, что интерпретируемость может быть частью предлагаемой рамки. В ответ на объявление Baseten компания Goodfire заявила, что безопасность должна быть встроена в открытые модели и обеспечиваться организациями, которые их обслуживают. Это широкая цель, а не опубликованная спецификация.
Baseten запустила Base Labs в начале 2026 года как своё исследовательское подразделение. Компания также пригласила разработчиков и других участников исследовательского сообщества вносить вклад в рамку, что указывает на стремление вывести проект за пределы трёх компаний-основателей.
Непосредственный фон — растущая обеспокоенность тем, что защитные механизмы можно удалить из скачиваемых моделей. TechCrunch сообщила, что техника, известная как «abliteration», всё чаще используется для отключения или ослабления отказного поведения и других средств безопасности. По данным отчёта, Hugging Face сейчас перечисляет более 6 000 моделей, идентифицированных как abliterated.
Эта цифра отражает содержимое и маркировку каталога платформы, а не независимую оценку всего рынка открытых моделей. Тем не менее она иллюстрирует практическую сложность того, чтобы считать исходное безопасное поведение модели постоянным после того, как её веса становятся общедоступными.
Для разработчиков моделей вопрос безопасности меняется: речь уже не о том, добавил ли поставщик защитные барьеры, а о том, сохраняют ли эти барьеры смысл после повторного распространения или модификации. Инструментам мониторинга, возможно, также придётся оценивать, как модель ведёт себя при изменённых промптах, дообучении, квантизации или других изменениях, внесённых пользователями ниже по цепочке.
Base Labs утверждает, что открытость может помочь исследованиям в области безопасности, поскольку внешние наблюдатели могут изучать поведение модели и разрабатывать более прозрачные механизмы контроля. Это позиция компании, а не вывод, доказанный этим партнёрством. Открытый доступ может улучшить проверяемость, но он также может облегчить удаление защит или воспроизведение небезопасных вариантов.
Подтверждённое объявление ограничивается созданием партнёрства и заявленным намерением компаний разрабатывать и публиковать методы безопасности. В доступных материалах не было предоставлено ни технической архитектуры, ни графика релизов, ни результатов оценки, ни списка моделей, ни процесса управления.
Наиболее конкретный рыночный сигнал — каталог Hugging Face с более чем 6 000 abliterated моделей, о котором сообщила TechCrunch. Каталог показывает масштаб проблемы, с которой сталкивается любая попытка сохранять свойства безопасности в открытой сети распространения, но он не доказывает, сколько из этих моделей широко используются и представляют ли они измеримый реальный риск.
Финансовые ресурсы участников тоже дают контекст, но не подтверждают технический прогресс. Baseten привлекла 1,5 млрд долларов в раунде Series F в июне, достигнув, по сообщениям, оценки в 13 млрд долларов. Goodfire AI привлекла 150 млн долларов в раунде Series B, возглавляемом B Capital, ранее в этом году. Эти суммы могут дать проекту доступ к инженерным и исследовательским ресурсам, но они не подтверждают ни предлагаемый стандарт, ни его вероятное принятие.
Поскольку доступные детали в основном поступают из заявления компаний и материалов СМИ, заявления о прозрачности, участии экосистемы и будущих улучшениях безопасности следует рассматривать как декларируемые цели. Пока нет независимых результатов бенчмарков, показывающих, что подход снижает вредоносные ответы или сохраняет эффективность после модификации модели.
Если Base Labs, Hugging Face и Goodfire создадут удобные инструменты, разработчики моделей смогут получить общий процесс для проверки поведения до релиза и мониторинга моделей после развёртывания. Это поможет командам документировать оценки безопасности, сравнивать версии моделей и выявлять изменения, вызванные дообучением или downstream-распространением.
Для корпоративных покупателей практическая ценность будет зависеть от того, создаст ли рамка доказательства, которые можно встроить в закупки, оценку рисков и комплаенс-процессы. Model card или одноразовый бенчмарк могут оказаться недостаточными для организаций, разворачивающих модели, которые обновляются, настраиваются или размещаются у разных поставщиков. Покупателям, вероятно, понадобятся воспроизводимые тесты, журналы аудита, отслеживание версий и чёткая информация о том, какие защиты сохраняются в производной модели.
Партнёрство также ставит Hugging Face в потенциально влиятельное положение. Как крупная платформа распространения и поиска, она может помочь сделать метаданные безопасности и результаты оценки видимыми в точке, где разработчики выбирают модели. Но одна лишь хостинг-инфраструктура не может гарантировать, что скачанная модель сохранит свои исходные защиты.
Для Base Labs и Goodfire проект также может закрепить конкурентную позицию на рынке, где инференс моделей, интерпретируемость и инструменты безопасности всё теснее связаны. Компаниям придётся показать, что их подход практичен для open-source разработчиков, а не только для хорошо финансируемых исследовательских команд. Инструменты, которые дороги, медленны или сложны в интеграции, могут ограничить внедрение, даже если их оценки технически сильны.
Первым сигналом станет публичный технический релиз: спецификация, набор бенчмарков, рецепт обучения, инструмент мониторинга или эталонная реализация. Его масштаб покажет, является ли партнёрство в первую очередь исследовательской программой или операционным стандартом для использования в продакшене.
Разработчикам также стоит следить за независимыми оценками моделей, протестированных в рамках этой системы, особенно после дообучения или удаления средств безопасности. Доказательства того, что методы продолжают выявлять рискованное поведение в модифицированных моделях, будут гораздо значимее, чем сами по себе заявления о запуске.
К другим важным сигналам относятся участие создателей моделей вне группы основателей, интеграция с рабочими процессами Hugging Face, документированные затраты и задержки, а также процесс обновления оценок по мере появления новых техник атак. Не менее важным будет управление: партнёры пока не объяснили, кто будет определять приемлемое поведение, разрешать споры или поддерживать рамку.
Партнёрство устраняет реальную слабость open-weight ИИ: защитные механизмы трудно сохранить, когда модели можно копировать и изменять. Его центральный тезис — что прозрачность и общие инструменты могут повысить безопасность — правдоподобен, но остаётся недоказанным, пока компании не опубликуют методы, которые другие смогут воспроизвести и оспорить.
Для разработчиков и корпоративных команд это объявление лучше рассматривать как предложение по инфраструктуре, а не как готовое решение безопасности. Доверие к Base Labs, Hugging Face и Goodfire будет зависеть не столько от самого партнёрства, сколько от того, смогут ли они предоставить открытые оценки, измеримые результаты и средства контроля, которые продолжают работать после того, как модели покидают исходную среду разработки.