PrismML выпустила Bonsai 2 27B — сжатую модель рассуждений для ПК и смартфонов, усилив аргументы в пользу приватного ИИ прямо на устройстве.

PrismML выпустила Bonsai 2 27B — сжатую модель рассуждений, которая, по словам стартапа, способна обеспечить почти производительность гораздо более крупной модели, занимая при этом всего 5,9 ГБ памяти. Этот релиз — пока что самый наглядный тест усилий PrismML по переносу способных языковых моделей с облачных серверов на ПК и, потенциально, на высококлассные смартфоны.
Подход компании может иметь значение для разработчиков ИИ и продуктовых команд, поскольку локальный инференс способен снизить облачные затраты, уменьшить задержку ответа и оставить чувствительные данные на устройстве пользователя. Однако самые сильные доступные на сегодня показатели производительности и внедрения исходят от самой PrismML, и стартап не продемонстрировал, что результаты бенчмарков одинаково переносятся на реальные приложения.
Bonsai 2 27B сжимает Qwen3.8 27B — open-source модель от Alibaba — в файл, который, согласно материалу TechCrunch, примерно в 9–10 раз меньше оригинала. При размере 5,9 ГБ модель должна без проблем помещаться на многих персональных компьютерах и может работать на некоторых смартфонах высокого класса, хотя практическая производительность будет зависеть от памяти, возможностей процессора, квантизации и программного обеспечения, используемого для запуска.
PrismML была основана исследователями Caltech и возглавляется Бабаком Хасиби, профессором Caltech, известным работами в области сжатия. Советником является Ион Стоика, сооснователь Databricks и директор Sky Computing Lab Университета Калифорнии в Беркли. Стартап привлёк seed-раунд на 22,25 млн долларов от Khosla Ventures, Cerberus Capital и Caltech.
Компания не одинока в стремлении к сжатию LLM. Multiverse Computing также разрабатывает методы уменьшения размера моделей. Отличие PrismML, по словам Хасиби, в том, что её модели сохраняют почти всю измеренную способность исходной модели вместо того, чтобы жертвовать значительной точностью ради меньшего размера.
Метод PrismML использует так называемые тернарные веса. Обычно веса модели хранят изученную информацию с помощью сравнительно больших числовых представлений. Компания сводит эти значения к трём возможным состояниям: положительная единица, отрицательная единица или ноль. Это ограничивает объём информации, необходимый для представления каждого веса, и резко снижает требования к памяти.
Возникающая в результате техника, широко известная как сжатие LLM, направлена на изменение того, где может происходить инференс. Вместо отправки каждого запроса в облачный сервис приложение могло бы выполнять по крайней мере часть задач локально. Это могло бы обеспечить работу без подключения к сети, более быстрые взаимодействия и больший контроль над потоками данных.
Первую модель Bonsai, выпущенную PrismML за несколько месяцев до Bonsai 2 27B, как сообщается, удалось довести до 95% от совокупных бенчмарк-результатов исходной модели. Новая версия, как утверждается, достигает 98%. Эти цифры указывают на прогресс между релизами, но это не то же самое, что независимая проверка на широком наборе задач, устройств и методов оценки.
Результат 98% — это заявленный поставщиком бенчмарк, приписываемый PrismML. Он указывает на небольшое отставание от оригинальной модели Qwen в выбранной компанией сводной оценке, но не доказывает, что Bonsai 2 27B будет вести себя идентично в продакшене. Бенчмарки могут не выявлять сбои, связанные с длинным контекстом, использованием инструментов, знаниями в узкой области, многоязычными запросами или слоем оркестрации вокруг модели.
Хасиби признал, что сжатие, вероятно, всегда будет вносить некоторый эффект на качество. Он также утверждал, что разница в 2% по бенчмарку может не иметь большого практического значения, поскольку несжатые языковые модели несовершенны, а баллы бенчмарков не точно предсказывают результаты для пользователей. Это разумный инженерный аргумент, но всё же это утверждение, которое продуктовым командам придётся проверять на своих собственных нагрузках.
PrismML также заявляет, что исходная модель Bonsai была скачана более 11 миллионов раз, а её более мелкие модели получили ещё 2,6 миллиона загрузок. Эти цифры — это данные об adoption, сообщаемые компанией, а не доказательство устойчивого использования в продакшене, активных пользователей или коммерческих внедрений. Суммы загрузок могут включать эксперименты, автоматическую активность и повторные скачивания.
Если модель надёжно работает на потребительском железе, Bonsai 2 27B может расширить пространство проектирования для on-device ИИ. Разработчики смогут создавать ассистентов, которые продолжают работать без сети, обрабатывают приватные документы локально или используют облачную модель только тогда, когда задача превышает локальные возможности. Для корпоративных покупателей такая архитектура может уменьшить риск раскрытия конфиденциальных запросов и документов внешним провайдерам инференса.
Не менее важны и компромиссы. Модель, которая помещается в хранилище, всё же может быть требовательной к ресурсам, если нужно обеспечить полезную скорость. Пропускная способность памяти, тепловые ограничения, расход батареи, поддержка операционной системы и наличие оптимизированных рантаймов будут определять, насколько локальная модель кажется отзывчивой. Команды приложений также должны оценить, достаточно ли надёжно сжатое рассуждение для таких сценариев, как помощь в кодировании, анализ документов, поддержка клиентов или ИИ-агенты.
Долгосрочный план PrismML — сжимать модели с несколькими сотнями миллиардов параметров. Хасиби сказал TechCrunch, что у более крупных моделей может быть больше пространства для сжатия без столь сильной потери интеллекта. Если это окажется верным, компания в итоге сможет нацелиться на локальные системы, значительно более мощные, чем сегодняшние небольшие модели. Однако это по-прежнему перспективная цель, а не доказанная продуктовая возможность.
Следующим важным сигналом станут независимые тесты Bonsai 2 27B на потребительских ПК и смартфонах, включая скорость, использование памяти, влияние на батарею и точность в практических задачах. Разработчикам также стоит следить за поддерживаемыми рантаймами, условиями лицензии, доступностью модели и воспроизводимыми данными оценки.
PrismML говорит, что надеется выпустить модели с несколькими сотнями миллиардов параметров в течение ближайших пары месяцев. То, выйдут ли эти релизы по графику, сохранят ли заявленное качество и будут ли работать на коммерчески значимом оборудовании, покажет, способен ли подход компании масштабироваться дальше убедительной демонстрации сжатия.
Сообщения о том, что PrismML может вести переговоры с Apple, не подтверждены; Хасиби отказался комментировать. Любое официальное партнёрство с устройством или платформой дало бы более ясный сигнал о коммерческом развёртывании, но имеющиеся доказательства не подтверждают такого соглашения.
Релиз PrismML важен не столько потому, что модель на 5,9 ГБ автоматически заменяет облачный ИИ, сколько потому, что делает выбор между локальным и облачным вариантом более гибким. Сжатая модель, которая немного слабее, но при этом приватна, дёшево обходится в эксплуатации и доступна офлайн, может быть полезнее более крупной модели для многих узких продуктовых сценариев.
Ключевой вопрос не в том, достигает ли Bonsai 2 27B 98% по бенчмарку. Вопрос в том, могут ли разработчики полагаться на неё при реальных ограничениях: ограниченная память, меняющиеся запросы, вызовы инструментов, политики безопасности и запутанные корпоративные данные. Если PrismML сможет показать, что её сжатие выдерживает эти испытания — и масштабируется до более крупных моделей — она сможет сделать локальный ИИ практичным уровнем развёртывания, а не узкоспециализированной оптимизацией.