PrismMLが27B推論モデルを5.9GBに圧縮し、ローカルAIへ

PrismMLは、PCやスマートフォン向けに設計された圧縮推論モデルBonsai 2 27Bを公開し、プライベートで端末内完結のAIの可能性をさらに高めた。

AI News

PrismMLは、Bonsai 2 27Bを公開した。これは、スタートアップによれば、5.9GBのストレージに収まりながら、はるかに大きなモデルに近い性能を発揮できる圧縮推論モデルだ。このリリースは、PrismMLが高性能な言語モデルをクラウドサーバーからPCへ、そして将来的にはハイエンドスマートフォンへ移そうとする取り組みの、これまでで最も明確な試金石となる。

ローカル推論はクラウドコストの削減、応答レイテンシの改善、そして機密データをユーザーの端末上に保持することにつながるため、このアプローチはAI開発者やプロダクトチームにとって重要になり得る。ただし、現時点で入手可能な最も強い性能・採用指標はPrismML自身によるものであり、同社はベンチマーク結果が実世界のアプリケーションでも同様に通用することを示してはいない。

より小さいモデルに、より大きな野心

Bonsai 2 27Bは、AlibabaのオープンソースモデルQwen3.8 27Bを、TechCrunchの報道によれば元の約9〜10分の1のサイズのファイルに圧縮している。5.9GBであれば多くの個人用PCに無理なく収まり、一部のハイエンドスマートフォンでも動作する可能性があるが、実際の性能はメモリ、プロセッサ性能、量子化、そして実行に使うソフトウェアに左右される。

PrismMLはCaltechの研究者によって設立され、圧縮研究で知られるCaltechのババク・ハシビ氏が率いている。Databricksの共同創業者であり、カリフォルニア大学バークレー校Sky Computing LabのディレクターであるIon Stoica氏は顧問を務める。同社はKhosla Ventures、Cerberus Capital、Caltechから2,225万ドルのシードラウンドを調達した。

同社はLLM圧縮に取り組む唯一の企業ではない。Multiverse Computingもモデルの小型化手法を開発している。ハシビ氏によれば、PrismMLの特徴は、モデルを小さくする代わりに大幅な精度低下を伴うのではなく、元のモデルの測定された能力をほぼ維持している点にある。

PrismMLが説明する圧縮の仕組み

PrismMLの手法は、同社が「ternary weights(三値重み)」と呼ぶものを使う。通常、モデルの重みは比較的大きな数値表現で学習した情報を保持する。同社はこれらの値を、正の1、負の1、ゼロの3つの状態に減らす。これにより、各重みを表現するために必要な情報量が制限され、メモリ需要が大幅に減少する。

この結果生まれる技術は、広くLLM圧縮として知られ、推論をどこで実行できるかを変えることを狙う。すべてのプロンプトをホスト型サービスへ送るのではなく、アプリケーションは少なくとも一部の処理をローカルで実行できるようになる。これにより、オフライン機能、より高速なやり取り、データフローのより大きな制御が可能になる。

Bonsai 2 27Bの数か月前に公開されたPrismMLの最初のBonsaiモデルは、元モデルの集計ベンチマークスコアの95%に達したと報じられている。新バージョンは98%に達すると主張されている。これらの数値はリリース間の進歩を示すものだが、幅広いタスク、デバイス、評価方法にわたる独立検証とは同じではない。

証拠、ベンチマーク、そして未解決の限界

98%という結果は、PrismMLに帰されるベンダー報告のベンチマーク主張だ。これは、同社が選んだ集計評価において元のQwenモデルとの間に小さな差しかないことを示唆するが、Bonsai 2 27Bが本番環境で同一の挙動を示すことは立証していない。ベンチマークは、長文コンテキスト、ツール利用、特定分野の知識、多言語プロンプト、あるいはモデル周辺のオーケストレーション層に関わる失敗を見逃すことがある。

ハシビ氏は、圧縮はおそらく常に何らかの性能への影響をもたらすと認めた。一方で、非圧縮の言語モデル自体が不完全であり、ベンチマークスコアはユーザー結果を厳密には予測しないため、2%のベンチマーク差に実用上の大きな意味はないかもしれないとも主張した。これは工学的にはもっともな議論だが、プロダクトチームは自分たちのワークロードで検証する必要がある主張であることに変わりはない。

PrismMLは、最初のBonsaiモデルが1,100万回以上ダウンロードされ、より小さいモデル群もさらに260万回ダウンロードされたと述べている。これらの数値は同社報告の採用指標であり、継続的な本番利用、アクティブユーザー、商用展開の証拠ではない。ダウンロード総数には、試験、 автомат化された活動、繰り返しの取得が含まれる可能性がある。

ローカル推論が開発者にとって重要な理由

モデルが消費者向けハードウェアで信頼性高く動作すれば、Bonsai 2 27BはオンデバイスAIの設計空間を広げる可能性がある。開発者は、ネット接続なしでも動き続けるアシスタント、機密文書をローカルで処理する仕組み、あるいはタスクがローカル能力を超えたときだけクラウドモデルを使う仕組みを構築できる。企業向けには、このアーキテクチャにより、機密のプロンプトや文書が外部の推論プロバイダーに渡るリスクを減らせる。

トレードオフも同様に重要だ。ストレージに収まるモデルでも、実用的な速度で動かすには負荷が高い場合がある。メモリ帯域幅、熱制約、バッテリー消費、OSサポート、最適化されたランタイムの有無が、ローカルモデルが応答性よく感じられるかを左右する。アプリケーションチームはまた、圧縮推論が、コーディング支援、文書分析、カスタマーサポート、AIエージェントのようなワークフローに十分信頼できるかを評価しなければならない。

PrismMLの長期計画は、数千億パラメータ規模のモデルを圧縮することだ。ハシビ氏はTechCrunchに対し、大きいモデルほど知能をあまり失わずに圧縮の余地が大きい可能性があると語った。この主張が正しければ、同社はいずれ、現在の小型モデルよりはるかに高性能なローカルシステムを目指せるかもしれない。ただし、これは依然として将来の目標であり、実証済みの製品能力ではない。

今後注目すべき点

次に重要なシグナルとなるのは、Bonsai 2 27Bを消費者向けPCやスマートフォンで独立にテストし、速度、メモリ使用量、バッテリーへの影響、実用タスクでの精度を確認することだ。開発者は、対応ランタイム、ライセンス条件、モデルの提供状況、再現可能な評価データにも注目すべきだ。

PrismMLは、今後数か月以内に数千億パラメータ規模のモデルを公開したいとしている。それらが予定通りに出るか、主張どおりの品質を維持するか、商用的に意味のあるハードウェアで動作するかが、同社のアプローチが説得力のある圧縮デモを超えて拡張できるかを示すことになる。

PrismMLがAppleと協議している可能性があるという報道は未確認であり、ハシビ氏はコメントを控えた。デバイスまたはプラットフォームとの正式な提携があれば商用展開のより明確なシグナルになるが、現時点の証拠ではそのような合意は確認されていない。

Creati.aiの視点

PrismMLのリリースが重要なのは、5.9GBのモデルが自動的にクラウドAIを置き換えるからではなく、ローカルかクラウドかという選択をより柔軟にするからだ。やや性能は劣っても、プライベートで、運用コストが低く、オフラインでも使える圧縮モデルは、多くの狭い用途のプロダクトワークフローにおいて、より大きなモデルより有用かもしれない。

重要なのは、Bonsai 2 27Bがベンチマークの98%に達するかどうかではない。実際の制約、つまり限られたメモリ、変化するプロンプト、ツール呼び出し、安全ポリシー、そして扱いづらい企業データの下で、開発者がそれを信頼できるかどうかだ。PrismMLが、その圧縮がそうしたテストを乗り越え、さらに大きなモデルへとスケールできることを示せれば、ローカルAIを専門家向け最適化ではなく、実用的な展開レイヤーにできる可能性がある。

広告