
元OpenAI CTOのMira Murati氏が設立したAIラボThinking Machinesは、2つ目のモデルとなる「Inkling Small」を公開し、注目を生の規模から効率へと移している。The Decoderの報道によると、この新モデルは同社の以前のInklingモデルよりもはるかに少ないアクティブパラメータで動作しながら、広範なベンチマーク指標ではほぼ同等の結果を示し、いくつかのコーディングおよび推論テストでは上回っている。
この位置づけが重要なのは、現在のモデル市場における圧力点に直接応えるからだ。多くの開発者や企業の買い手は、大規模なフロンティアシステムに伴いがちな推論コスト、レイテンシー、導入の複雑さを負担せずに、優れた推論性能を求めている。Thinking Machinesが、より小さなオープンモデルでも重要なタスクで競争力を保てることを示せれば、あらゆる用途に対応する一律の大規模化競争ではなく、ファインチューニングされたドメイン特化型の導入を支持する論拠が強まる。
核心となるニュースは明快だ。Thinking MachinesはInkling Smallをオープンウェイトの推論モデルとして紹介し、The Decoderによれば、言及されている主要なパラメータ数ではInklingの3分の1未満のサイズだという。Artificial Analysisのベンチマーク追跡によると、Inkling Smallは同社のIntelligence Indexで40点を獲得し、Inklingの41点に迫っている。
同じ報道では、このモデルは総パラメータ数が2760億、アクティブパラメータ数が120億とされている。この違いは重要だ。現在のモデル設計、特にスパース型やMixture型のシステムでは、アクティブパラメータ数は総パラメータ数だけよりも実行時コストの指標として優れている場合がある。なぜなら、それは特定のトークンで実際にどれだけのネットワークが使われるかを反映するからだ。入手可能なソース資料にはInkling Smallの背後にあるアーキテクチャの詳細はないが、総パラメータとアクティブパラメータの差は、Thinking Machinesがマーケティングだけでなく、推論がどのように管理されるかという点でも効率を重視していることを示唆している。
VentureBeatも別報道で同様の見方を示し、Inkling Smallを、前世代機の性能におよそ4分の1のサイズで迫るオープンソースAIモデルと説明した。その報道の全文は提供された証拠には含まれていなかったため、ここでのより詳細な技術面・ベンチマーク面の説明は、主にThe Decoderの報道とそれが引用する第三者ベンチマークに依拠している。
The Decoderによれば、Inkling Smallは推論やコーディングに焦点を当てた複数の評価で、より大きな兄弟モデルを上回っている。報告された例には、Humanity's Last ExamでInkling Smallが32%に対してInklingが30%、GPQA Diamondで89%に対して87%という結果が含まれる。
これらは些細な勝利ではない。Humanity's Last Examは、より高度な推論能力を測るための難易度の高いベンチマークとして使われており、GPQA Diamondは高度な科学・専門知識の質問応答に関する議論で頻繁に引用される。そこでの向上は、Thinking MachinesがInkling Smallを、単に広い基礎能力を維持するのではなく、コンパクトで難しい推論タスクに強くなるよう調整した可能性を示している。
一方で、このモデルはエージェントベースのタスクや事実知識では、より大きなInklingに後れを取ると報じられている。このトレードオフは重要だ。コーディングアシスタント、社内リサーチコパイロット、あるいは限定された推論ワークフローを作るチームにとっては、より多くの知識よりもトークン当たりの性能のほうが価値が高い場合がある。しかし、事実を検索し、より長い時間軸でツールを使い、多くの企業業務で安定して動作する必要がある汎用エージェントでは、その弱点は依然として問題になる可能性がある。
もう1つの性能面は出力効率だ。The Decoderは、Inkling Smallがタスクごとに平均24Kの出力トークンを生成するのに対し、Deepseek V4 Flashは45K、GPT-5.4 miniは78Kだと報じている。この比較が同様の条件下で成り立つなら、実用的な利点を示している。生成トークン数が少なくても結果に到達できるモデルは、コストを下げ、ユーザーが体感するレイテンシーを減らせるからだ。ただし、多くのベンチマーク型効率比較と同様、正確なタスク構成と評価設定が重要であり、購入者は独立したテストなしに単一のトークン効率値を過大解釈すべきではない。
この公開は、Thinking Machinesがモデルをどのようにパッケージしているかという点でも注目に値する。The Decoderによれば、Inkling Smallはテキスト、画像、音声入力をサポートし、テキスト専用の推論エンジンではなくマルチモーダルな性質を持つ。また、256Kトークンのコンテキストウィンドウを備えており、大規模文書の分析、コードベース作業、長時間の対話セッションに期待される水準に入っている。
アクセス面では、このモデルはApache 2.0で配布され、重みはHugging Faceで利用可能だ。このライセンス選択は商用採用にとって重要だ。Apache 2.0は、より制限の強いコミュニティライセンスに伴う法的不確実性の一部を伴わずに、幅広い利用、改変、配布を支援するため、一般に企業向けと見なされている。
The Decoderによると、Thinking MachinesはInkling SmallをTinker Playground経由でも利用可能にしており、ユーザーはブラウザ内でモデルをファインチューニングできる。これは、1つの標準的なモデルエンドポイントを売ることよりも、ベースモデルをカスタマイズ可能な出発点にすることを重視する製品戦略と合致している。同報道で説明されているように、同社は自社モデルを、ユーザーが自分のデータで適応させられる基盤として位置づけている。
このメッセージは、所有と特化にますます関心が集まる市場に響く。多くの製品チームは今や、レイテンシー、デプロイのトポロジー、安全性の挙動、ドメイン適応を管理したいと考えている。Hugging Faceで配布され、軽量なチューニングツールと組み合わされたオープンウェイトモデルは、クローズドなAPI専用提供よりも、Thinking Machinesにとってその買い手層へ届きやすい道筋を与える。
Inkling Smallの公開を裏付ける証拠は有望だが、まだ比較的薄い。今回の中で最も詳細なソースはThe Decoderであり、同メディアは主な性能の枠組みをArtificial Analysisに帰属させている。つまり、中心的な主張である「はるかに小さいアクティブサイズでInklingに近い能力」は、提供された証拠に含まれる完全な技術論文ではなく、第三者ベンチマーク追跡に基づいている。
Apache 2.0ライセンス、Hugging Face上の重み、256Kコンテキストウィンドウ、Tinker Playground経由での利用可能性など、直接確認しやすい主張もある。一方で、より慎重さが必要な点もある。Intelligence Index、Humanity's Last Exam、GPQA Diamondのようなベンチマークスコアは、評価プロトコル、プロンプト設計、モデルのバージョンに依存する。いずれも、同等かそれ以下のサイズのオープンモデルでこれを上回るものはないという主張は、The Decoderが引用するArtificial Analysisのものであり、ここで提供された資料にある独立再現済みの市場全体監査ではない。
また、ソース証拠には詳細な運用データもない。スループット、実運用の提供コスト、企業利用、ファインチューニングの安定性、敵対的テスト下での安全性などの直接的な数値はまだない。したがって、Inkling Smallは紙の上では効率的なオープンウェイト公開として魅力的に見えるものの、現時点では実地で証明されたというより、ベンチマーク主導の印象として受け止めるべきだ。
AI開発者にとって、この公開が示す最も強いシグナルは、Thinking Machinesが単に別のモデルを出したということではない。同社が異なる最適化目標を掲げていることだ。いまだにフラッグシップモデル発表が支配的な市場で、Inkling Smallは、より小さなアクティブサイズ、より少ないトークン消費、より容易なカスタマイズを軸にした有用な推論のための製品戦略に余地があることを示唆している。
それは複数のワークフローで響く可能性がある。迅速な反復提案を必要とするコーディングアシスタントは、できるだけ広い世界知識よりもトークン効率の恩恵を受けるかもしれない。独自文書を中心に構築された社内エンタープライズAIシステムは、企業データでファインチューニングでき、許容的なライセンスで導入できるモデルを好む可能性がある。マルチモーダル入力を扱うチームは、より大きな独自スタックに自動的に切り替えることなく、テキスト、画像、音声を処理できる1つのモデルに価値を見いだすかもしれない。
競争上の意味も明確だ。Deepseek V4 FlashやGPT-5.4 miniとの出力トークン効率の比較によって、この公開は、絶対的なベンチマーク首位だけでなく、コスト対性能で競うモデル群の混雑した中位層に入っている。実際に多くの企業AI予算が決まるのはその領域だ。問いは「最も賢いモデルはどれか」ではなく、「本番投入できるほど十分に良く、十分に制御可能で、十分に手頃なのはどれか」だ。
Thinking Machinesにとって、この公開は自社のアイデンティティを定義する助けになる。最大級のクローズドモデル提供企業に派手さだけで勝とうとするのではなく、オープンな導入、効率的な推論、ファインチューニングの柔軟性によって持続的な立場を築けると賭けているように見える。
次に注目すべきシグナルは、宣伝よりも実用面だ。まず、Inkling Smallをコーディングアシスタントのタスク、エージェントの信頼性、事実の裏付けで独立評価すれば、ベンチマークの物語が本番利用に結びつくかどうかが分かる。
次に、Hugging Faceでの公開が意味のあるコミュニティの牽引力、つまり派生チェックポイント、チューニングレシピ、フレームワーク統合、再現可能なレイテンシーレポートを生むかを見守る必要がある。オープンウェイトの公開は、単なるダウンロードだけでなく、エコシステムを引きつけるときに価値が高まる。
第三に、Tinker Playgroundの役割も追跡に値する。ブラウザベースのファインチューニングが特化のハードルを下げれば、Thinking Machinesは重いMLインフラを持たない小規模チームの採用を獲得できるかもしれない。
最後に、Thinking Machinesからの将来的な技術公開は重要だ。アーキテクチャ、学習方法、安全性の挙動、推論経済に関するさらなる詳細があれば、企業はInkling Smallが主にベンチマーク効率の良いモデルなのか、それともより大きな独自システムに対する本当に運用可能な代替なのかを判断しやすくなる。
Inkling Smallは、企業向けAI購買におけるより広い変化に合致している。最適化は、生のモデルの名声から導入の計算へと移っている。ランキング上では少し劣っていても、トークン使用、チューニングの柔軟性、ライセンス面で大幅に優れているモデルのほうが、より重要な製品になり得る。
未解決の問いは、Thinking Machinesがこの仮説を採用に変えられるかどうかだ。Inkling Smallは、特にApache 2.0、Hugging Face、Tinker Playgroundを通じて、同社にオープンウェイト市場への信頼できる入口を与えている。しかし、突破するには、Inklingにベンチマークで近いだけでは足りない。チームがその上に、閉じた代替案よりもコスト、制御、速度に優れた真の企業AIとAIエージェントを確実に構築できる証拠が必要になる。
Thinking Machinesは、Inklingの結果に少ないアクティブパラメータで迫るApache 2.0のオープンウェイト推論モデル「Inkling Small」を公開した。