
NvidiaはNemotron 3.5 Lightningを公開した。これは、あらゆるインテリジェンス・ベンチマークで性能を最大化するのではなく、AIエージェントのワークロードをより速く、より安価に実行できるように設計されたオープンウェイトの推論モデルである。
このモデルは、総パラメータ数316億と、トークンごとに36億パラメータだけを有効化する疎なアーキテクチャを組み合わせている。The Decoderが報じたベンチマークによると、Nvidiaの最終NVFP4重みを使ったプレリリーステストでは毎秒ほぼ670トークンに達し、スループットがこの新しいNemotron 3.5の中心的な特徴となっている。
開発者が、たまに使うチャットボットへの問い合わせから、ツール呼び出し、コード、途中推論の長い連続を生成するエージェントシステムへと移行する中で、この位置づけは重要だ。そうしたワークロードでは、レイテンシー、ハードウェアの稼働効率、提供コストが、モデルのベンチマーク最高値と同じくらい重要になり得る。
Nemotron 3.5 LightningはNemotron 3 Nano 30B A3Bの後継で、前モデルのハイブリッドなMamba-Transformer設計を引き継いでいる。総パラメータ数は、個々の計算で使われる数より大幅に多く、これは316億パラメータの密なモデルの完全な計算コストを負担せずに、より大きな容量を提供するための構造だ。
Nvidiaはこの推論モデルをBF16とNVFP4の形式で提供している。後者は、推論に必要なメモリと計算量を減らすため、より低精度の重みを使う。The Decoderは、NVFP4がArtificial AnalysisのIntelligence IndexでBF16版と同じスコアを達成し、その評価では品質差はわずかだったと報じた。
このモデルはテキスト専用で、最大100万トークンのコンテキストウィンドウをサポートする。この容量は、コーディングエージェント、文書中心のワークフロー、長いタスク履歴の維持が必要なアプリケーションに有用だろうが、コンテキスト長だけでは、非常に長い入力をどれだけ効率的かつ確実に処理できるかは分からない。
重みはNvidiaの寛容なOpenMDW-1.1ライセンスの下で利用できる。The Decoderはまた、DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius、Crusoeなどのプロバイダー経由でのサーバーレスアクセスも挙げている。複数の推論プラットフォームで利用できることは、自社のNvidiaインフラをすぐに運用しなくてもモデルを試したいチームにとって参入障壁を下げる。
The Decoderによると、Artificial AnalysisはNemotron 3.5 LightningにIntelligence Indexスコア24を与えた。これはOpenAIのgpt-oss-120bと同点で、NvidiaのNemotron 3 Superの26を下回った。この結果は、報告値15だったNemotron 3 Nanoから9ポイントの改善を意味する。
この比較は、Nvidiaのアプローチの限界も示している。The Decoderは、Qwen3.6 35B A3BとMetaのMuse Glimmerがそれぞれ32と35で、より高いスコアを出したと報じた。引用された分析では、速度と知能を合わせたトレードオフでは依然として独自システムが優勢で、GoogleのGemini 3.5 Flash-Liteは37、GPT-5.6 Lunaは52だったという。
Lightningの最も強い報告結果は、エージェント志向のテストで見られた。GDPval-AA v2では、Artificial AnalysisはEloレーティング824を記録し、gpt-oss-120bの800、Nemotron 3 Superの698を上回った。Terminal-Bench v2.1では、前世代の7%から24.3%へ上昇し、gpt-oss-120bの報告値26.2%に近づいた。
これらの数値は独立したベンチマーク・プラットフォームに由来するが、ここではThe Decoderの報道を通じて示されており、提示された証拠の中で独立再現された完全な結果セットではない。したがって、Lightningが本番ワークロードでより大きなモデルを常に上回る証拠ではなく、ベンチマークのスナップショットとして扱うべきだ。推論速度は、ハードウェア、バッチサイズ、量子化、提供ソフトウェア、プロンプト長、出力長によって大きく変動する。
注目のスループット数値も、最終NVFP4重みを使ったプレリリーステストに由来する。The Decoderによれば、LightningはIntelligence Indexのタスクを約30秒で完了し、引用された比較ではQwen3.6 35B A3Bが約3.5分、Gemma 4 31Bが5.8分だった。これらの時間は、Nvidiaの狙いを明確にする。つまり、待ち時間や大きなモデルを提供するコストが、多数のやり取りで積み重なる、反復的でレイテンシーに敏感なタスクだ。
プロダクトチームにとってLightningは、小型で安価なモデルと、難しい推論のために使う大規模システムの中間層になり得る。企業は、分類、ツール選択、コードナビゲーション、文書検索、構造化実行などの通常のエージェント手順にこれを使い、曖昧または高リスクのケースはより高性能なモデルにエスカレーションできる。
このアーキテクチャは高価な独自APIへのリクエスト数を減らせるが、それは小型モデルが特定のワークフローで確実に動作する場合に限られる。Terminal-Benchでの優位性が、そのまま信頼できるデータベース更新、財務分析、カスタマーサポート対応、本番コードにつながるわけではない。チームは、失敗時の復旧、ツール使用の精度、幻覚率、タスクがエスカレーションを要する頻度をテストする必要がある。
疎な設計とNVFP4オプションは、導入コストにも影響する可能性がある。1ステップあたり36億パラメータを有効化することで、同程度の総サイズを持つ密なモデルに比べて計算需要を減らせる一方、量子化はメモリ要件を下げられる。実際の利点は、チームが対応ハードウェアと提供インフラを持っているか、また長いコンテキスト、バッチ処理、エージェントのオーケストレーションによるオーバーヘッドがどれだけあるかに左右される。
Nvidiaのより広い戦略も、このリリースに表れている。同社は以前から、アクティブパラメータが100億未満のモデルでも、はるかに大きなシステムの一部のコストで多くのエージェントタスクを処理できると主張してきた。Lightningはその効率性の主張を、316億パラメータのミックス型設計でありながら、36億パラメータのアクティブ経路を持つ製品へと具体化した。
Fastino Labsの関連リリースは、下流での利用可能性を示す初期のシグナルだ。StreetInsiderは、同社がNemotron 3.5 Lightning上でエージェントを使って完全に再学習した、金融と医療向けの特化型オープンウェイトモデルを公開したと報じた。提示されたソースには、これらのモデルの技術的詳細、評価結果、採用数は含まれていないため、この発表は本番規模の需要の証拠というより、エコシステム活動の一例として理解するのが適切だ。
最も重要な次の確認事項は、エンドツーエンドのエージェント信頼性に関する独立したテストだ。開発者は、コード、ブラウジング、企業向けソフトウェア、長時間実行ワークフローにわたって、トークンスループットやベンチマークスコアだけでなく、完了したタスクを測定する評価を探すべきである。
提供コストも重要なシグナルになる。公開デプロイは、NVFP4と疎な活性化が実際のワークロードで意味のある節約を生むかどうかを示せる。特に、モデルが大きなコンテキストや多数の同時ユーザーを扱う必要がある場合だ。ローカル導入とホスティング推論の性能差も、制御と運用の簡便さを天秤にかける企業にとって重要になる。
Nvidiaのポストトレーニング提携も注目に値する。Artificial Analysisは、CodeRabbitとHarveyがNvidiaとドメイン特化型のポストトレーニングで協力したと報じた。より特化した派生版が、Lightningが汎用エージェントモデルになるのか、それとも狭い高ボリュームシステムの基盤になるのかを左右するかもしれない。
最後に、購入者はライセンスの明確さ、ツールのサポート、安全制約下でのモデルの挙動を追うべきだ。オープンウェイトモデルはクローズドAPIより検査と導入が容易だが、組織は監視、アクセス制御、データ処理、障害封じ込めの責任を負い続ける。
Nemotron 3.5 Lightningは、Nvidiaが生の知能ランキングで勝とうとする試みではない。多くの有用なAIエージェントには、あらゆるタスクで最強の答えよりも、高速で繰り返し可能な実行が必要だ、という賭けである。
そのため、ベンチマークのリーダーが依然として先行している場面でも、このリリースは戦略的に重要だ。報告されたスループットが一般的な導入構成でも維持されるなら、Lightningは大量のエージェント処理に対する実用的なルーティング विकल्पをビルダーに与える可能性がある。最終的な成功は、パラメータ数よりも、許容できない信頼性や安全性のリスクを増やさずに、より低いレイテンシーとコストで実際のワークフローを完了できるかどうかで判断されるだろう。
NvidiaのNemotron 3.5 Lightningは、疎な活性化と量子化を用いて高速なオープンウェイト推論を実現し、最高スコアよりも大量処理のAIエージェントを狙っている。