NvidiaのNemotron 3.5 Lightningは、高速で効率的なAIエージェントに賭ける
NvidiaのNemotron 3.5 Lightningは、疎な活性化と量子化を用いて高速なオープンウェイト推論を実現し、最高スコアよりも大量処理のAIエージェントを狙っている。
NvidiaのNemotron 3.5 Lightningは、疎な活性化と量子化を用いて高速なオープンウェイト推論を実現し、最高スコアよりも大量処理のAIエージェントを狙っている。
オックスフォードは、AIの情報操作リスクに関するライブ・ベンチマークを公開し、モデル開発者や購入者に対して、時間の経過とともに追跡できる新たな安全性シグナルを提供した。
OpenAIは、2つのAPI設定によりARC-AGI-3でのGPT-5.6のスコアが3倍になったと述べ、推論設定がモデル性能をどう変えうるかを強調した。
AnthropicのClaude Opus 5がARC-AGI-3で新たな最高スコアを記録し、真の推論力向上なのかベンチマーク対策なのかという新たな疑問を呼んでいる。
ドイツのオープンモデル Soofi S は、完全にオープンな英語・ドイツ語ベンチマークで首位を主張する一方、開発者はテストデータ漏えいを公表し修正した。
NVIDIAは、LangChainで調整されたNemotron 3 Ultraがオープンモデルのエージェント・ベンチマークで最高水準の結果を達成し、低コストな企業向けAIスタックを示したと述べている。
Yellow.comの報告によると、Metaは社内の「Watermelon」AIモデルがGPT-5.5に並んだとスタッフに伝えたとされ、最先端モデルをめぐる競争が一段と激化していることを示唆している。
Mark Zuckerberg氏は、MetaのAIエージェントの改善が自身の期待より遅れていると従業員に伝えた。これは、同社の大きなプラットフォーム賭けに対する注目すべき現実確認だ。
開発者やヘビーユーザーは、AnthropicがClaude Opus 4.6とClaude Codeの性能を低下させたと非難しており、透明性をめぐる反発を招いている。
AI性能に関する最新ニュースと分析