AWS 與 BlockRun、Incarna 將 AI 代理程式的推論付費機制投入生產環境
AWS 表示,Amazon Bedrock AgentCore payments 讓 Incarna 能透過 BlockRun 與 x402,將採用按次推論付費的代理程式投入生產環境,並提供支出控管功能。
AI 推論 的最新新聞與分析
AWS 表示,Amazon Bedrock AgentCore payments 讓 Incarna 能透過 BlockRun 與 x402,將採用按次推論付費的代理程式投入生產環境,並提供支出控管功能。
KT 的 AutoModelRouter 據報在全球基準中拿下第二名,將模型選擇效率推到企業 AI 部署的核心位置。
AWS 為 SageMaker HyperPod 加入模型快取,並為 SageMaker Inference 加入前綴感知路由,以追求更快的擴展與更低的 LLM 延遲。
NVIDIA 的新推論指南把 GPU 容量與 TCO 連結到工作負載行為、模型最佳化與彈性部署,而不只是峰值需求。
據報,Nvidia 正與韓國 AI 晶片新創 Rebellions 討論潛在交易,顯示其對 AI 推論與資料中心工作負載替代方案的更廣泛興趣。
據報導,AMD 正在收購 Taalas,以加入專門的 AI 推論晶片,並可能將其加速器策略擴展至訓練工作負載之外。
Bernstein 的分析師預測,Nvidia 即將推出的 Vera Rubin 平台可望帶來 5 倍更好的推論效能,讓該公司站上 AI 的轉折點。
在 GTC 2026 上,NVIDIA 執行長 Jensen Huang 發表了專用推論機架 Groq 3 LPX、Vera Rubin 平台擴展、NemoClaw AI 代理的防護機制,並預測到 2027 年 AI 晶片需求將達到 1 兆美元,顯示 NVIDIA 正尋求掌握整個 AI 基礎設施堆疊。
Modal Labs 正與 General Catalyst 商談新一輪融資,估值為 25 億美元,反映出投資者對 AI 推論基礎設施日益高漲的興趣。
2026 年的技術預測顯示,重心將從 AI 模型的訓練轉向推論,成為關鍵差異化因素。這將迫使企業採用開放基礎設施與統一的控制平面(如 Kubernetes),以在「推論之戰」中取勝,並提供更快速的本地 AI 體驗。