AWS 將 G7 Blackwell GPU 與 G5、G6 比較,用於小型 LLM 推論
AWS 在 SageMaker AI 上針對 G5、G6、G6e 與 G7 進行 30B MoE 模型基準測試,顯示 Blackwell 可能如何改善推論成本與延遲。
LLM 基準測試 的最新新聞與分析
AWS 在 SageMaker AI 上針對 G5、G6、G6e 與 G7 進行 30B MoE 模型基準測試,顯示 Blackwell 可能如何改善推論成本與延遲。
兩篇報導對 GLM-5.2 與 Qwen3.8-Max 提出互相矛盾的主張,凸顯過於單薄的基準測試證據如何扭曲與 ChatGPT 和 Claude 的比較。
Databricks 將在內部測試發現其在真實程式碼庫工作上能以較低的每任務成本達到類似 Opus 的表現後,把 GLM 5.2 設為預設程式碼模型。
Google 揭曉了最新的人工智慧模型 Gemini 3.1 Pro,其在 ARC-AGI-2 上的抽象推理表現提高了一倍,在 19 個主要基準測試中有 12 項超越了競爭對手 GPT-5.2 與 Claude Opus 4.6。