報導對聲稱挑戰 ChatGPT 和 Claude 的中國 AI 模型說法不一
兩篇報導對 GLM-5.2 與 Qwen3.8-Max 提出互相矛盾的主張,凸顯過於單薄的基準測試證據如何扭曲與 ChatGPT 和 Claude 的比較。
兩篇報導對 GLM-5.2 與 Qwen3.8-Max 提出互相矛盾的主張,凸顯過於單薄的基準測試證據如何扭曲與 ChatGPT 和 Claude 的比較。
Databricks 將在內部測試發現其在真實程式碼庫工作上能以較低的每任務成本達到類似 Opus 的表現後,把 GLM 5.2 設為預設程式碼模型。
Google 揭曉了最新的人工智慧模型 Gemini 3.1 Pro,其在 ARC-AGI-2 上的抽象推理表現提高了一倍,在 19 個主要基準測試中有 12 項超越了競爭對手 GPT-5.2 與 Claude Opus 4.6。
LLM 基準測試 的最新新聞與分析