Insilico Medicine 推出用於測試藥物發現 AI 的基準服務
Insilico Medicine 推出 DDD Benchmark as a Service,用來測試前沿 AI 與基礎模型在真實世界藥物發現與開發任務上的表現。
Insilico Medicine 推出 DDD Benchmark as a Service,用來測試前沿 AI 與基礎模型在真實世界藥物發現與開發任務上的表現。
Moonshot 的 Kimi K3 在 Code Arena: Frontend 奪得第一,但在 FrontierMath Tier 4 上落後於頂尖的 OpenAI 與 Anthropic 模型,凸顯模型能力不均衡。
據報導,五家 AI 實驗室正支持一套通用的越獄評分標準,並以 8 月 1 日作為更廣泛安全標準協議的早期目標,這是朝向更可比較的 AI 模型安全測試邁出的一步。
OpenAI 發布 GeneBench-Pro,一項基因體學基準,旨在衡量更高層次的科學推理能力,因為 AI 實驗室正加速進入生物學工作流程。
熱門的免費 AI 模型排行榜新創公司 Arena 於去年 9 月推出商業服務,如今已成長為一個 1 億美元規模的企業。
CAISI 的評估顯示,DeepSeek V4 Pro 是中國最強的模型,但仍落後於美國領先的前沿 AI 系統。
一項嚴格的新基準測試了頂尖AI模型在投資銀行任務上的表現;沒有任何輸出被認定為可直接交付客戶,不過有一半的銀行家認為它可作為起點。
一項新的基準測試顯示,即使是頂尖的 AI 模型,在分析複雜圖表時準確率也會下降約 50%,暴露出視覺推理中的一項關鍵限制。
Google 的強化版 Gemini 3 Deep Think 模型在最新的基準測試中展現出優於 OpenAI 的 GPT-5.2 與 Anthropic 的 Claude Opus 4.6 的表現。
Claude Opus 4.6 在 Terminal-Bench 上取得 65.4%、在 OSWorld 上取得 72.7% 的突破性表現,在真實工作應用中超越了 Gemini 3 Flash。
AI基準測試 的最新新聞與分析