Mistral Large 4以1兆參數多模態模型瞄準前沿競爭對手
Mistral AI發表Mistral Large 4,這是一款瞄準開放與封閉競爭對手的1兆參數多模態模型,但為進行安全性測試而延後發布模型權重。
多模態 AI 的最新新聞與分析
Mistral AI發表Mistral Large 4,這是一款瞄準開放與封閉競爭對手的1兆參數多模態模型,但為進行安全性測試而延後發布模型權重。
Meta 已推出 Muse Glimmer,一款 30B 開放權重多模態模型,適用於本地代理、程式撰寫,以及在不同硬體上的私人影像與影片工作流程。
Meta 發布了 Muse Glimmer,一款適用於本地 AI 代理的 30B Apache 2.0 多模態模型,並具備廣泛工具支援,主打私有、低成本推理。
Moonshot AI 的 PerceptionBench 發現,領先的多模態模型在基本視覺任務上的表現仍低於 60%,揭示看似推理錯誤背後的感知失誤。
Mistral AI 發表了 Robostral Navigate,一款用於單鏡頭導航的 8B 機器人模型,顯示出朝向更便宜機器人感知堆疊的推進。
Twelve Labs 從 Amazon 與創投投資人手中募得 1 億美元,顯示市場對可大規模搜尋與分析影片的 AI 系統需求正在升溫。
Google 介紹了 Gemma 4 12B,這是一款無編碼器的多模態開放模型,可在配備 16GB 記憶體的筆記型電腦上本地執行。
Mira Murati 的 Thinking Machines Lab 預覽了專為與 AI 進行持續即時協作而設計的互動模型。
Luma AI 的 Uni-1 採用自回歸架構,在推理基準測試中打敗 Google Nano Banana 2 與 OpenAI GPT Image 1.5,同時將 2K 解析度的價格降低最多 30%。
小米發表了 MiMo-V2-Pro、MiMo-V2-Omni 與 MiMo-V2-TTS — 這三款 AI 模型擁有超過一兆個參數、具備多模態感知與情感語音合成,在代理基準測試中可與 Claude Opus 4.6 一較高下。
Google 推出 Gemini Embedding 2,這是首款原生多模態的嵌入模型,能夠將文字、圖像與影片共同映射到統一的向量空間,用於檢索與搜尋任務。
中國的 DeepSeek 即將發布 V4 多模態模型 — 能夠生成文字、圖像與影片 — 據報導,其拒絕讓 Nvidia 和 AMD 提前進行優化存取,反而在中國一年一度的議會會期前僅獨家提供給國內晶片廠商華為與寒武紀。
DeepSeek 的職缺公告透露了建立一個支援文字、圖像與音訊的多模態 AI 搜尋引擎的計畫,直接瞄準 Google 在搜尋市場的市占率。
總部位於北京的 Moonshot AI 推出 Kimi K2.5,一款開源多模態 AI 模型,可與 OpenAI 和 Anthropic 媲美,且運行成本低四倍,這對美國的半導體出口管制在限制中國 AI 發展方面的有效性提出了質疑。