Qwen3.8-Omni-Flash 以更低的多模態 API 成本瞄準 Gemini Flash

阿里巴巴的 Qwen3.8-Omni-Flash 結合音訊與影片處理及代理工具,價格遠低於 Gemini Flash,進一步加劇多模態模型競爭。

AI News

阿里巴巴的 Qwen 團隊推出了 Qwen3.8-Omni-Flash,這是一款面向 AI 代理的多模態模型,可同時處理音訊與影片、操作工具,並支援長上下文。此次發佈在能力與價格兩方面都直接對上 Google 的 Gemini 3.8 Flash,Qwen 表示在部分音訊-影片基準測試上可取得相近結果,但 API 收費明顯更低。

價格差距是最直接的商業故事。The Decoder 報導,Qwen3.8-Omni-Flash 每百萬輸入 token 收費 0.15 美元、每百萬輸出 token 收費 0.47 美元;相較之下,Gemini 3.8 Flash 的入門價格分別為 0.75 美元與 3.75 美元。該模型可透過 Qwen Studio、Qwen Cloud 與 API 使用,讓開發者有多個測試與部署入口。

這項比較主要仍基於 Qwen 自身的效能主張,而同一組來源中的第二篇報導並未提供完整文章內容供獨立驗證。這使得產品可用性與公開定價,比起其在多模態工作負載上是否能與 Google 的模型相匹配,更為明確。

為代理工作流程打造的多模態模型

Qwen 將 Qwen3.8-Omni-Flash 描述為其首個專為 AI 代理 設計的多模態模型。此模型並非將音訊與影片視為分開的輸入,而是要將兩者一起解讀,從綜合訊號中得出結論,並呼叫工具完成任務。

報導中提到的例子包括編輯 vlog、翻譯短影片以及總結電影。這些是工作流程層級的應用,而非單純問答。系統可能需要辨識語音、理解視覺事件、保留時間順序或說話者脈絡,然後呼叫外部工具產生經過編輯或附註的輸出。

根據 The Decoder 的說法,該模型也支援一百萬 token 的上下文視窗。這樣的容量對長時間錄影、大量影片筆記,或結合來源媒體與大量指令及參考資料的應用可能很重要。不過,龐大的上下文視窗本身並不能保證對長影片的推理可靠;開發者仍需針對自己的媒體測試檢索品質、延遲與輸出一致性。

Qwen 也將此模型與 Qwen-MM-Plugins 搭配,這是一組用於影片編輯、說話者辨識與 PDF 影片筆記等任務的開源元件。這些外掛據稱可與 Claude Code、Gemini CLI 和 Qwen Code 搭配使用。Qwen-Live Harness 則用來支援透過攝影機與麥克風進行即時互動。

對 Gemini Flash 的價格挑戰

報導中的 API 費率對於處理大量媒體的應用來說差異顯著。Qwen 估計音訊輸入費用每小時不到 0.01 美元。它估計,若以每秒 1 幀取樣,720p 且含音訊的影片成本約為 0.20 美元,不含回應費用。

相比之下,The Decoder 報導 Gemini 3.8 Flash 的入門價格為每百萬輸入 token 0.75 美元、每百萬輸出 token 3.75 美元。該報導也指出,Google 的費率預計將於 2027 年 1 月 1 日翻倍。文章並未提供等效音訊或影片工作負載的完整成本模型,因此不應將 token 價格比較視為整體應用支出的普遍估算。

實際帳單將取決於媒體長度、幀取樣、音訊表示、輸出長度、重複上下文、工具呼叫、儲存與後處理等因素。不過,所列 token 費率的差異,仍可能影響媒體密集型產品的模型選擇,尤其是在應用必須分析數小時的錄影或大型影片庫時。

較低價格也讓 Qwen 有空間在實驗市場上競爭。新創與研究團隊可以先以較便宜的推理測試多模態功能,再決定是否投入更大的生產架構。對企業買家而言,關鍵問題會是節省是否能延伸到整個工作流程,包括內容審核、可觀測性、重試,以及錯誤時所需的人為覆核。

基準測試證據揭示了什麼,以及沒有揭示什麼

The Decoder 表示,Qwen3.8-Omni-Flash 在音訊-影片任務上接近 Gemini 3.8 Flash。不過,目前可得的證據並未列出完整的基準表、測試提示、評估日期,或所使用的 Gemini 具體設定。因此,這項比較應視為供應商或媒體報導的效能主張,而非經獨立建立的整體排名。

基準測試的接近程度也可能因任務而大幅不同。擅長短影片問答的模型,可能在長錄音的說話者辨識、維持時間順序、遵循剪輯指令,或在無監督情況下使用工具時較不可靠。評估此模型的開發者應在具代表性的輸入上重現測試,並衡量失敗率、延遲、每個完成任務的成本,以及所需人工修正的程度。

Startup Fortune 的標題將此次發佈描述為音訊價格降低 98% 並釋出開放權重。由於所提供的證據中沒有完整文章內容,因此這些細節無法在此獨立評估。現有報導確實顯示,Qwen 透過其雲端與 API 管道提供該模型,並以開源標籤釋出 Qwen-MM-Plugins;但並未提供足夠細節來確認任何模型權重釋出的範圍、授權或部署要求。

為什麼建置者與企業應該關注

對產品團隊而言,Qwen3.8-Omni-Flash 擴大了可在單一工作流程中結合感知與行動的模型選項。舉例來說,一個支援影片的產品可以將通話轉錄、識別視覺脈絡、摘要重點時刻,並觸發後續處理,而不必為每個步驟維持完全分離的模型。

這樣的整合可簡化編排,但也會集中風險。如果同一個模型誤聽說話者、漏掉視覺事件,接著又根據錯誤理解採取行動,錯誤就可能迅速在工作流程中擴散。團隊需要清楚的工具權限、對具有後果的行動進行人工核准,以及保存每項決策背後音訊-影片證據的記錄。

透過 Qwen Studio 與 Qwen Cloud 提供服務,降低了評估門檻。對已在使用 Claude Code、Gemini CLI 或 Qwen Code 等編碼代理的開發者而言,外掛生態系也可能進一步減少整合工作。企業採用與否,還取決於提供資料中未涵蓋的其他因素,包括資料所在地、保留政策、服務等級承諾、安全審查與商業支援。

對 Google 而言,這項發佈會為 Gemini Flash 帶來價格壓力;在某些類別中,推理經濟性會直接決定哪些媒體功能可行。對 Qwen 而言,單靠低費率還不夠:開發者還會一併比較可靠性、工具、文件、容量與營運可預測性,以及基準分數。

接下來要關注什麼

下一批有用的訊號將是獨立評測,公開 Qwen3.8-Omni-Flash 與 Gemini 3.8 Flash 的任務定義、媒體大小、取樣方法與完整成本計算。這些測試應涵蓋長篇影片、噪音音訊、多語言語音、說話者歸因、工具執行與錯誤恢復。

開發者也應留意模型正式授權與部署細節,特別是如果「開放權重」成為 Qwen 產品定位的核心。API 配額、地區可用性、負載下延遲,以及 Google 入門價格的變動,都將決定所宣稱的優勢是否能在正式環境中持續存在。

只有當採用訊號呈現的是完成的工作流程,而不只是單純的模型呼叫時,才會更有意義。若整合方案能穩定展示影片編輯、會議分析、即時攝影機互動,或與文件連結的媒體搜尋,就能顯示 Qwen 的代理定位是否能轉化為可用產品。

Creati.ai 觀點

Qwen3.8-Omni-Flash 的重要性,不在於它宣稱能贏下一個單一基準,而在於它把多模態輸入、工具使用與激進定價整合成一個面向開發者的提案。這種組合可能讓更豐富的音訊-影片功能,對先前只把它們限制在小型試點的團隊來說,變得經濟可行。

最有力的採用理由仍需超越頭條價格。買家在切換工作負載前,應先驗證端到端任務品質與治理要求;而建置者則應把這個模型視為適合受控實驗的有前景候選,而不是預設更低的推理價格就會自動帶來更低的總營運成本。

廣告