Google DeepMind 推出 Gemini 3.8 Live 音訊模型,API 定價更低,從成本、品質與開發者採用面向挑戰 OpenAI 的 GPT-Live-1。

Google DeepMind 已發布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,這兩款音訊模型是為開發者打造對話式語音應用而設計。這些模型可透過 Gemini API 與 Google AI Studio 使用,讓 Google 在與 OpenAI 的 GPT-Live-1 競爭中有了新的切入點,同時也為語音對話設定了明顯更低的公開價格。
這次發布之所以重要,是因為即時語音系統正從轉錄與基本聊天,走向更進階的能力。根據 The Decoder,Gemini 3.8 Live 可支援在背景執行 API 呼叫、處理視覺輸入,並在這些操作進行期間持續說話的語音代理。Google 也表示,這些模型支援超過 97 種語言,但來源證據並未提供更多逐語言的效能或可用性細節。
Gemini 3.8 Live 被定位為標準的即時音訊模型,而 Gemini 3.8 Live Extended Thinking 則加入了偏向推理的變體。兩者都是提供給開發者使用,而不只是作為面向消費者的功能。根據 The Decoder,這次發布還包含 GitHub 上的範例應用程式,讓產品團隊能以此作為測試語音工作流程的起點。
這套功能組合指向結合語音、工具使用與多模態情境的應用。舉例來說,語音代理可以在處理外部 API 請求的同時解讀視覺輸入,並維持口語互動。來源並未指出具體的企業整合、正式上線客戶或一般可用條件,除了可透過 Gemini API 與 Google AI Studio 存取之外。
這個區別對建構者很重要。能自然說話的模型只是語音產品的一部分。開發者也需要可靠的工具執行、中斷處理、延遲控制、記錄,以及針對由語音請求觸發的動作所設計的安全防護。Google 所描述的能力解決了其中一部分架構問題,但現有證據並未證明這些模型在生產環境中的表現一致性。
最明顯的競爭差異是成本。The Decoder 報導,Google 對音訊輸入收費每分鐘 0.005 美元,對音訊輸出收費每分鐘 0.018 美元。依照該刊的計算,在 Google 的定價假設下,一小時的語音對話約為 1.38 美元。
同一份報導將 OpenAI 的 GPT-Live-1 標示為每分鐘 0.05 美元,代表一小時對話大約是 3 美元或更高。任何應用的精確總額都會取決於輸入與輸出音訊的比例、停頓、重試、工具呼叫及其他可計費活動,因此小時比較應視為示意性的估算,而非通用的營運成本。
即便如此,價格差距仍可能影響團隊如何設計語音產品。較低的推論成本讓測試更長對話、向更多使用者提供語音功能、以及在商業模式尚未驗證前先做實驗變得更容易。對新創公司而言,成本可能決定一個語音工作流程是否根本可行。對大型企業而言,成本會影響語音是作為主要介面,還是昂貴的附加功能。
但價格並不是唯一決定因素。The Decoder 表示,OpenAI 的模型應該聽起來更自然,因為 GPT-Live-1 使用 full duplex,讓它能同時聽與說。該刊也認為 OpenAI 的示範聽起來更好,並將 Google 顯而易見的取捨描述為更強的價格效率,而非明顯更優的對話品質。
報導中最強的效能主張來自 Artificial Analysis Speech-to-Speech Leaderboard。The Decoder 表示,Gemini 3.8 Live Extended Thinking 取得 82.6%,並在最新的 OpenAI GPT-Live-1 模型之前排名第一。
這是一項基準測試結果,並不代表 Google 的模型在每一種應用中都會提供最佳體驗。排行榜分數可能取決於測試設計、提示詞、評估標準與模型版本。來源證據並未提供排行榜的方法論、信賴區間,或模型在哪些部分得分或失分的細節。
報導對對話自然度的評估,也建立在聆聽示範內容之上。這對市場脈絡有幫助,但不是對延遲、中斷復原、事實準確性、工具使用可靠度或使用者滿意度的受控評估。來源與現有證據都沒有提供 Gemini 3.8 Live 的獨立採用數據、客戶案例或生產可靠性資料。
對評估這次發布的團隊來說,實務測試可能會是任務層級的表現,而不是單一的 speech-to-speech 分數。建構者應比較回應延遲、輪替發言、插話行為、發音、多語一致性,以及不同說話模式下的對話成本。他們也應測試模型是否能正確處理視覺情境與 API 動作,而不造成不安全或令人困惑的中斷。
Google 的策略很直接:讓即時語音開發更便宜,同時提供足夠的多模態與工具使用能力,吸引已在嘗試 AI 代理的開發者。透過 Gemini API 與 Google AI Studio 存取,降低了原型製作門檻,而 GitHub 範例則可能幫助團隊更快從示範走向初步應用。
最大的機會在於那些語音互動頻繁,但不需要最像真人對話的產品。客服分流、內部助理、語音搜尋、現場服務工具與免持工作流程,都可能受益於較低的音訊成本。不過,涉及銷售、醫療、金融或其他敏感對話的應用,可能會比價格更重視自然的輪流發言、可預測的行為、資料控制與可稽核性。
這次發布也讓在不同模型供應商之間做選擇的企業面臨部署問題。如果模型需要更多重試、產生更生硬的輪替,或需要額外協調才能追上競爭對手的體驗,那麼較低的每分鐘費率可能會被工程成本抵消。因此,團隊應計算完成每個任務的總成本,而不只是音訊 token 或每分鐘價格。
第一個訊號將是 Gemini 3.8 Live 對 GPT-Live-1 在延遲、中斷、視覺推理、多語語音與工具執行上的獨立測試。Artificial Analysis 的排名提供了初步參考,但更廣泛的評估將顯示這個結果是否能在基準測試環境之外成立。
開發者也應關注真實生產使用的證據:具名客戶、公開案例研究、使用數據,以及更清楚的服務限制。Google 的價格可能會吸引試驗,但持續採用仍取決於可靠性、可用性,以及周邊 API 工具的品質。
最後,兩家公司之後的模型更新可能會迅速改變這項比較。OpenAI 可能以更低價格或更佳存取性回應,而 Google 則可能優先提升更自然的輪流發言。競爭問題不只是今天誰比較便宜,而是誰能在規模化下提供可接受的語音品質與可靠的代理行為。
Gemini 3.8 Live 給了開發者一個可信的理由,重新思考語音 AI 的經濟性。Google 報導中的價格優勢大到足以改變產品實驗,特別是圍繞頻繁或長時間對話打造的應用。
但這次發布並沒有消除成本與互動品質之間的核心取捨。最有價值的評估,應該把報導中的基準測試與真實工作流程結合起來,因為在那裡延遲、中斷、工具呼叫與安全性和排行榜分數一樣重要。就目前而言,Google 已經提出成本面的論點;開發者仍需確認這樣的體驗是否足以滿足他們的使用者。