
Google 擴充了 Gemini 產品線,推出三款面向更低成本、較快速生產用途的新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 與 Gemini 3.5 Flash Cyber。這次發布為正在打造 AI 代理與程式開發工作流程的開發者增加了更多選擇,但也凸顯出 Google 更尷尬的一點:公司預期的高階推理模型 Gemini 3.5 Pro,至今仍未對外公開。
根據 TechCrunch AI 與 The Decoder 的報導,Google 將這些新模型定位在效率、延遲與可靠性,而不是引人注目的前沿能力大躍進。這很重要,因為企業 AI 的競爭壓力,已不再只是看誰的 benchmark 最強。許多開發者要的是能夠以低成本大規模運行、快速回應,並支援生產環境代理系統、且不會讓 token 成本失控的模型。不過,缺少新的公開版 Pro,仍使 Google 在買家與研究者尋求最強推理與編碼表現的市場區塊中暴露出弱點。
Axios 也報導 Google 發布了一系列更便宜的 Gemini 模型,進一步強化了這次發布的核心訊息:這是一次關於成本與實用性的更新,而不是旗艦模型時刻。
此次發布的核心是 Gemini 3.6 Flash。根據 TechCrunch AI,Google 將其描述為新的「主力模型」。公司表示,這個模型在編碼、知識工作與多模態表現上都有提升,同時相較於 Gemini 3.5 Flash,token 使用量最多可降低 17%。The Decoder 補充了更多細節,報導 Google 也提到在特定基準測試上的更大節省,包括在 DeepSWE 上最多可減少 65% token 的說法。
這個差異很重要。17% 的數字看起來描述的是較廣泛的效率預期,而 65% 的數字則與較狹窄的 benchmark 條件相關。和大多數模型發布指標一樣,這些節省不一定能平均轉移到真實的生產工作負載上。
Google 也推出了 Gemini 3.5 Flash-Lite,並將其定位為這一類中成本最低的選擇,針對低延遲與高吞吐量進行調校。對於執行客服流程、輕量編碼輔助、分類任務或帶有工具呼叫的代理團隊來說,這種定位可能比純粹的推理品質更重要。The Decoder 報導 Flash-Lite 的定價為每百萬輸入 token 0.30 美元、每百萬輸出 token 2.50 美元,並指出第三方 benchmark 匯總平台 Artificial Analysis 預估其輸出速度為每秒 350 tokens。
第三款模型 Gemini 3.5 Flash Cyber 則更為專門,也更受限。根據 TechCrunch AI,Google 將其針對尋找與修補資安漏洞進行微調,並透過受限存取試點僅提供給政府與可信合作夥伴。The Decoder 報導,這款模型已內建於 Google DeepMind 的程式碼安全代理 CodeMender 中,但透過 Gemini Enterprise Agent Platform 對 CodeMender 的廣泛預覽存取,使用的是標準 Gemini 模型,而非受限的 Cyber 版本。
這次發布受到關注,不只是因為 Google 推出了新的 Gemini Flash 變體,也因為 Gemini 3.5 Pro 依然缺席。TechCrunch AI 指出,Google 先前在 5 月推出 3.5 Flash 後,曾暗示會接著發布 Pro,並表示它已在內部使用、很快就會推出。那個時程已經延後。
TechCrunch AI 引述 Google DeepMind 產品負責人 Logan Kilpatrick 的說法,表示公司正在與合作夥伴測試 Gemini 3.5 Pro,並希望它「很快到來」。The Decoder 也報導,Google 表示這款模型仍在合作夥伴測試中,會在準備好後再推出。兩家媒體都未提供已確認的公開發布日期。
這個延遲很重要,因為在 Google 的命名中,Pro 模型通常代表公司在複雜推理與編碼上的更高能力層級。若沒有新的公開 Pro 版本,Google 的可見動能就落在效率區段,而不是前沿區段。
市場背景並不樂觀。TechCrunch AI 指出,自 Google 2 月最後一次 Pro 更新以來,OpenAI 與 Anthropic 都有新發表。The Decoder 更進一步,主張美國與中國的競爭實驗室正在高階領域更積極前進,並舉出 GPT-5.6、Claude Opus 4.8 與 Kimi K3 等產品。有些比較反映的是媒體解讀,而非官方跨供應商測試,但競爭訊號很清楚:Google 正在推出更適合生產部署的模型,而競爭者也在爭奪最高能力系統的領先地位。
Google 的說法顯示這是一個刻意的產品選擇,而不只是延遲故事。TechCrunch AI 報導,公司的明確重點是幫助客戶以更好的效率、可靠性與延遲,擴大建構 AI 代理。這與許多企業部署實際上成敗的方式一致。
對生產團隊來說,稍微提升的效能若再加上更少的 token 使用,可能比昂貴、難以編列預算,或對互動式工作流程來說太慢的旗艦模型更有價值。Gemini 3.6 Flash 看起來就是為了這個實用中間地帶而設計:比先前的 Flash 變體更好的編碼與多模態表現,但成本結構則是為了廣泛部署而打造。
The Decoder 報導,Gemini 3.6 Flash 相較於 Gemini 3.5 Flash,在 DeepSWE、MLE Bench、OSWorld-Verified 與 GDPval-AA v2 上都有 benchmark 提升。它還指出,Gemini 3.6 Flash 保留了 100 萬 token 的上下文視窗,且 Computer Use 現在已成為 Gemini API 與 Gemini Enterprise 的內建用戶端工具。如果這些功能能在生產環境中穩定運作,將強化 Google 對於建構需要瀏覽器、桌面或應用程式互動,而不只是聊天回應的代理式軟體團隊的吸引力。
這個策略也符合更廣泛的市場趨勢。企業 AI 買家越來越把「最佳模型」與「最適合工作的模型」分開看待。客服流程、程式碼審查管線或文件分流系統,可能更需要可預測的延遲與可控的 token 帳單,而不是前沿級推理。從這個角度看,Gemini 3.5 Flash-Lite 與 Gemini 3.6 Flash 目標是市場中最大、最實際的一塊,即便它們無法定下名聲之爭。
這些發布中最強的性能說法,要不是出自 Google 本身,就是來自引用 benchmark 結果的二手報導,因此需要保持謹慎。
針對 Gemini 3.6 Flash,TechCrunch AI 引述 Google 的說法是,相較於 Gemini 3.5 Flash,token 使用量最多可減少 17%。The Decoder 則報導了更細緻的 benchmark 差異與定價,並提到 Google 聲稱在 DeepSWE 上最多可節省 65% token。這些數字可能具有意義,但除非經過獨立重現,否則仍屬於與 benchmark 綁定、由供應商提出的數據。
對於 Gemini 3.5 Flash-Lite,The Decoder 引用了 Artificial Analysis 的吞吐量估算,並報導 Google 與早期 Flash 模型的比較。這些對買家來說是有用的訊號,但不等於中立的生產研究。
Gemini 3.5 Flash Cyber 則包含最敏感的說法。The Decoder 報導,在 CyberGym benchmark 上它拿下 83.2%,接近 OpenAI 的 GPT-5.5-Cyber 的 85.6%,並描述 Google 團隊在 Chrome、Safari、V8 與公開 API 上的內部測試。它也報導 Google 表示,該模型找到了遠端程式碼執行漏洞,並在一次測試中產生了可運作的 exploit。這些能力相當嚴重,且明顯具有雙重用途的含意,也很可能是 Google 嚴格限制存取的原因。不過,這些說法是基於 Google 自行評估與內部部署,而非廣泛公開測試。
報導同時指出更強的安全控管。The Decoder 表示,Google 已加入針對 CBRN 與資安濫用的 Frontier Safety 防護措施。對企業治理團隊而言,這是一個重要訊號,但目前提供的證據並未詳述精確的營運限制與紅隊測試結果。
對開發者而言,直接的結論是 Google 正更強力地押注 AI 代理的經濟性。如果 Gemini 3.6 Flash 能在更少 token 使用下提供更好的編碼與多模態表現,那它對於需要在長工作流程中反覆呼叫模型的生產系統就更具吸引力。
對企業而言,Gemini 3.5 Flash-Lite 可能比標題所顯示的更關鍵。低成本、高吞吐量的模型,往往決定 AI 功能能否被大規模推廣到大量員工或客戶互動中。高階推理模型與快速、便宜的服務模型之間的差異,甚至可能決定一項產品究竟能否推出。
受限提供的 Gemini 3.5 Flash Cyber 指向第二個主題:專門化模型正在企業 AI 內成為更清楚的產品類別。供應商不再讓單一通用模型包辦一切,而是越來越把堆疊切分成針對編碼、安全、研究或大量工作流程自動化的最佳化工具。CodeMender 與 Gemini Enterprise Agent Platform 都符合這個方向。
Google 的缺點在於戰略形象。若買家認為 Google 在高效率服務層最強,但在公開可用的前沿模型上仍不具競爭力,那麼在 Gemini 3.5 Pro 到來之前,一些高風險的編碼與研究工作負載可能會轉向 OpenAI 或 Anthropic。即使許多真實部署仍然運行在更便宜的 Flash 類系統上,這種印象依然可能很重要。
第一個要看的是 Gemini 3.5 Pro 的時間點與定位。如果 Google 很快推出,且在編碼與推理上有明顯提升,那麼這週的 Flash 發布就會更像是實際的產品組合擴張,而不是因延遲而作出的妥協。
第二,要觀察第三方測試是否能驗證 Google 對 Gemini 3.6 Flash 的效率主張,以及對 Gemini 3.5 Flash-Lite 的吞吐量主張。來自開發者與 benchmark 團隊的獨立測量,比發布當天的圖表更重要。
第三,要留意 Google 會把 Gemini 3.5 Flash Cyber 的存取開放到什麼程度,以及 CodeMender 是否會在安全團隊中獲得採用。對於雙重用途系統,嚴格存取限制是可以理解的,但限制可得性也可能削弱市場影響力。
最後,TechCrunch AI 引述 Logan Kilpatrick 的說法,指 Google 已經展開迄今最具野心的 Gemini 4 預訓練,這顯示公司希望讓市場相信,即使 Gemini 3.5 Pro 延後,前沿工作仍在前進。這種安撫是否足夠,取決於真正的出貨,而不是訊號。
Google 最新的 Gemini 發布,看起來不太像是要贏得模型排行榜,更像是承認 AI 預算實際上花在哪裡。對企業部署來說,真正困難的往往不是找到最聰明的模型,而是找到一個夠快、夠穩、夠便宜,而且一天能呼叫成千上萬次甚至數百萬次的模型。Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 正是直接回應這個現實。
但 Pro 的落差仍然重要。前沿模型會塑造開發者心智、影響高價值工作負載,並形成誰在 AI 領域設定節奏的印象。如果 Google 無法盡快把 Gemini 3.5 Pro 從合作夥伴測試推進到廣泛發布,該公司就有可能被視為在效率層最強,但市場上游由競爭者定義。對開發者而言,這代表 Google 今天已在提供實用的生產工具。對更廣泛的 AI 競賽而言,懸而未決的問題是:它的旗艦能力故事只是延後了,還是正在進一步落後。
Google 發表 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 與 Flash Cyber,在 Gemini 3.5 Pro 仍處於測試階段之際,進一步強化其低成本 AI 產品線。