AWS 將 Moonshot AI 的 Kimi K3 帶入 Amazon Bedrock,支援長上下文與提示快取

AWS 已將 Moonshot AI 的 Kimi K3 加入 Amazon Bedrock,讓開發者取得具備視覺、長上下文與提示快取能力的開放權重模型。

AI News

Amazon Web Services 已將 Moonshot AI 的 Kimi K3 提供於 Amazon Bedrock,新增一款鎖定程式開發與知識工作負載的開放權重模型。這次發布讓開發者可透過 AWS 管理的推論 API,使用原生影像理解、100 萬 token 的上下文視窗,以及明確的提示快取。

這項發布對於建立長時間運作的代理與程式開發系統的團隊最為重要,因為這些系統會反覆送入大型程式庫、參考文件或工具指令。AWS 表示,Kimi K3 可在 Bedrock 主控台中測試,或透過 Bedrock API 程式化呼叫,包括相容於 OpenAI 的介面。不過,該公告中最強的能力與效率主張來自 Moonshot AI 或 AWS,而非獨立評測。

Kimi K3 以開放權重的 Bedrock 選項登場

Kimi K3 由 Moonshot AI 開發,該公司也是 Kimi 模型家族的推出者。根據 AWS Machine Learning Blog,Moonshot AI 將 Kimi K3 描述為其最具能力的模型,並宣稱它是第一個達到 2.8 兆參數的開放模型。AWS 也轉述 Moonshot 宣稱相較於 Kimi K2,在擴展效率上約提升 2.5 倍。

這些數字皆為供應商宣稱,現有公告並未提供獨立的基準測試方法、價格比較,或與競品模型對照的評測結果。對開發者而言,更具體的改變是部署存取方式:Kimi K3 現在可在 Amazon Bedrock 中與其他支援模型一同選用,而不必再由客戶自行管理另一套服務堆疊。

該模型結合原生視覺能力與 100 萬 token 的上下文視窗。這種配置與需要在工作上下文中保留大量資料的應用相關,包括軟體儲存庫、技術文件、冗長的商業紀錄,以及包含影像的檔案。大型上下文視窗本身並不能保證對所有材料都能可靠推理,因此生產團隊仍需要檢索、評估與上下文管理控制。

提示快取鎖定重複上下文

AWS 將明確提示快取定位為 Kimi K3 在 Bedrock 上的主要實用差異化功能之一。此功能允許開發者標記可重複使用的提示前綴,例如儲存庫指令、工具定義或參考資料。前綴必須至少包含 1,024 個 token,且可在後續模型呼叫中重複使用。

當後續請求與已快取的前綴相符時,AWS 表示 Bedrock 可降低回應延遲與輸入 token 成本。快取的 token 在寫入時會以較高費率計費,但 AWS 指出它們至少可保留 30 分鐘。相符的請求可享有折扣後的輸入 token 定價,而快取 token 不會計入每分鐘輸入 token 配額。

這種設計對 AI 程式開發助理 與代理工作流程尤其相關。代理可能在數十輪對話中反覆傳送相同的系統指引、程式碼庫地圖或工具結構。快取可減輕重複輸入的負擔,但財務效益取決於快取命中率、提示長度、請求頻率與適用的區域定價。AWS 的公告未說明 Kimi K3 的每 token 價格。

Bedrock 負責存取、API 與資料控制

開發者可透過 Amazon Bedrock 主控台開啟 Test and Playground,然後選取模型來試用 Kimi K3。應用程式可使用 Bedrock Runtime 端點、Amazon Bedrock 的 Invoke 與 Converse API,或相容於 OpenAI 的 Responses 與 Chat Completions API。

AWS 透過跨區域推論設定檔支援此模型。名為 global.moonshotai.kimi-k3 的全球設定檔可將請求路由至全球受支援的 AWS 商業區域。AWS 表示,全球跨區域推論的成本大約比地理設定檔低 10%。對於有美國資料駐留要求的客戶,公告列出 us.moonshotai.kimi-k3 作為美國地理設定檔。

AWS 也表示,Kimi K3 繼承了平台對開放權重模型所聲稱的控制:資料會在 AWS 資料邊界內處理,不會與模型供應商共享,也不會用於訓練底層模型。公司稱,推論請求已啟用零資料保留,且零操作員存取可防止 AWS 操作員在推論期間存取提示與完成內容。這些都是 AWS 的服務與政策說法;買家仍應針對自身工作負載驗證確切的設定、區域路由、記錄與合約條款。

證據、生態系與建置者影響

這項公告將 Kimi K3 放在 AWS 在 Bedrock 上擴展開放權重模型的更大脈絡中。AWS 表示,自 2025 年以來,該服務已新增來自 DeepSeek、Google、MiniMax、Mistral AI、Moonshot AI、NVIDIA、OpenAI 與 Qwen 等供應商的數十個模型。它也表示,Bedrock 在 2026 年新增了平台層級對工具呼叫、結構化輸出、推理、回應串流,以及 Responses 與 Chat Completions API 的支援。

對建置者來說,平台層級功能可降低測試不同模型時所需的整合工作。團隊可以使用既有的 Bedrock 驗證、權限、可觀測性與應用程式程式碼來評估 Kimi K3,而不必建立另一條推論路徑。AWS 列出的模型呼叫所需權限包括 bedrock:InvokeModel、bedrock:InvokeModelWithResponseStream 與 bedrock:CreateInference。

公告也強調了 OpenCode,一款具備原生 Amazon Bedrock 提供者、與模型無關的開源程式開發助理,以及 Hermes Agent,一款支援研究與任務自動化的開源生產力助理。這些範例顯示 Kimi K3 可如何融入既有工具,但它們屬於整合案例,而非廣泛採用或優於他人的證據。

對企業團隊而言,實際決策很可能取決於工作負載經濟性與可靠性。Kimi K3 的長上下文與快取,可能有助於輸入穩定且重複的應用,而跨區域推論則可提供成本或容量上的取捨。對於有嚴格資料駐留或法規要求的團隊,必須仔細選擇地理設定檔。他們也應在自家儲存庫與文件上測試輸出品質,特別是對於長期程式開發任務,因為單靠上下文長度不一定能避免錯誤。

接下來要關注什麼

接下來有價值的訊號將是針對 Kimi K3 在程式開發、視覺、工具使用與長上下文檢索上的獨立評測。公開定價細節與真實世界的快取命中經濟性,將決定明確提示快取是否會實質改變應用總成本。

開發者也應關注在持續代理工作負載下的延遲、區域可用性、速率限制與故障行為的生產報告。程式開發助理與代理框架的採用,可能提供更清楚的 संकेत,顯示透過 Bedrock 存取是否能讓 Kimi K3 成為其他託管與自我管理模型的實用替代方案。

Creati.ai 觀點

Kimi K3 的重要性,不在於單一的參數數字主張,而在於開放權重存取、長上下文、原生視覺與快取,在受管理雲端環境中的組合。AWS 正讓團隊更容易測試這些能力,同時不必放棄周邊的 Bedrock 部署模式。

最大的未確定因素仍是證據。Moonshot AI 對規模與效率的主張,在提供的材料中並未獲得獨立佐證,而 100 萬 token 視窗也不會自動轉化為可靠的代理行為。建置者應將這次發布視為新的評估目標:對於具有重複上下文與大型輸入的工作負載很有用,但仍需在應用層級測試品質、成本與資料治理適配性。

廣告