AWS 展示 OpenCode 如何將 Bedrock 的開源權重模型變成程式碼代理

AWS 向開發者展示如何將 OpenCode 與 Amazon Bedrock 中的開源權重模型配對,為 AWS 帶來私有、彈性、按使用量付費的 AI 程式碼代理。

AI News

Amazon Web Services 正將 Amazon Bedrock 定位為讓開發者在其 AWS 環境內執行使用開源權重模型的 AI 程式碼代理的一種方式。AWS 在一篇 Machine Learning Blog 文章中,詳細說明了如何將開源、以終端機為基礎的程式碼代理 OpenCode 連接到包括 Kimi K3、GPT-OSS 120B 和 NVIDIA Nemotron 3 Super 120B 在內的模型。

這項指引之所以重要,是因為程式碼代理可以存取原始碼、執行 shell 指令、修改檔案,並跨多個儲存庫工作。AWS 主張,將 OpenCode 與 Bedrock 搭配,可為團隊提供一個替代方案,避免把專有程式碼送到獨立的模型供應商,或支付固定的每席位程式碼訂閱費。這種安排仍依賴 AWS 托管的模型存取與按使用量計費,因此更應理解為一種部署模式,而非一個新宣布的程式碼產品。

AWS 的提案是什麼

根據 AWS 的說法,OpenCode 是在開發者的終端機本地執行,而模型推論則透過 Amazon Bedrock 處理。這個代理可以讀寫檔案、執行指令、透過 Language Server Protocol 診斷理解專案結構,並連接超過 75 家大型語言模型供應商。Bedrock 就是其中之一。

AWS 的範例聚焦於開源權重模型,而不是單一預設模型。開發者可以將 OpenCode 設定為針對不同工作使用不同模型,例如讓偏向推理的模型去調查棘手的錯誤,讓更快的模型產生樣板程式碼或協助互動式程式設計。

文章中強調的模型涵蓋了不同的運作特性。AWS 表示,Kimi K3 支援 100 萬 token 的上下文視窗與可設定的推理深度。OpenAI GPT-OSS 120B 被列為另一個開源權重選項,而 NVIDIA Nemotron 3 Super 120B 則被用來處理對吞吐量敏感的工作負載。AWS 也引述 NVIDIA 的說法,指出由於其 Mixture-of-Experts 設計每個 token 只會啟用總參數的一部分,因此 Nemotron 的吞吐量最高可達 7 倍。

對建構者來說,實際上的改變是透過 Bedrock 設定來選擇模型,而不是重寫程式碼工作流程。AWS 表示,切換模型可透過 API 參數處理,不過團隊仍需測試行為、調整提示詞,並考量工具使用與輸出品質的差異。

安全性與運作模式

AWS 表示,在使用相關的 Bedrock 設定與區域時,程式碼、提示詞與回應都會保留在客戶的 AWS 帳戶內。文章指出既有的 AWS 控制項,包括 Identity and Access Management、CloudTrail 記錄、PrivateLink 連線與加密。文章也表示,Bedrock 不會使用客戶輸入或輸出來訓練或改善 foundation models。

對於評估程式碼代理是否符合資料駐留與合規要求的公司來說,這些聲明很重要。AWS 表示,Bedrock 適用於多個常見合規計畫,包括 HIPAA、SOC 2、ISO 27001、FedRAMP 與 GDPR。不過,某項服務的合規涵蓋範圍並不會自動讓每個客戶部署都合規;組織仍然需要正確設定存取、記錄、保留與區域路由。

文章描述了 Bedrock 的三種定價層級:Priority 用於對延遲敏感的正式環境流量,Standard 用於隨選推論,Flex 用於可容忍可變延遲的工作負載。AWS 表示,Flex 的費用比 Standard 低 50%。文章也描述了受支援模型的全球與地理推論設定檔,包括一個供有美國處理需求的工作負載使用的美國設定檔,以及一個可將請求路由到受支援商業 AWS 區域的全球設定檔。

這種架構避免了 GPU 配置與模型服務營運,但並沒有消除治理需求。團隊仍必須控制代理可存取哪些儲存庫、限制 shell 權限、審查生成的變更,並在代理執行多步驟工作時監控 token 消耗。

效能與採用聲明背後的證據

AWS 文章中最強的主張,來自 AWS 引用的供應商報告或第三方資料,而非這次宣布所做的獨立測試。AWS 引述一份 2025 年的 McKinsey 報告,指出 76% 的組織預期會增加對開源 AI 的使用,而領先的 AI 採用者更可能使用開源權重模型。文章也引用了 CrowdStrike 的一項結果:經微調的 NVIDIA Nemotron 模型據報在有效查詢準確率上達到 96%,相較之下 GPT-4o 為 61%,Claude Sonnet 4.5 為 94%。

這些數字或許能支持針對特定任務的開源權重模型,但不應被視為程式碼代理的一般排名。結果會因資料集、提示詞、微調方法、評估標準與工具存取而有顯著差異。AWS 建議使用 Artificial Analysis Coding Index,該指標結合了 SWE-Bench 與 Terminal-Bench 等軟體工程基準,並建議使用 Amazon Bedrock Evaluations 進行並排測試,搭配自動評分、模型判定或人工審查。

AWS 也提到 Ethara.AI 使用此架構進行多代理工程與研究工作流程的正式部署。文章將此案例作為實作參考,但沒有提供獨立的使用資料、客戶規模指標或詳細成本比較。所提供來源集合中的另一個 AWS 清單只是重複了文章標題,並未增加獨立報導。

為什麼這種模式對 AI 團隊重要

對開發者來說,最大的吸引力在於營運彈性。程式碼代理可以使用更大的推理模型來做架構規劃或複雜除錯,然後將例行程式碼生成路由到更快或更便宜的模型。這種做法可能降低不必要的推論成本,尤其是在代理消耗的 token 遠多於單次對話請求時。

對企業買家而言,更關鍵的問題是 AWS 的控制是否足以支援代理式存取原始碼與開發環境。將推論保留在 AWS 帳戶內,對現有 AWS 客戶來說或許能簡化採購與網路設計,但並不能單獨保證準確性、保密性或安全執行。人工審查、沙箱化、密鑰管理與稽核軌跡仍是核心需求。

開源權重存取也改變了模型供應商的競爭計算。當品質、價格、區域可用性與授權條款改變時,團隊理論上可以在不同模型間切換。這降低了對單一模型供應商的依賴,但也帶來新的評估工作。即使周邊代理不變,模型行為、上下文處理、工具呼叫與拒絕模式仍可能不同。

經濟性同樣取決於工作負載。AWS 主張開源權重模型可以降低每 token 成本,並表示 Kimi K3 的全球跨區域推論大約比地理設定檔便宜 10%。實際節省將取決於模型選擇、路由、上下文大小、重試、代理迴圈,以及審查錯誤變更的成本。若產生更多修正工作,再便宜的 token 也不一定代表更便宜的軟體開發流程。

接下來值得關注什麼

第一個訊號將是針對 OpenCode 與由 Bedrock 託管的模型,在儲存庫規模任務上的獨立評估,特別是除錯、重構與安全命令執行。比起基準分數,成功完成任務率、審查時間、延遲與每個被接受變更的總成本會更有參考價值。

團隊也應該關注 AWS 各區域的模型可用性、個別開源權重模型的授權條款,以及 Bedrock 是否會為代理工作流程新增更多路由與評估工具。正式採用不僅取決於模型品質,也取決於對 shell 存取、儲存庫權限、prompt injection 與機密暴露的控制。

最後,如果 AWS 引用的正式部署案例能提供工作負載量、失敗率、模型路由政策與成本比較,將會更有資訊量。若沒有這些證據,這種架構雖然有前景,但仍主要是一種由供應商文件化的實作模式。

Creati.ai 觀點

AWS 並不是在宣布某個模型已成為最終定案的程式碼代理。它更重要的動作,是把模型可互換性納入工作流程:OpenCode 提供本地代理介面,而 Bedrock 提供對多個開源權重模型與 AWS 安全控制的代管存取。

這種分工可能吸引那些已在 AWS 上運作、並且希望比固定程式碼訂閱更具控制力的團隊。但商業與技術上的成敗,將取決於可衡量的任務成功率、治理品質與整體工作流程成本,而不只是開源權重這個身分。建構者應將 AWS 的設定視為自己評估的起點,而不是替代品。

廣告