AI News

根據 AWS Machine Learning Blog 的案例研究,OneAdvanced 已打造出一個英國主權 AI 平台,在部署於 AWS 倫敦區域的基礎設施上運行超過 50 個專門代理。這家英國企業軟體供應商在其想於該區域使用的 AWS 管理式服務中無法取得模型後,便自行託管 Meta 的 Llama 4 Maverick 與 Llama Guard 4。

此部署是為 OneAdvanced 在醫療保健與法律服務等受監管產業中的客戶所設計,因為資料所在地是採購與合規的核心要求。其架構結合了用於模型服務的 Amazon SageMaker AI、用於代理工作負載的 Amazon ECS,以及以 Amazon Aurora PostgreSQL-Compatible Edition 搭配 pgvector 建構的檢索系統。

這個專案說明了企業 AI 團隊面臨的一個務實取捨:管理式模型服務可以加速實驗,但主權需求可能要求客戶自行操作模型、GPU、協調編排、安全控管與資料管線。

從 Bedrock 原型到自架模型

OneAdvanced 起初是用 Amazon Bedrock 來原型化其 AI 能力。AWS 表示,該公司在兩週內產出了一個可運作的衝刺版本,涵蓋聊天完成、查詢英國成文法的代理、Snowflake 整合,以及圖表生成。

然而,這種作法無法滿足公司要求:模型必須僅在其位於英國的自有 AWS 帳戶中執行。在 AWS 所描述的合作當時,Llama 4 Maverick 與 Llama Guard 4 在英國區域相關的管理式服務中並不可用。因此,OneAdvanced 改採自架設計,使用可直接控制的英國基礎設施。

最終形成的英國主權 AWS 平台,透過 Amazon SageMaker AI 端點上的 vLLM 提供 Llama 4 Maverick 與 Llama Guard 4。這些模型在倫敦區域的 p5.48xlarge 執行個體上運行,使用 Hugging Face 模型與 AWS Deep Learning Containers。AWS 表示,OneAdvanced 最初使用的是 p4d.24xlarge 執行個體,之後為了生產環境與更長的上下文需求而轉向 P5 硬體。

該公司將大約 120,000 到 128,000 token 的上下文視窗作為目標,用於大型文件分析與多輪對話。AWS 報告稱,在其顧問協作期間進行的壓力測試已驗證吞吐量需求,但案例研究並未提供延遲、請求量、可用性或成本數據。

代理平台如何運作

核心代理層由超過 50 個任務特化代理組成,這些代理以 Strands Agents SDK 建立並部署在 Amazon ECS 上。每個代理都有自己的系統提示與工具設定,而可選的輸入表單則支援那些不想透過開放式聊天介面互動的使用者。代理設定儲存在 Amazon DynamoDB 中。

AWS 表示,OneAdvanced 在三週內從第一個代理成長到超過 50 個,其中大多數代理在不到一天內完成。這個代理庫涵蓋醫療、法律工作、人力資源、行銷、物流與教育等領域。AWS 提供的例子包括照護事件回應助理、臨床安全公告產生器、文件比較工具、績效評估助理,以及 AWS Architect Agent。

工作流程在 Llama Guard 4 先檢查使用者請求是否含有有害內容時開始。若請求通過,便會路由到 Amazon ECS 上適當的代理。該代理可以呼叫專門工具,從儲存在 Amazon S3 的文件中擷取相關資訊,並搜尋由 pgvector 支援的向量索引。

上傳到 S3 的文件會被轉換為 Markdown、切分成區塊,並建立向量嵌入以供檢索。這個 Retrieval Augmented Generation,或稱 RAG,層旨在讓回應立基於組織自身的材料,而不是完全依賴模型內部知識。

證據顯示了什麼,以及沒有顯示什麼

詳細的技術說明來自 AWS;AWS 曾為 OneAdvanced 提供顧問協助,並將該架構作為客戶案例研究發布。因此,關於採用與速度的最強說法——包括代理庫的規模、三週的建置期間,以及多數代理少於一天完成的說法——都是供應商回報,而非獨立審核。

同樣的限定也適用於所報告的壓力測試結果。AWS 表示該部署滿足了 OneAdvanced 的吞吐量要求,但來源並未披露測試方法、流量特徵、回應時間目標、失敗率或生產使用率。它也沒有說明超過 50 個代理中有多少個正被客戶積極使用,或提供其商業影響的細分。

以架構描述來看,主權成果更為具體。AWS 表示,此解決方案將模型託管與客戶資料保留在英國環境內,並協助支援 OneAdvanced 的 AI 治理 ISO 42001 認證。這不應被解讀為已自動滿足所有下游合規義務:資料所在地、存取控制、保留、可稽核性與供應商治理,仍取決於整體服務如何設定與營運。

OneAdvanced 的 CTO Andrew Henderson 將英國資料主權描述為許多公共部門與受監管客戶的硬性要求。這個管理層的理由解釋了核心設計選擇,但仍是公司的立場,而非對平台合規狀態的獨立評估。

為什麼這次部署對 AI 建構者重要

對產品團隊來說,這個案例凸顯了「把資料留在國內」這類看似簡單要求背後隱藏的工程成本。當所需模型未出現在本地管理式服務目錄中時,團隊可能需要取得模型授權、取得稀缺的 GPU 容量、部署推論伺服器、實作擴展機制,並自行維護安全與檢索層。

這個架構也將在託管式 AI API 中常被捆綁在一起的責任拆分開來。SageMaker AI 處理模型端點,ECS 執行代理與工具,S3 儲存來源文件,Aurora PostgreSQL 提供向量資料庫,DynamoDB 則儲存代理設定。這種模組化讓 OneAdvanced 擁有控制權,但也帶來更多需要監控、保護與排錯的操作介面。

從 Llama Guard 3 轉向 Llama Guard 4 也是一個實務訊號。AWS 表示,OneAdvanced 在較早的模型上觀察到高誤拒率,因此將其替換。先在主模型前串行過濾請求可降低部分風險,但也新增一個必須測試的門檻,涵蓋誤判、漏判、延遲,以及語言或領域覆蓋。

對企業買家而言,代理數量不如其背後的治理模型重要。50 個代理的庫可以讓專門化工作流程更容易包裝,但每個代理都會引入提示、工具、權限、檢索來源,並可能帶來不同的失敗模式。無程式碼代理建構器可以擴大非技術使用者的可及性,但也提高了核准流程、測試、版本控制與使用監督的需求。

下一步值得關注什麼

接下來真正有用的訊號會是營運層面的,而不只是新聞標題上的代理數量。OneAdvanced 可能會揭露生產使用情況、回應時間與可靠度目標、GPU 使用率,或自架與管理式推論之間的成本差異。這些數字可協助買家判斷,主權是否足以抵銷額外的基礎設施負擔。

同時也值得觀察,相關的 Llama 模型是否會在英國透過管理式 AWS 服務提供,以及這是否會改變 OneAdvanced 的架構。若有本地管理式選項,可能在保留資料所在地需求的同時降低平台維護工作量,不過該公司也可能仍保留自架,以便控制模型版本與設定。

後續證據也應說明部署後代理如何受到治理:誰可以發佈新工具、檢索來源如何獲批、如何稽核有害內容判定,以及 ISO 42001 流程是否涵蓋整個代理生命週期。這些細節對受監管客戶而言,會比初始原型的速度更重要。

Creati.ai 觀點

OneAdvanced 的部署之所以值得注意,不是因為「50 個代理」是 AI 成熟度的通用衡量標準,而是因為它揭示了 AI 示範與主權企業平台之間的實務界線。該公司先用管理式服務進行早期實驗,之後在區域模型可用性無法滿足其資料需求時,接受了自架所帶來的營運複雜度。

對建構者而言,教訓是把資料所在地、模型可用性、安全篩檢、檢索品質與 GPU 經濟性視為同一個架構決策。對買家而言,AWS 的說法是一個可行模式的有用證據,但缺少的生產指標意味著它應被視為實作藍圖——而不是已經經過獨立驗證的基準。

精選

OneAdvanced如何在英國主權AWS上部署50多個AI代理

OneAdvanced在AWS上打造了英國主權AI平台,搭配50多個代理與自架Llama模型,鎖定受監管客戶與英國資料管控需求。