
AWS Machine Learning Blog 사례 연구에 따르면, OneAdvanced는 AWS 런던 리전의 인프라에서 50개가 넘는 전문 에이전트를 실행하는 영국 주권 AI 플랫폼을 구축했다. 영국의 엔터프라이즈 소프트웨어 제공업체인 이 회사는 지역에서 사용하려던 AWS의 관리형 서비스로는 모델을 사용할 수 없게 되자, Meta의 Llama 4 Maverick과 Llama Guard 4를 자체 호스팅했다.
이 배포는 의료 및 법률 서비스와 같은 규제 산업의 OneAdvanced 고객을 위해 설계되었으며, 이들 산업에서는 데이터 거주성이 핵심적인 조달 및 규제 준수 요건이다. 아키텍처는 모델 서빙을 위한 Amazon SageMaker AI, 에이전트 워크로드를 위한 Amazon ECS, 그리고 pgvector가 포함된 Amazon Aurora PostgreSQL-Compatible Edition을 중심으로 구축된 검색 시스템을 결합한다.
이 프로젝트는 엔터프라이즈 AI 팀에게 현실적인 절충안을 보여준다. 관리형 모델 서비스는 실험을 가속화할 수 있지만, 주권 요건으로 인해 고객이 모델, GPU, 오케스트레이션, 안전 제어, 데이터 पाइ프라인을 직접 운영해야 할 수도 있다.
OneAdvanced는 처음에 Amazon Bedrock으로 AI 기능을 프로토타입했다. AWS에 따르면 이 회사는 2주 만에 채팅 완성, 영국 법령 조회 에이전트, Snowflake 통합, 차트 생성까지 포함한 동작하는 스프린트를 만들었다.
그러나 이 접근 방식은 모델이 영국 기반 자체 AWS 계정에서만 실행되어야 한다는 회사의 요구를 충족하지 못했다. AWS가 설명한 당시에는 Llama 4 Maverick과 Llama Guard 4가 영국 리전의 관련 관리형 서비스에서 제공되지 않았다. 이에 OneAdvanced는 직접 제어할 수 있는 영국 인프라를 사용하는 자체 호스팅 설계로 전환했다.
그 결과 만들어진 영국 주권 AWS 플랫폼은 Amazon SageMaker AI 엔드포인트의 vLLM을 통해 Llama 4 Maverick과 Llama Guard 4를 제공한다. 모델은 런던 리전의 p5.48xlarge 인스턴스에서 실행되며, Hugging Face 모델과 AWS Deep Learning Containers를 사용한다. AWS는 OneAdvanced가 처음에는 p4d.24xlarge 인스턴스를 사용하다가, 운영 환경과 더 긴 컨텍스트 요구를 위해 P5 하드웨어로 전환했다고 밝혔다.
이 회사는 대규모 문서 분석과 다중 턴 대화를 위해 약 120,000~128,000 토큰의 컨텍스트 윈도우를 목표로 한다. AWS는 자문 수행 중 실시한 부하 테스트가 처리량 요구를 검증했다고 보고했지만, 사례 연구에는 지연 시간, 요청량, 가용성, 비용 수치는 제공되지 않았다.
핵심 에이전트 계층은 Strands Agents SDK로 만든 50개 이상의 작업 특화 에이전트로 구성되며, Amazon ECS에 배포된다. 각 에이전트는 고유한 시스템 프롬프트와 도구 구성을 가지며, 선택적 입력 폼은 열린 채팅 인터페이스로 상호작용하고 싶지 않은 사용자들을 지원한다. 에이전트 구성은 Amazon DynamoDB에 저장된다.
AWS에 따르면 OneAdvanced는 첫 번째 에이전트에서 3주 만에 50개 이상으로 늘었고, 대부분의 에이전트는 하루도 채 걸리지 않아 만들어졌다. 라이브러리는 의료, 법무, 인사, 마케팅, 물류, 교육 등의 영역을 포함한다. AWS가 언급한 예시로는 케어 인시던트 대응 도우미, 임상 안전 공지 생성기, 문서 비교 도구, 성과 평가 도우미, AWS Architect Agent가 있다.
워크플로는 Llama Guard 4가 사용자 요청에 유해 콘텐츠가 있는지 검사하는 것으로 시작한다. 요청이 통과하면 Amazon ECS의 적절한 에이전트로 라우팅된다. 에이전트는 전문 도구를 호출하고, Amazon S3에 저장된 문서에서 관련 정보를 검색하며, pgvector로 지원되는 벡터 인덱스를 검색할 수 있다.
S3에 업로드된 문서는 Markdown으로 변환되고, 청크로 분할되며, 검색을 위해 임베딩된다. 이 Retrieval Augmented Generation, 즉 RAG 계층은 모델의 내부 지식에만 의존하지 않고 조직 고유의 자료에 기반해 응답하도록 하는 것을 목표로 한다.
상세한 기술 설명은 OneAdvanced에 자문한 AWS가 제공했으며, 아키텍처를 고객 사례 연구로 공개했다. 따라서 에이전트 라이브러리의 규모, 3주 구축 기간, 대부분의 에이전트가 하루도 걸리지 않았다는 주장 등 가장 강한 채택 및 속도 관련 주장은 독립 감사를 거친 것이 아니라 벤더 보고에 해당한다.
같은 한계는 보고된 부하 테스트 결과에도 적용된다. AWS는 배포가 OneAdvanced의 처리량 요구를 충족했다고 말하지만, 출처는 테스트 방법론, 트래픽 프로필, 응답 시간 목표, 실패율, 프로덕션 활용도는 공개하지 않는다. 또한 50개가 넘는 에이전트 중 몇 개가 고객에게 활발히 사용되는지, 비즈니스 영향이 어떤지에 대한 세부 내역도 제공하지 않는다.
주권 성과는 아키텍처 설명으로서 더 구체적이다. AWS는 이 솔루션이 모델 호스팅과 고객 데이터를 영국 환경 내에 유지하며 OneAdvanced의 AI 거버넌스용 ISO 42001 인증을 지원하는 데 도움이 되었다고 밝혔다. 하지만 이것이 모든 하위 규정 준수 의무가 자동으로 충족된다는 의미로 읽혀서는 안 된다. 거주성, 접근 제어, 보존, 감사 가능성, 공급업체 거버넌스는 여전히 전체 서비스가 어떻게 구성되고 운영되는지에 달려 있다.
OneAdvanced의 CTO인 Andrew Henderson은 영국 데이터 주권이 많은 공공 부문 및 규제 고객에게 절대적인 요구사항이라고 설명했다. 이 경영진의 논리는 핵심 설계 선택을 설명하지만, 이는 회사의 입장일 뿐 플랫폼의 규정 준수 상태에 대한 독립적 평가가 아니다.
제품팀에게 이 사례는 “데이터를 국내에 유지하라”처럼 단순한 요구 뒤에 숨어 있는 엔지니어링 비용을 드러낸다. 원하는 모델이 지역 관리형 서비스 카탈로그에 없을 경우, 팀은 모델 라이선스 확보, 희소한 GPU 용량 확보, 추론 서버 배포, 스케일링 구현, 안전 및 검색 계층 자체 유지보수가 필요할 수 있다.
이 아키텍처는 또한 호스팅된 AI API에서는 अक्सर 함께 묶이는 책임을 분리한다. SageMaker AI는 모델 엔드포인트를 처리하고, ECS는 에이전트와 도구를 실행하며, S3는 소스 문서를 저장하고, Aurora PostgreSQL은 벡터 데이터베이스를 제공하고, DynamoDB는 에이전트 구성을 저장한다. 이러한 모듈성은 OneAdvanced에 제어권을 주지만, 모니터링하고 보호하며 문제를 해결해야 할 운영 인터페이스도 더 많이 만든다.
Llama Guard 3에서 Llama Guard 4로의 전환도 실용적인 신호다. AWS에 따르면 OneAdvanced는 이전 모델에서 높은 오탐 거부율을 관찰하고 이를 교체했다. 본 모델 전에 요청을 순차적으로 검열하면 일부 위험은 줄일 수 있지만, 대신 오탐, 미탐, 지연 시간, 언어 또는 도메인 커버리지를 검증해야 하는 관문이 추가된다.
엔터프라이즈 구매자에게 중요한 것은 에이전트 수보다 그 뒤에 있는 거버넌스 모델이다. 50개 에이전트 라이브러리는 전문 워크플로를 패키징하기 쉽게 만들 수 있지만, 각 에이전트는 프롬프트, 도구, 권한, 검색 소스, 그리고 잠재적으로 서로 다른 실패 모드를 도입한다. 노코드 에이전트 빌더는 비기술 사용자에게 접근성을 넓힐 수 있지만, 승인 워크플로, 테스트, 버전 관리, 사용 감독의 필요성도 높인다.
다음으로 유용한 신호는 헤드라인의 에이전트 수보다 운영 지표가 될 것이다. OneAdvanced는 실제 프로덕션 사용량, 응답 시간 및 신뢰성 목표, GPU 활용률, 자체 호스팅과 관리형 추론의 비용 차이를 공개할 수 있다. 이런 수치는 구매자가 주권이 추가 인프라 부담을 정당화했는지 평가하는 데 도움이 될 것이다.
또한 관련 Llama 모델이 영국에서 관리형 AWS 서비스로 제공되기 시작하는지, 그리고 그것이 OneAdvanced의 아키텍처를 바꾸는지도 지켜볼 만하다. 지역 관리형 옵션은 데이터 거주 요건을 유지하면서 플랫폼 유지 관리를 줄일 수 있지만, 회사는 모델 버전과 구성을 통제하기 위해 자체 호스팅을 유지할 수도 있다.
추가 증거는 배포 후 에이전트가 어떻게 거버넌스되는지도 보여줘야 한다. 누가 새 도구를 게시할 수 있는지, 검색 소스는 어떻게 승인되는지, 유해 콘텐츠 결정은 어떻게 감사되는지, ISO 42001 프로세스가 에이전트의 전체 수명 주기를 포괄하는지 등이 그것이다. 이런 세부 사항은 초기 프로토타입의 속도보다 규제 고객에게 더 중요할 것이다.
OneAdvanced의 배포가 주목할 만한 이유는 “50개 에이전트”가 AI 성숙도의 보편적 척도여서가 아니라, AI 데모와 주권적 엔터프라이즈 플랫폼 사이의 실질적 경계를 드러내기 때문이다. 회사는 초기 실험에는 관리형 서비스를 사용했고, 지역별 모델 가용성이 데이터 요구와 맞지 않자 자체 호스팅의 운영 복잡성을 받아들였다.
구축자에게 주는 교훈은 거주성, 모델 가용성, 안전성 검사, 검색 품질, GPU 경제성을 하나의 아키텍처 결정으로 다루는 것이다. 구매자에게 AWS의 설명은 실현 가능한 패턴에 대한 유용한 증거이지만, 누락된 프로덕션 지표 때문에 아직은 독립적으로 검증된 벤치마크가 아니라 구현 청사진으로 평가해야 한다.
OneAdvanced는 영국 데이터 통제를 요구하는 규제 고객을 대상으로, 50개 이상의 에이전트와 자체 호스팅 Llama 모델을 AWS에서 운영하는 영국 주권 AI 플랫폼을 구축했다.