
OneAdvanced построила британскую суверенную ИИ-платформу, работающую более чем с 50 специализированными агентами на инфраструктуре, размещённой в лондонском регионе AWS, согласно материалу-кейсу в блоге AWS Machine Learning. Британский поставщик корпоративного ПО самостоятельно разместил Meta Llama 4 Maverick и Llama Guard 4 после того, как модели не были доступны через управляемые сервисы AWS, которые компания хотела использовать в регионе.
Развёртывание предназначено для клиентов OneAdvanced в регулируемых отраслях, таких как здравоохранение и юридические услуги, где территориальное размещение данных является ключевым требованием закупок и соблюдения норм. Архитектура сочетает Amazon SageMaker AI для обслуживания моделей, Amazon ECS для рабочих нагрузок агентов и систему извлечения, построенную на Amazon Aurora PostgreSQL-Compatible Edition с pgvector.
Проект иллюстрирует практический компромисс для корпоративных ИИ-команд: управляемые сервисы моделей могут ускорять эксперименты, но требования суверенитета могут вынудить клиентов самостоятельно управлять моделями, GPU, оркестрацией, средствами безопасности и конвейерами данных.
Сначала OneAdvanced прототипировала свои ИИ-возможности с помощью Amazon Bedrock. AWS сообщает, что компания за две недели подготовила рабочий спринт, включавший чат-ответы, агента для запросов к законодательству Великобритании, интеграцию со Snowflake и генерацию графиков.
Однако этот подход не удовлетворял требование компании, чтобы модели работали исключительно в её собственных аккаунтах AWS в Великобритании. На момент сотрудничества, описанного AWS, Llama 4 Maverick и Llama Guard 4 не были доступны через соответствующие управляемые сервисы в британском регионе. Поэтому OneAdvanced перешла на самостоятельно размещённую схему с использованием инфраструктуры Великобритании, которую можно было контролировать напрямую.
В результате получившаяся британская суверенная AWS-платформа обслуживает Llama 4 Maverick и Llama Guard 4 через vLLM на конечных точках Amazon SageMaker AI. Модели работают на инстансах p5.48xlarge в лондонском регионе, используя модели Hugging Face и AWS Deep Learning Containers. AWS сообщает, что OneAdvanced сначала использовала инстансы p4d.24xlarge, а затем перешла на оборудование P5 для production и более длинных контекстных требований.
Компания ориентируется на окна контекста примерно от 120 000 до 128 000 токенов для анализа больших документов и многоходовых диалогов. AWS сообщает, что нагрузочное тестирование во время консультативной работы подтвердило требования к пропускной способности, хотя в кейсе не приводятся данные по задержкам, объёму запросов, доступности или стоимости.
Основной слой агентов состоит из более чем 50 специализированных по задачам агентов, созданных с помощью Strands Agents SDK и развёрнутых в Amazon ECS. У каждого агента есть собственный системный промпт и конфигурация инструментов, а необязательные формы ввода помогают пользователям, которые не хотят взаимодействовать через открытый чат-интерфейс. Конфигурация агентов хранится в Amazon DynamoDB.
AWS сообщает, что OneAdvanced выросла с первого агента до более чем 50 за три недели, причём большинство агентов было создано менее чем за день. Библиотека охватывает области здравоохранения, юридической работы, управления персоналом, маркетинга, логистики и образования. Примеры, приведённые AWS, включают помощника по реагированию на инциденты в уходе, генератор клинических бюллетеней по безопасности, инструмент сравнения документов, помощника по оценке эффективности и AWS Architect Agent.
Рабочий процесс начинается, когда Llama Guard 4 проверяет запрос пользователя на вредоносный контент. Если запрос проходит проверку, он направляется соответствующему агенту в Amazon ECS. Агент может вызывать специализированные инструменты, извлекать релевантную информацию из документов, хранящихся в Amazon S3, и искать в векторном индексе на базе pgvector.
Документы, загруженные в S3, преобразуются в Markdown, разбиваются на фрагменты и встраиваются для последующего поиска. Этот слой Retrieval Augmented Generation, или RAG, призван держать ответы привязанными к собственным материалам организации, а не полагаться исключительно на внутренние знания модели.
Подробный технический рассказ исходит от AWS, которая консультировала OneAdvanced и опубликовала архитектуру как кейс клиента. Поэтому самые сильные утверждения о внедрении и скорости — включая масштаб библиотеки агентов, трёхнедельный срок создания и утверждение, что большинство агентов заняло менее одного дня, — являются сообщениями поставщика, а не результатами независимого аудита.
То же замечание относится и к опубликованным результатам нагрузочного тестирования. AWS заявляет, что развёртывание удовлетворило требованиям OneAdvanced по пропускной способности, но источник не раскрывает методологию теста, профиль трафика, целевые показатели времени отклика, частоты сбоев или использование в production. Он также не сообщает, сколько из более чем 50 агентов активно используется клиентами, и не даёт разбивки по их бизнес-эффекту.
Результат с точки зрения суверенитета более конкретен как архитектурное описание. AWS сообщает, что решение сохраняет размещение моделей и данные клиентов в пределах британской среды и помогло поддержать сертификацию OneAdvanced по ISO 42001 для управления ИИ. Это не следует понимать как доказательство того, что автоматически соблюдены все последующие обязательства по комплаенсу: территориальное размещение, контроль доступа, хранение, аудитируемость и управление поставщиками по-прежнему зависят от того, как настроен и эксплуатируется весь сервис.
CTO OneAdvanced Эндрю Хендерсон описал суверенитет данных Великобритании как жёсткое требование для многих клиентов из госсектора и регулируемых отраслей. Это объясняет ключевое проектное решение, но остаётся позицией компании, а не независимой оценкой комплаенс-профиля платформы.
Для продуктовых команд этот кейс подчёркивает инженерные затраты, скрытые за таким простым требованием, как «держать данные в стране». Когда желаемые модели отсутствуют в локальном каталоге управляемых сервисов, командам может понадобиться получать лицензии на модели, находить дефицитные GPU, развёртывать серверы инференса, внедрять масштабирование и самостоятельно поддерживать уровни безопасности и поиска.
Архитектура также разделяет обязанности, которые в хостинговом ИИ-API часто объединены. SageMaker AI обслуживает конечные точки моделей, ECS запускает агентов и инструменты, S3 хранит исходные документы, Aurora PostgreSQL предоставляет векторную базу данных, а DynamoDB хранит конфигурацию агентов. Такая модульность даёт OneAdvanced контроль, но создаёт больше операционных интерфейсов, которые нужно мониторить, защищать и устранять при сбоях.
Переход с Llama Guard 3 на Llama Guard 4 — ещё один практический сигнал. AWS сообщает, что OneAdvanced наблюдала высокие уровни ложных отклонений у предыдущей модели и заменила её. Последовательная проверка запросов перед основной моделью может снизить некоторые риски, но также добавляет «ворота», которые нужно тестировать на ложные срабатывания, пропуски, задержку и покрытие языков или доменов.
Для корпоративных покупателей число агентов менее важно, чем модель управления, стоящая за ним. Библиотека из 50 агентов может упростить упаковку специализированных рабочих процессов, но каждый агент привносит промпты, инструменты, разрешения, источники извлечения и потенциально разные режимы отказа. No-code конструктор агентов может расширить доступ для нетехнических пользователей, одновременно повышая потребность в процессах утверждения, тестировании, контроле версий и надзоре за использованием.
Следующие полезные сигналы будут скорее операционными, а не просто числом агентов в заголовках. OneAdvanced могла бы раскрыть данные о production-использовании, целевых показателях времени ответа и надёжности, загрузке GPU или разнице в стоимости между самостоятельным размещением и управляемым инференсом. Эти цифры помогли бы покупателям оценить, оправдала ли суверенность дополнительную инфраструктурную нагрузку.
Также стоит следить, появятся ли соответствующие модели Llama в управляемых сервисах AWS в Великобритании и изменит ли это архитектуру OneAdvanced. Локальный управляемый вариант мог бы снизить эксплуатационные затраты платформы, сохранив требования к территориальному размещению, хотя компания может оставить саморазмещение ради контроля над версиями и конфигурацией моделей.
Дополнительные доказательства должны также показать, как управляются агенты после развёртывания: кто может публиковать новые инструменты, как утверждаются источники извлечения, как аудируются решения по вредоносному контенту и охватывают ли процессы ISO 42001 весь жизненный цикл агента. Эти детали для регулируемых клиентов будут важнее скорости первоначального прототипа.
Развёртывание OneAdvanced примечательно не потому, что «50 агентов» — универсальная мера зрелости ИИ, а потому, что оно показывает практическую границу между ИИ-демо и суверенной корпоративной платформой. Компания использовала управляемые сервисы на раннем этапе экспериментов, а затем приняла операционную сложность самостоятельного размещения, когда региональная доступность моделей не совпала с её требованиями к данным.
Для разработчиков урок заключается в том, чтобы рассматривать территориальное размещение данных, доступность моделей, проверку безопасности, качество поиска и экономику GPU как одно архитектурное решение. Для покупателей отчёт AWS — полезное свидетельство работоспособного подхода, но отсутствующие производственные метрики означают, что его следует оценивать как проектный blueprint, а не как независимо подтверждённый бенчмарк.
OneAdvanced построила британскую суверенную ИИ-платформу с более чем 50 агентами и самостоятельно размещёнными моделями Llama на AWS, ориентируясь на регулируемых клиентов с британскими требованиями к данным.