
OneAdvanced ha construido una plataforma de IA soberana del Reino Unido que ejecuta más de 50 agentes especializados sobre infraestructura alojada en la región de AWS Londres, según un caso de estudio del blog de AWS Machine Learning. El proveedor británico de software empresarial autoalojó Llama 4 Maverick y Llama Guard 4 de Meta después de que los modelos no estuvieran disponibles a través de los servicios gestionados de AWS que quería usar en la región.
El despliegue está diseñado para los clientes de OneAdvanced en sectores regulados como la sanidad y los servicios jurídicos, donde la residencia de los datos es un requisito central de compra y cumplimiento. Su arquitectura combina Amazon SageMaker AI para la publicación de modelos, Amazon ECS para las cargas de trabajo de los agentes y un sistema de recuperación basado en Amazon Aurora PostgreSQL-Compatible Edition con pgvector.
El proyecto ilustra una compensación práctica para los equipos de IA empresarial: los servicios gestionados de modelos pueden acelerar la experimentación, pero los requisitos de soberanía pueden obligar a los clientes a operar ellos mismos los modelos, las GPU, la orquestación, los controles de seguridad y las canalizaciones de datos.
OneAdvanced prototipó inicialmente sus capacidades de IA con Amazon Bedrock. AWS dice que la empresa produjo en dos semanas un sprint funcional que cubría la finalización de chat, un agente para consultar la legislación del Reino Unido, la integración con Snowflake y la generación de gráficos.
Ese enfoque no satisfacía el requisito de la empresa de que los modelos se ejecutaran exclusivamente en sus propias cuentas de AWS con sede en el Reino Unido. En el momento del trabajo descrito por AWS, Llama 4 Maverick y Llama Guard 4 no estaban disponibles a través de los servicios gestionados relevantes en la región del Reino Unido. Por ello, OneAdvanced pasó a un diseño autoalojado utilizando infraestructura británica que podía controlar directamente.
La plataforma de AWS soberana del Reino Unido resultante ofrece Llama 4 Maverick y Llama Guard 4 mediante vLLM en endpoints de Amazon SageMaker AI. Los modelos se ejecutan en instancias p5.48xlarge en la región de Londres, utilizando modelos de Hugging Face y AWS Deep Learning Containers. AWS dice que OneAdvanced utilizó inicialmente instancias p4d.24xlarge antes de pasar al hardware P5 para producción y para requisitos de contexto más largos.
La empresa apunta a ventanas de contexto de aproximadamente 120.000 a 128.000 tokens para el análisis de documentos grandes y conversaciones de varios turnos. AWS informa de que las pruebas de carga durante su compromiso de asesoría validaron los requisitos de rendimiento, aunque el caso de estudio no ofrece cifras de latencia, volumen de solicitudes, disponibilidad ni costes.
La capa central de agentes consta de más de 50 agentes específicos para tareas, creados con el SDK de Strands Agents y desplegados en Amazon ECS. Cada agente tiene su propio prompt de sistema y configuración de herramientas, mientras que los formularios de entrada opcionales ayudan a los usuarios que quizá no quieran interactuar mediante una interfaz de chat abierta. La configuración de los agentes se almacena en Amazon DynamoDB.
AWS dice que OneAdvanced pasó de su primer agente a más de 50 en tres semanas, y que la mayoría de los agentes se crearon en menos de un día. La biblioteca cubre áreas como sanidad, trabajo jurídico, recursos humanos, marketing, logística y educación. Entre los ejemplos citados por AWS figuran un asistente de respuesta a incidentes de cuidados, un generador de boletines de seguridad clínica, una herramienta de comparación de documentos, un asistente de evaluación del rendimiento y un AWS Architect Agent.
El flujo de trabajo comienza cuando Llama Guard 4 examina una solicitud del usuario en busca de contenido dañino. Si la solicitud pasa el filtro, se dirige al agente apropiado en Amazon ECS. El agente puede llamar a herramientas especializadas, recuperar información relevante de documentos almacenados en Amazon S3 y buscar en un índice vectorial respaldado por pgvector.
Los documentos cargados en S3 se convierten a Markdown, se dividen en fragmentos y se incrustan para la recuperación. Esta capa de Generación Aumentada por Recuperación, o RAG, pretende mantener las respuestas ancladas en los materiales propios de una organización en lugar de depender únicamente del conocimiento interno del modelo.
El relato técnico detallado procede de AWS, que asesoró a OneAdvanced y publicó la arquitectura como un caso de estudio de cliente. Por tanto, las afirmaciones más contundentes sobre adopción y velocidad —incluida la escala de la biblioteca de agentes, el período de construcción de tres semanas y la afirmación de que la mayoría de los agentes tardó menos de un día— están reportadas por el proveedor y no auditadas de forma independiente.
La misma salvedad se aplica a los resultados de las pruebas de carga informados. AWS dice que el despliegue cumplió los requisitos de rendimiento de OneAdvanced, pero la fuente no revela la metodología de las pruebas, el perfil de tráfico, los objetivos de tiempo de respuesta, las tasas de fallo ni la utilización en producción. Tampoco indica cuántos de los más de 50 agentes son utilizados activamente por los clientes ni ofrece un desglose de su impacto comercial.
El resultado de soberanía es más concreto como descripción arquitectónica. AWS dice que la solución mantiene el alojamiento del modelo y los datos de los clientes dentro del entorno británico y ayudó a respaldar la certificación ISO 42001 de OneAdvanced para la gobernanza de la IA. Eso no debe interpretarse como prueba de que automáticamente se cumpla cada obligación de cumplimiento posterior: la residencia, el control de acceso, la retención, la auditabilidad y la gobernanza de proveedores siguen dependiendo de cómo se configure y opere todo el servicio.
El CTO de OneAdvanced, Andrew Henderson, describió la soberanía de los datos del Reino Unido como un requisito ineludible para muchos clientes del sector público y regulado. Esa justificación ejecutiva explica la decisión de diseño central, pero sigue siendo la posición de la empresa y no una evaluación independiente del estado de cumplimiento de la plataforma.
Para los equipos de producto, el caso pone de relieve el coste de ingeniería que se esconde detrás de un requisito tan simple como “mantener los datos en el país”. Cuando los modelos deseados no están en un catálogo local de servicios gestionados, los equipos pueden necesitar obtener licencias de modelos, conseguir capacidad escasa de GPU, desplegar servidores de inferencia, implementar escalado y mantener por su cuenta las capas de seguridad y recuperación.
La arquitectura también separa responsabilidades que a menudo se agrupan en una API de IA alojada. SageMaker AI gestiona los endpoints de modelos, ECS ejecuta los agentes y las herramientas, S3 almacena los documentos fuente, Aurora PostgreSQL proporciona la base de datos vectorial y DynamoDB almacena la configuración de los agentes. Esa modularidad da control a OneAdvanced, pero crea más interfaces operativas que supervisar, asegurar y solucionar.
El cambio de Llama Guard 3 a Llama Guard 4 es otra señal práctica. AWS dice que OneAdvanced observó altas tasas de rechazo erróneo con el modelo anterior y lo sustituyó. Filtrar las solicitudes en serie antes del modelo principal puede reducir algunos riesgos, pero también añade una puerta que debe probarse frente a falsos positivos, falsos negativos, latencia y cobertura lingüística o de dominio.
Para los compradores empresariales, el número de agentes es menos importante que el modelo de gobernanza que hay detrás. Una biblioteca de 50 agentes puede facilitar el empaquetado de flujos de trabajo especializados, pero cada agente introduce prompts, herramientas, permisos, fuentes de recuperación y, potencialmente, modos de fallo diferentes. Un generador de agentes sin código puede ampliar el acceso a usuarios no técnicos, al tiempo que aumenta la necesidad de flujos de aprobación, pruebas, control de versiones y supervisión del uso.
Las próximas señales útiles serán operativas más que el mero número de agentes en los titulares. OneAdvanced podría divulgar el uso en producción, los objetivos de tiempo de respuesta y fiabilidad, la utilización de GPU o la diferencia de coste entre el autoalojamiento y la inferencia gestionada. Esas cifras ayudarían a los compradores a evaluar si la soberanía justificó la carga adicional de infraestructura.
También merece la pena vigilar si los modelos Llama relevantes pasan a estar disponibles a través de servicios gestionados de AWS en el Reino Unido y si eso cambia la arquitectura de OneAdvanced. Una opción gestionada local podría reducir el mantenimiento de la plataforma al tiempo que preserva los requisitos de residencia, aunque la empresa podría mantener el autoalojamiento para conservar el control sobre las versiones y la configuración del modelo.
La evidencia adicional también debería mostrar cómo se gobiernan los agentes tras el despliegue: quién puede publicar nuevas herramientas, cómo se aprueban las fuentes de recuperación, cómo se auditan las decisiones sobre contenido dañino y si los procesos ISO 42001 cubren todo el ciclo de vida del agente. Estos detalles importarán más a los clientes regulados que la velocidad del prototipo inicial.
El despliegue de OneAdvanced es notable no porque “50 agentes” sea una medida universal de madurez de IA, sino porque expone el límite práctico entre una demo de IA y una plataforma empresarial soberana. La empresa utilizó servicios gestionados para la experimentación inicial y luego aceptó la complejidad operativa del autoalojamiento cuando la disponibilidad regional de los modelos no coincidía con sus requisitos de datos.
Para los constructores, la lección es tratar la residencia, la disponibilidad de modelos, el filtrado de seguridad, la calidad de la recuperación y la economía de GPU como una sola decisión arquitectónica. Para los compradores, la cuenta de AWS es una prueba útil de un patrón viable, pero las métricas de producción que faltan significan que debe evaluarse como un plano de implementación, no todavía como una referencia validada de forma independiente.
OneAdvanced construyó una plataforma de IA soberana del Reino Unido con más de 50 agentes y modelos Llama autoalojados en AWS, dirigida a clientes regulados con controles de datos del Reino Unido.