AIUC recauda 40 millones de dólares para probar y certificar agentes de IA empresariales

AIUC recaudó 40 millones de dólares para certificar agentes de IA en materia de seguridad empresarial, utilizando miles de pruebas para evaluar jailbreaks, alucinaciones y filtraciones de datos.

AI News

Artificial Intelligence Underwriting Company (AIUC), una startup fundada por un antiguo empleado de Anthropic y el ex director de operaciones de la organización de seguridad en IA METR, ha recaudado 40 millones de dólares para construir una capa independiente de pruebas y certificación para agentes de IA.

La Serie A fue liderada por Ribbit Capital, con participación de First Harmonic, según TechCrunch. La ronda eleva la financiación total de AIUC a 55 millones de dólares, tras una ronda seed de 15 millones de dólares reportada previamente y respaldada por NFDG de Nat Friedman, Emergence, Terrain y Ben Mann, cofundador de Anthropic.

AIUC apunta a una preocupación empresarial creciente: si se puede confiar en que un sistema de IA opere dentro de los flujos de trabajo de negocio, no simplemente si puede completar tareas. Su propuesta de estándar AIUC-1 se inspira en parte en SOC 2, el marco ampliamente utilizado para evaluar controles en torno a la seguridad y los procesos empresariales.

Una capa de certificación para agentes de IA

AIUC fue fundada por Rune Kvist, un antiguo empleado de Anthropic, y Rajiv Dattani, quien fue director de operaciones de METR de 2024 a 2025 y sigue formando parte de la junta directiva de la organización, según TechCrunch. Los fundadores están posicionando la empresa como un evaluador independiente para compañías que construyen o despliegan agentes de IA.

La startup afirma haber reunido un consorcio de unos 250 líderes de seguridad y riesgo para ayudar a definir qué quieren saber los compradores empresariales antes de adquirir un agente. Esas conversaciones informan las pruebas que AIUC utiliza para evaluar los sistemas, dijo Dattani a TechCrunch.

AIUC dice que su servicio de pruebas ejecuta un agente a través de aproximadamente 5.000 escenarios que cubren áreas como jailbreaks, alucinaciones y fuga de datos. El proceso produce un informe de unas 100 páginas, que identifica dónde el sistema se comporta de forma fiable y dónde los compradores deberían aplicar restricciones o controles adicionales.

Las pruebas en sí se realizan con la ayuda de agentes de IA, y la IA también se usa para analizar los datos resultantes. Según Kvist, las personas verifican la auditoría final. Esa revisión humana es importante porque un evaluador automatizado puede heredar los mismos puntos ciegos, malinterpretar el comportamiento del modelo o no reconocer un problema de seguridad sutil.

De la capacidad del modelo al riesgo operativo

La propuesta de la empresa refleja un cambio en cómo las compañías evalúan la IA empresarial. Un agente que rinde bien en un benchmark puede seguir siendo inadecuado para un flujo de trabajo de finanzas, sanidad, gobierno o atención al cliente si puede exponer información confidencial, seguir instrucciones maliciosas o realizar una acción fuera de su autorización.

Kvist dijo a TechCrunch que muchas organizaciones ya no se están conteniendo solo porque los modelos de IA carezcan de capacidad. En cambio, necesitan garantías de que los sistemas se comportarán dentro de los compromisos asumidos con clientes y reguladores. El enfoque de AIUC pretende aportar evidencia que pueda revisarse antes del despliegue, en lugar de confiar únicamente en las pruebas internas de un proveedor.

La empresa menciona a Cursor, Lovable, Harvey y ElevenLabs entre sus clientes. La fuente no ofrece detalles sobre el alcance de esas relaciones, qué productos fueron evaluados ni si las compañías han completado la certificación AIUC-1. Por lo tanto, esas señales de adopción deben tratarse como declaraciones de la empresa y no como resultados de clientes verificados de forma independiente.

El modelo de negocio de AIUC también difiere del seguro tradicional, a pesar de la palabra "underwriting" en su nombre. La evidencia describe un servicio de pruebas y certificación, no cobertura de pérdidas causadas por un sistema de IA. Su producto inmediato es una capa de evaluación destinada a apoyar las decisiones de compra y despliegue.

Cómo se compara AIUC con las evaluaciones al estilo METR

La trayectoria de Dattani en METR le da a AIUC una conexión con un área consolidada de evaluación de IA. METR ha trabajado con laboratorios de IA de frontera para medir si los agentes pueden completar tareas de forma fiable. Su investigación también se ha utilizado en investigaciones sobre el comportamiento de modelos, incluido trabajo vinculado al incidente de OpenAI con Hugging Face.

AIUC afirma que su enfoque es más amplio y más orientado a la empresa. En lugar de centrarse principalmente en el rendimiento en tareas, su proceso AIUC-1 está diseñado para examinar fallos de seguridad y fiabilidad que pueden surgir cuando los agentes interactúan con datos, herramientas y usuarios reales del negocio.

Esa distinción importa para los compradores. Un sistema puede completar con éxito una tarea en una evaluación controlada y, aun así, requerir permisos limitados, supervisión, aprobación humana o un entorno operativo restringido en producción. Las pruebas independientes podrían ayudar a los equipos de compras a comparar sistemas, aunque una certificación no puede garantizar que un agente siga siendo seguro después de una actualización del modelo, un cambio de herramienta o una nueva técnica de ataque.

La idea más amplia de la evaluación externa también está ganando atención entre las empresas de modelos de frontera. El CEO de Anthropic, Dario Amodei, ha pedido mayor cautela en el desarrollo de frontera y ha sugerido que evaluadores independientes podrían observar y verificar el trabajo de seguridad en los laboratorios de IA. AIUC no propone incorporar evaluadores en las instalaciones de los clientes, pero sus fundadores persiguen un principio relacionado: las organizaciones deberían tener acceso a pruebas independientes antes de confiar en sistemas potentes.

Lo que muestran las afirmaciones —y lo que sigue sin probarse

La financiación es un evento empresarial confirmado reportado por TechCrunch, al igual que los fundadores de AIUC, su estándar AIUC-1 y el proceso de pruebas declarado por la empresa. Los nombres de clientes reportados, el tamaño del consorcio, el número de pruebas y la longitud del informe provienen de las propias declaraciones de AIUC en la entrevista y deben entenderse como afirmaciones de la empresa.

Todavía no hay evidencia suficiente para determinar qué tan bien AIUC-1 predice incidentes en producción, con qué consistencia distintos evaluadores puntuarían al mismo agente o si las empresas tratarán la certificación como un requisito de compra. La fuente tampoco identifica resultados públicos de auditoría, tasas de fallo, resultados de remediación, precios ni la proporción de pruebas que superan los agentes.

Esas lagunas son importantes. Las certificaciones de seguridad se vuelven útiles cuando los compradores entienden su alcance y cuando las evaluaciones son repetibles en el tiempo. Los agentes de IA pueden cambiar de comportamiento después de actualizaciones del modelo, integraciones de herramientas, cambios en los prompts o variaciones en los datos a los que pueden acceder. Por ello, un informe puntual puede ser menos valioso que una evaluación continua vinculada a controles de despliegue.

Qué observar a continuación

La primera señal será si AIUC publica detalles de las evaluaciones AIUC-1 completadas, incluida la metodología, los criterios de puntuación y ejemplos de fallos descubiertos durante las pruebas. Los compradores también querrán saber cómo gestiona la empresa las actualizaciones del modelo y si la certificación debe renovarse cuando cambian las herramientas o los permisos de un agente.

Otra señal importante es la validación independiente. La evidencia de clientes empresariales, investigadores de seguridad o auditores no afiliados a AIUC ayudaría a establecer si las pruebas identifican riesgos del mundo real y no solo fallos sintéticos.

El mercado también revelará si el enfoque de AIUC pasa a formar parte de las compras. La adopción por grandes bancos, hospitales, agencias gubernamentales o grandes plataformas de software sugeriría que la evaluación de agentes por terceros se está convirtiendo en un control estándar. Por el contrario, si las empresas usan la certificación como un distintivo de marketing sin publicar resultados significativos, su valor para creadores y compradores seguirá siendo limitado.

Perspectiva de Creati.ai

AIUC está abordando un cuello de botella real en la IA empresarial: las organizaciones necesitan una forma defendible de decidir dónde puede actuar un agente de forma autónoma y dónde necesita límites. Una evaluación externa estructurada podría hacer esas decisiones más concretas que las afirmaciones generales sobre la seguridad del modelo o su capacidad general.

Pero la certificación debe considerarse evidencia, no permiso para eliminar salvaguardas. La versión más sólida de este mercado combinará pruebas independientes con monitoreo en vivo, acceso con privilegios mínimos, escalado humano y reevaluaciones después de cambios materiales en el sistema. La financiación de AIUC le da espacio a ese modelo para desarrollarse; su credibilidad dependerá de si puede demostrar que los informes mejoran en la práctica las decisiones de despliegue.

Anuncios