AI News

El AI Security Institute del Reino Unido, o AISI, dice que los principales modelos de pesos abiertos han reducido la brecha de capacidad cibernética con los mejores sistemas propietarios de IA a aproximadamente entre cuatro y siete meses, un retraso menor que a comienzos de 2025 y una advertencia notable para los equipos de seguridad que cuentan con tiempo para adaptarse. Según la evaluación de AISI, modelos como GLM-5.2 y DeepSeek V4-Pro ahora pueden igualar niveles de rendimiento que algunos sistemas cerrados alcanzaron solo meses antes, y además costar mucho menos de ejecutar.

Esa combinación importa más allá de los puntos de referencia. Según el análisis de AISI, los modelos abiertos de menor costo con pesos descargables reducen las barreras prácticas para escalar flujos de trabajo cibernéticos ofensivos, al tiempo que dificultan la aplicación de controles de seguridad a nivel de proveedor. Para los desarrolladores y compradores empresariales, el informe agudiza una tensión que ha definido el debate sobre los modelos abiertos: los mismos atributos que hacen atractivos a los sistemas de pesos abiertos para el despliegue privado y la personalización también pueden hacer más difícil contener el uso indebido.

Qué midió AISI

AISI dijo que esta es su primera evaluación pública de hasta qué punto los principales modelos de pesos abiertos quedan por detrás de los modelos cerrados líderes en tareas relacionadas con ciberseguridad. El instituto utilizó dos métodos de evaluación.

El primero, llamado Narrow Cyber Tasks, cubre 70 tareas en cuatro niveles de dificultad. Según el informe de The Decoder sobre los hallazgos, esas tareas abarcan investigación de vulnerabilidades, ingeniería inversa, explotación web y criptografía. En ese punto de referencia, AISI encontró que GLM-5.2, lanzado en junio de 2026, rindió aproximadamente al nivel de Opus 4.6 de febrero de 2026, lo que implica una brecha de alrededor de cuatro meses. DeepSeek V4-Pro, por su parte, habría rendido aproximadamente al nivel de Opus 4.5, que AISI fecha en noviembre de 2025.

El segundo método, Cyber Ranges, prueba un comportamiento más autónomo en redes simuladas en lugar de tareas aisladas. Un escenario, “The Last Ones”, modela un ataque de varios pasos contra una red corporativa con cuatro subredes y unos 20 hosts. AISI estimó que un experto humano necesitaría alrededor de 20 horas para completar ese ejercicio.

Allí, los resultados fueron menos favorables para los modelos abiertos, pero aun así apuntaron a una rápida convergencia. AISI dijo que GLM-5.2 rindió casi tan bien como Opus 4.5 en el entorno simulado, mientras que DeepSeek V4-Pro quedó por debajo de Sonnet 4.5. El instituto describió la evidencia de Cyber Ranges como más débil que los resultados de Narrow Cyber Tasks porque depende de menos escenarios y puede reflejar límites en la planificación a largo plazo más que puro conocimiento cibernético.

Esa distinción es importante. Para los compradores de seguridad, el riesgo práctico no es solo si un modelo puede resolver una instrucción de ingeniería inversa, sino si puede sostener una secuencia complicada de acciones en un entorno ruidoso. AISI parece estar diciendo que ambas capacidades importan, y que la brecha entre modelos abiertos y cerrados puede depender del tipo de trabajo que se mida.

Por qué la brecha de costos cambia el panorama

Las cifras de costo reportadas por AISI son probablemente la parte más relevante operativamente del lanzamiento. Según el instituto, una prueba de Cyber Ranges de 100 millones de tokens costó unos 85 dólares usando Opus 4.5 u Opus 4.6, unos 46 dólares usando GLM-5.2, y solo 1,19 dólares usando DeepSeek V4-Pro.

También informó estimaciones de costo por tarea para tareas resueltas de forma fiable. Opus 4.6 salió en torno a 15 dólares por tarea, GLM-5.2 alrededor de 6 dólares, Opus 4.5 unos 12,50 dólares y DeepSeek V4-Pro cerca de 0,28 dólares.

Esas cifras no son lo mismo que los costos reales de un ataque, y AISI no afirmó que lo fueran. Pero sí sugieren que un rendimiento cibernético “suficientemente bueno” puede estar volviéndose mucho más barato de acceder, especialmente cuando se combina con opciones de despliegue abiertas. Para los defensores, eso significa que la amenaza no se limita a si los modelos abiertos igualan exactamente la frontera actual. Si capacidades más antiguas o ligeramente más débiles pueden ejecutarse con un costo muy bajo y a gran escala, aún pueden cambiar la economía del atacante.

Esta es una de las razones por las que el informe es relevante para la IA empresarial, no solo para la investigación de seguridad. Muchas organizaciones que evalúan modelos de pesos abiertos se centran en privacidad, soberanía y menor costo de inferencia. Los hallazgos de AISI sugieren que también deben pensar en la exposición de uso dual: un modelo atractivo para programación interna, automatización o apoyo a red teams puede tener propiedades de seguridad muy distintas de las alternativas cerradas basadas en API.

Las barreras de seguridad parecen débiles en los modelos descargables

La conclusión más contundente de AISI es sobre los controles, no sobre el rendimiento bruto. Dijo que las medidas de seguridad en los modelos abiertos probados eran en gran medida ineficaces. En un ejemplo citado por The Decoder, DeepSeek V4-Pro a veces rechazaba solicitudes de ingeniería inversa, pero volver a intentarlo bastaba para eludir la restricción.

Esa debilidad no se presenta como un fallo exclusivo de un solo modelo. El argumento más amplio de AISI es estructural: las salvaguardas como la supervisión, los clasificadores, la limitación de velocidad y las restricciones de usuario dependen de controlar el acceso al sistema. Una vez que se liberan los pesos, ese control se debilita o desaparece. Las copias pueden ejecutarse de forma privada, modificarse o compartirse fuera del alcance del desarrollador original.

AISI habría descrito eso como un “riesgo persistente e irreversible de uso indebido”. Es un lenguaje más fuerte que una advertencia rutinaria de la ficha del modelo, y ayuda a explicar por qué el instituto enmarca la reducción de la brecha como un problema de política y de tiempo de defensa, no solo como una actualización del ranking.

Al mismo tiempo, el informe no descarta por completo los modelos abiertos. AISI también reconoce los beneficios prácticos del despliegue de pesos abiertos: alojamiento privado, menor dependencia de proveedores, personalización y menor riesgo de que un proveedor cambie las condiciones de acceso o apague un servicio. Para muchas empresas, esas son ventajas reales. El desafío de política es que la misma descentralización que hace atractivos a los modelos abiertos para los compradores también reduce el control centralizado sobre usos dañinos.

Evidencia, matices y lo que sigue sin demostrarse

Los hallazgos centrales de esta historia provienen de la evaluación de AISI tal como la informó The Decoder; la segunda fuente, Tech Times, parece reflejar la misma valoración subyacente sin añadir detalles materiales. Eso significa que la base principal de evidencia aquí es un informe mediático de un análisis institucional, no un artículo público completo reproducido en el conjunto de fuentes.

Hay varios matices importantes. Primero, AISI dijo que los resultados de Cyber Ranges son evidencia más débil porque provienen de menos casos de prueba. Segundo, el instituto también dijo que las evaluaciones pueden subestimar ligeramente a los modelos abiertos en su mejor nivel porque esos sistemas no fueron ajustados especialmente para las pruebas. Tercero, los entornos de red simulados no incluyen defensores activos ni todo el desorden de las organizaciones reales.

Esas limitaciones empujan en distintas direcciones. Los defensores de los modelos abiertos podrían argumentar que la brecha informada exagera la ventaja de los sistemas cerrados si un mejor prompting o ajuste mejorara los resultados. Los profesionales de seguridad, por otro lado, podrían argumentar que las simulaciones subestiman la fricción real para los atacantes porque las redes de producción están defendidas, monitorizadas e incoherentes.

También hay una cuestión de diseño de benchmark detrás de los titulares. Un modelo que obtiene buenos resultados en Narrow Cyber Tasks puede aun así fallar en una intrusión multietapa real porque pierde el hilo del plan, maneja mal las herramientas o comete errores acumulativos. Por el contrario, un modelo que tiene dificultades en un largo recorrido autónomo aún puede ser muy útil para un operador humano que divide el trabajo en pasos más pequeños. El propio marco de AISI parece reconocer esa distinción.

Qué significa esto para desarrolladores y compradores empresariales

Para los desarrolladores de IA, el informe apunta a una línea base cambiante. Si sistemas de pesos abiertos como GLM-5.2 y DeepSeek V4-Pro pueden acercarse al rendimiento cibernético reciente de los modelos cerrados a un costo mucho menor, los equipos de producto que construyen asistentes de programación, automatización de seguridad o flujos de trabajo de agentes de IA tendrán más opciones de despliegue, pero también más responsabilidad sobre cómo se restringen, observan y segmentan esos sistemas.

Para las empresas, la conclusión práctica no es “evitar los modelos abiertos”, sino “separar las decisiones de costo de las decisiones de riesgo”. Ejecutar un modelo abierto en un entorno interno controlado todavía puede tener sentido, especialmente donde importan la residencia de datos y la inferencia privada. Pero los equipos de seguridad pueden necesitar controles locales más fuertes, acceso más restringido a herramientas, registros de auditoría más detallados y políticas internas de uso más claras de las que dependerían con una API alojada.

Para el mercado cibernético, el marco temporal de AISI puede ser la señal estratégica más importante. El instituto ve la brecha entre modelos cerrados y abiertos como una ventana temporal de preparación en la que los defensores que usan sistemas más potentes pueden adaptarse antes de que capacidades equivalentes estén ampliamente disponibles para descarga. Si esa ventana ahora es de cuatro a siete meses en lugar de seis a diez, las hojas de ruta para ingeniería de detección, red teaming y monitoreo de abuso pueden necesitar moverse más rápido.

El informe también llega en medio de un rápido movimiento en la parte alta del mercado de modelos. AISI dijo que los modelos cerrados, incluidos Mythos Preview y GPT-5.5, ofrecieron algunas de las mayores mejoras en capacidad cibernética de IA desde que empezó a hacer pruebas. El National Cyber Security Centre del Reino Unido ha advertido por separado que el entorno de amenazas cibernéticas está cambiando rápidamente. Incluso si los modelos abiertos no replican de inmediato cada salto de frontera, la velocidad de difusión parece estar acelerándose.

Qué observar a continuación

Una señal inmediata es la prueba prevista por AISI de Kimi-K3, que según The Decoder se espera que publique sus pesos abiertos a finales de julio. AISI habría estimado que los benchmarks actuales de programación sugieren que Kimi-K3 podría acercarse más a los modelos de frontera actuales, aunque potencialmente a un costo mayor que otros modelos abiertos.

Más allá de ese lanzamiento puntual, importan tres cosas. Primero, si las futuras evaluaciones de Cyber Ranges muestran que los modelos abiertos mejoran en autonomía de largo horizonte, y no solo en competencia en tareas estrechas. Segundo, si las empresas adoptan patrones de gobernanza local más fuertes para el despliegue de pesos abiertos en lugar de asumir que siguen aplicando los hábitos de seguridad de la era de los proveedores. Tercero, si los proveedores de modelos cerrados pueden preservar una ventaja significativa en rendimiento cibernético o si las mejoras de frontera siguen extendiéndose a sistemas descargables en cuestión de meses.

Perspectiva de Creati.ai

Lo notable de este hallazgo de AISI no es simplemente que los modelos abiertos estén mejorando. Es que el retraso parece comprimirse mientras la economía de inferencia mejora todavía más rápido. En la práctica, eso significa que el mercado quizá no necesite una paridad exacta con la frontera para que los modelos abiertos se vuelvan estratégicamente importantes en flujos de trabajo cibernéticos. “Lo bastante cerca, lo bastante barato y lo bastante incontrolable” ya es un umbral serio.

Para los equipos de producto y los compradores, la lección es tratar la adopción de pesos abiertos como una decisión de infraestructura y gobernanza, no solo como una decisión sobre la calidad del modelo. Los mismos factores que impulsan el interés en la autonomía empresarial de la IA —alojamiento privado, menor costo y libertad frente al bloqueo de proveedor— también debilitan supuestos de seguridad heredados. A medida que modelos como GLM-5.2, DeepSeek V4-Pro y posiblemente Kimi-K3 cierren la brecha, el verdadero diferenciador puede pasar de la capacidad bruta a quién puede desplegarlos con controles fiables sobre herramientas, datos y abuso.

Destacados

AISI dice que los modelos cibernéticos de IA de pesos abiertos se acercan más rápido a los sistemas de frontera — y a un costo mucho menor

AISI afirma que los modelos de pesos abiertos ya están a solo 4-7 meses de los principales sistemas cibernéticos de IA cerrados, reduciendo la ventaja de los defensores mientras los costos caen con fuerza.