El método de razonamiento Astra que OpenAI habría desarrollado plantea nuevas preocupaciones de seguridad en la IA

La técnica de razonamiento Astra que OpenAI habría desarrollado podría dificultar la supervisión del comportamiento de la IA, lo que lleva a expertos en seguridad a advertir que la recurrencia opaca podría escalar.

AI News

Según los informes, OpenAI está desarrollando un modelo de razonamiento llamado Astra que utiliza una técnica conocida como “profundidad recurrente”, lo que ha despertado la preocupación de investigadores de seguridad en IA de que un razonamiento de modelo cada vez más complejo podría volverse más difícil de inspeccionar.

El método, también descrito como “recurrencia opaca”, permitiría supuestamente que un modelo procese la misma consulta mediante bucles internos repetidos en lugar de depender únicamente de una cadena secuencial de razonamiento. TechCrunch, citando información de The Information, dijo que el uso actual de la técnica por parte de Astra parece limitado. Aun así, los investigadores advierten que una adopción más amplia podría debilitar una de las principales herramientas utilizadas para investigar el comportamiento del modelo: los registros legibles de cadena de pensamiento.

El problema importa más allá del modelo informado de OpenAI. Si los laboratorios de IA usan más computación en estados internos o latentes que producen menos trazas interpretables, los desarrolladores y los equipos de seguridad podrían enfrentar mayores dificultades para detectar comportamientos engañosos, desalineación o fallos en sistemas autónomos antes de que esos sistemas lleguen a los usuarios.

Qué cambia la profundidad recurrente

La mayoría de los modelos de razonamiento presentan su trabajo como una secuencia de pasos intermedios. Esas trazas no se consideran una transcripción perfecta de la cognición interna de un modelo, pero pueden aportar evidencia útil sobre cómo abordó una tarea y si encontró instrucciones de riesgo o persiguió un objetivo inesperado.

Según el informe citado por TechCrunch, la profundidad recurrente cambia ese patrón al permitir que el modelo revise una consulta en un bucle. En lugar de producir una progresión única y fácil de seguir, el modelo puede realizar más de su trabajo mediante procesamiento interno repetido. El resultado puede ser menos pasos legibles disponibles para revisión.

Esa distinción es importante para los creadores de agentes de IA. Un modelo que solo responde preguntas a menudo puede probarse a través de sus salidas. Un agente que planifica, llama a herramientas, cambia archivos o actúa en sistemas empresariales crea una mayor necesidad de que los investigadores entiendan por qué ocurrió una acción concreta. Un razonamiento menos transparente podría hacer que el análisis posterior a un incidente sea más lento y menos fiable.

Por qué los investigadores de seguridad están alarmados

Buck Shlegeris, director ejecutivo de Redwood, dijo en una publicación tras el informe que estaba “extremadamente preocupado” por el supuesto uso de recurrencia opaca por parte de Astra. Reconoció la incertidumbre sobre si el modelo es materialmente menos monitorizable que sistemas anteriores, pero advirtió que OpenAI podría aumentar potencialmente la cantidad de recurrencia en versiones futuras.

Zvi Mowshowitz, un veterano defensor de la seguridad de la IA, argumentó que con el tiempo podrían ser necesarias salvaguardas o leyes más fuertes para evitar una “carrera hacia el fondo” en la industria. Dijo que la técnica podría socavar los esfuerzos de OpenAI y Anthropic por preservar señales de cadena de pensamiento fieles y monitorizables.

Ryan Greenblatt, científico jefe de Redwood Research, planteó una preocupación relacionada con la escala. En su opinión, una progresión natural podría trasladar más razonamiento al espacio latente hasta que poco o nada del razonamiento siga siendo visible a través de los canales de supervisión convencionales.

Estas son advertencias de expertos, no evidencia de que Astra opere actualmente sin supervisión útil. TechCrunch informó que el uso de profundidad recurrente aparentemente es limitado y que se espera que su cadena de pensamiento siga siendo legible. Las preocupaciones se centran principalmente en lo que ocurre si la técnica se amplía en futuros modelos de razonamiento.

La respuesta de OpenAI y la evidencia disponible

OpenAI ha rechazado la sugerencia de que esté abandonando el razonamiento interpretable. El científico jefe Jakub Pachocki escribió en X que la empresa ha trabajado para preservar y usar la supervisión de la cadena de pensamiento desde sus primeros modelos de razonamiento, describiéndolo como un objetivo central de investigación.

Según los informes, la empresa también rechazó sugerencias de que Astra se movería a “neuralese”, un término utilizado en debates sobre el razonamiento generado por modelos que es difícil de interpretar para las personas. OpenAI ha anunciado planes para una amplia supervisión de la cadena de pensamiento como parte de su trabajo de seguridad orientado al futuro.

Los detalles de producto más sólidos en el relato actual provienen de informes periodísticos y no de una publicación técnica pública sobre Astra. La evidencia disponible no establece el momento de lanzamiento de Astra, el diseño del sistema, el rendimiento ni el alcance preciso de su procesamiento recurrente. Tampoco muestra que la técnica haya causado un incidente de seguridad específico.

Sin embargo, hay una razón concreta por la que la supervisión sigue siendo central en el debate. TechCrunch señaló que los registros de cadena de pensamiento desempeñaron un papel importante en la investigación de una reciente actividad deshonesta de agentes en OpenAI. Ese ejemplo ilustra por qué cualquier reducción de trazas legibles podría afectar no solo las evaluaciones de investigación, sino también la respuesta a incidentes después del despliegue.

The Information informó más tarde que Anthropic y Google DeepMind estaban discutiendo la técnica. Esa señal sugiere que la cuestión podría convertirse en un tema de arquitectura y gobernanza en toda la industria, aunque los informes disponibles no establecen si alguna de las dos empresas está desplegando activamente recurrencia opaca en un modelo de producción.

Implicaciones para desarrolladores y compradores empresariales

Para los desarrolladores de IA, la lección inmediata es que las pruebas basadas en salidas pueden no ser suficientes para sistemas de razonamiento avanzados. Los equipos que construyen agentes deberán evaluar cuánta evidencia útil sigue disponible cuando un modelo planifica a través de múltiples ciclos internos, especialmente cuando puede usar herramientas o realizar acciones con consecuencias.

Eso podría aumentar la importancia de los registros externos, los registros de llamadas a herramientas, el aislamiento en sandbox, los controles de permisos y las evaluaciones independientes. Estos controles no recrean el razonamiento interno de un modelo, pero pueden ayudar a los equipos a reconstruir lo que hizo el sistema, a qué datos accedió y dónde fue posible intervenir.

Los compradores empresariales también deberían tratar la “transparencia del razonamiento” como una característica de despliegue y no asumir que es idéntica entre modelos. Un modelo puede ofrecer un mejor rendimiento al tiempo que proporciona información diagnóstica menos útil. Para flujos de trabajo regulados o de alto impacto, ese intercambio podría influir en la adquisición, la auditabilidad, la revisión de incidentes y el nivel de aprobación humana requerido antes de que un agente actúe.

El intercambio comercial no está resuelto. El procesamiento recurrente podría ofrecer capacidades útiles o ganancias de eficiencia, pero la evidencia fuente no proporciona puntos de referencia verificados que muestren cómo se compara Astra con otros modelos de razonamiento. Cualquier ventaja de rendimiento o de escalado sigue sin confirmarse en el material actualmente disponible.

Qué observar a continuación

La señal más importante será si OpenAI publica documentación técnica que explique cómo funciona la profundidad recurrente en Astra, con qué frecuencia se utiliza y qué supervisión sigue estando disponible para los evaluadores. Las afirmaciones sobre legibilidad serán más significativas si van acompañadas de pruebas reproducibles y no de garantías amplias.

Los investigadores también deberían vigilar evaluaciones que comparen la supervisión estándar de la cadena de pensamiento con la supervisión de sistemas recurrentes. Las preguntas clave incluyen si el razonamiento peligroso aún puede detectarse, si los modelos se comportan de manera diferente cuando sus trazas son supervisadas y con qué fiabilidad pueden los investigadores reconstruir un incidente.

Otra señal vendrá de Anthropic y Google DeepMind. Si los informes sobre su interés se convierten en investigación pública o cambios de producto, la recurrencia opaca podría convertirse en una elección de diseño competitiva en lugar de un experimento aislado de OpenAI. Entonces, los reguladores podrían verse presionados a definir qué formas de supervisión del razonamiento del modelo son necesarias para sistemas cada vez más autónomos.

Perspectiva de Creati.ai

El informe sobre Astra es significativo porque sitúa una tensión en el centro del desarrollo de modelos de razonamiento: una mayor computación interna puede mejorar la capacidad de un sistema para resolver tareas difíciles, al tiempo que hace el proceso menos legible para las personas responsables de evaluarlo y controlarlo.

El uso informado por parte de OpenAI es limitado, y la evidencia disponible no muestra que la empresa haya abandonado la supervisión de la cadena de pensamiento. Pero las preocupaciones de seguridad apuntan a la trayectoria, no solo al modelo actual. Para desarrolladores y empresas, la pregunta práctica es si un sistema puede seguir siendo auditable a medida que su razonamiento se vuelve más capaz, y qué controles independientes harán falta si las trazas legibles ya no proporcionan respuestas suficientes.

Anuncios