Un estudio de KAIST y Naver AI Lab concluye que los modelos codifican internamente operaciones de razonamiento distintas, lo que abre nuevas posibilidades y límites para la supervisión de la IA.

Un estudio de investigadores de KAIST, en Corea del Sur, y de Naver AI Lab concluye que varias operaciones de razonamiento visibles en la solución escrita de un modelo de IA también aparecen como patrones separables en sus representaciones internas. La señal fue más fuerte en las capas intermedias de los modelos probados, lo que sugiere que la actividad interna podría revelar más sobre el cómputo de un modelo que su texto final por sí solo.
Este hallazgo importa porque los desarrolladores utilizan cada vez más el razonamiento escrito como una ventana imperfecta para entender cómo resuelven problemas los modelos. Si los estados internos distinguen actividades como recuperar una fórmula, descomponer una tarea o realizar un cálculo, los investigadores podrían llegar a supervisar o intervenir en esos procesos directamente. El estudio aún no demuestra que estos patrones puedan detectar de forma fiable errores o controlar la generación en tiempo real.
El equipo examinó tres modelos —Qwen2.5-7B, Qwen3-8B y Gemma4-31B— mientras resolvían problemas matemáticos. Los investigadores dividieron las soluciones generadas en segmentos y clasificaron cada segmento según una de ocho operaciones recurrentes. Las categorías incluían extraer información, dividir un problema en partes, recordar una fórmula, deducción y cálculo.
Las etiquetas de clasificación fueron producidas con GPT-5, según el relato de The Decoder sobre la investigación. Luego, los investigadores comprobaron si las representaciones numéricas internas de los modelos contenían suficiente información para distinguir esas operaciones.
En los tres modelos, los clasificadores pudieron separar las categorías de razonamiento a partir de las representaciones internas. La distinción fue más pronunciada en las capas intermedias que al principio o al final de las redes. Este patrón sugiere que los modelos pueden procesar inicialmente el lenguaje en una forma relativamente mezclada antes de organizarlo en estados internos más específicos de cada operación.
Los investigadores también descubrieron que palabras comunes podían adoptar representaciones internas distintas dependiendo de la actividad de razonamiento circundante. Términos como “a”, “is” y “the” aparecían en muchas categorías a nivel superficial, pero sus estados internos se separaban según la operación en curso.
Ese resultado es importante porque va en contra de una explicación simple basada solo en el vocabulario. Un clasificador que usaba los propios tokens rindió peor que uno que utilizaba representaciones internas. La posición de un segmento en la solución tampoco explicó la separación.
El estudio incluyó varias pruebas destinadas a establecer que la señal reflejaba algo más que patrones textuales superficiales. En una intervención, los investigadores bloquearon la atención a los 30 tokens anteriores. La representación asociada con la operación actual se debilitó, lo que indica que un paso de razonamiento depende del contexto previo en lugar de formarse de manera independiente.
Las categorías de operación también siguieron siendo identificables cuando el modelo llegó a una respuesta incorrecta. Un cálculo defectuoso seguía pareciendo internamente un cálculo, mientras que la recuperación de fórmulas y la deducción conservaban sus respectivas firmas. Esta distinción podría ayudar algún día a los investigadores a separar el tipo de proceso que un modelo intenta realizar de si ese proceso produjo un resultado correcto.
El efecto informado se replicó con Llama-3-8B. Para Qwen3-8B, clasificadores entrenados en un conjunto de tareas se transfirieron a GPQA-Diamond y MATH-500, según The Decoder. Estas pruebas adicionales sugieren que las representaciones podrían generalizar más allá de los ejemplos iniciales, pero no establecen una fiabilidad amplia entre modelos o dominios.
La evidencia sigue siendo limitada. Los experimentos se centraron en tareas de matemáticas y en un pequeño grupo de modelos de lenguaje. El relato disponible no ofrece suficientes detalles para evaluar el conjunto de datos completo, el diseño del clasificador, los márgenes estadísticos o si la investigación ha sido reproducida de forma independiente. La transferencia a otros dominios, a trazas de razonamiento más largas, a sistemas multimodales y a modelos a escala de producción sigue sin probarse con la evidencia disponible.
La implicación central es que la cadena de pensamiento visible de un modelo podría ser solo una cuenta parcial de su cómputo interno. The Decoder cita trabajos previos de Anthropic que indican que los modelos revelaron las pistas utilizadas en su razonamiento solo en el 25 % al 39 % de los casos. También señala investigaciones que sugieren que Claude Opus 4.6 procesa información que no aparece en su razonamiento de salida.
Esa limitación complica los sistemas de supervisión construidos en torno a la lectura de explicaciones generadas. Un modelo podría producir una explicación que parezca plausible mientras se apoya en pasos internos ausentes del texto, o podría describir una operación de razonamiento sin ejecutarla correctamente. El resultado de KAIST y Naver AI Lab no resuelve ese problema, pero aporta evidencia de que las representaciones internas contienen información estructurada sobre el tipo de razonamiento en curso.
Para los investigadores de modelos, la próxima oportunidad es entrenar sondas que identifiquen operaciones durante la generación. Estas herramientas podrían potencialmente señalar un cálculo inesperado, detectar un cambio de deducción a una conjetura sin respaldo o ayudar a diagnosticar por qué falló una solución. Para los equipos de producto, sin embargo, estas posibilidades siguen siendo líneas de investigación y no salvaguardas listas para desplegar.
El hallazgo también podría volverse relevante a medida que más sistemas trasladan el razonamiento a estados numéricos ocultos. The Decoder vincula el trabajo con OpenAI Astra y su técnica Recurrent Depth, que desplaza parte del proceso de razonamiento fuera del texto visible habitual. Si los modelos realizan cada vez más cómputos internamente, los métodos que inspeccionan representaciones podrían volverse más importantes que los que analizan solo explicaciones generadas.
El seguimiento más importante es si las firmas de operación se mantienen estables fuera de las matemáticas. Las pruebas en programación, análisis científico, planificación y uso de herramientas mostrarían si los patrones describen funciones generales de razonamiento o si reflejan principalmente la estructura de las soluciones matemáticas.
Los investigadores también tendrán que determinar si las señales internas pueden identificar errores antes de que un modelo termine una respuesta. El resultado actual muestra que un cálculo incorrecto aún puede reconocerse como un cálculo; no muestra que un monitor pueda decir cuándo el cálculo ha salido mal.
Otra cuestión abierta es la intervención. El estudio demostró que eliminar el contexto precedente debilita la señal, pero no mostró que reforzar o modificar una representación pueda dirigir de manera fiable al modelo hacia una operación deseada. La reproducibilidad en modelos más grandes y más diversos será otra prueba clave.
Los compradores empresariales de IA deberían vigilar las herramientas de monitorización que hacen afirmaciones sobre el razonamiento oculto. Hasta que estos métodos se validen en distintas tareas y se evalúen frente a comportamientos adversarios, el análisis del estado interno debería complementar —y no reemplazar— las pruebas de salida, la verificación de resultados de herramientas y los controles de seguridad convencionales.
Este estudio añade peso a una visión cautelosa del monitoreo de la cadena de pensamiento: el razonamiento escrito es una evidencia útil, pero no una transcripción completa del cómputo del modelo. Los patrones internos identificados por los investigadores muestran que los modelos codifican distinciones entre actividades de razonamiento, pero la brecha entre identificar un proceso y evaluarlo o controlarlo sigue siendo considerable.
Para los constructores, la lección práctica es tratar las sondas de interpretabilidad como una capa diagnóstica emergente. Podrían eventualmente apoyar la depuración de modelos y la evaluación de seguridad, especialmente en sistemas que ocultan más de su razonamiento. Por ahora, la afirmación más sólida respaldada por la evidencia es más estrecha: las representaciones internas contienen señales estructuradas sobre qué tipo de paso de razonamiento parece estar realizando un modelo, incluso cuando la respuesta es incorrecta.