El exinvestigador de AlphaGo Thore Graepel sostiene que los LLM necesitan estados de creencias auditables y búsqueda, no simplemente cadenas de pensamiento más largas.

Los grandes modelos de lenguaje han mejorado a la hora de producir respuestas paso a paso, pero esa deliberación aparente no equivale necesariamente a razonar, según Thore Graepel, antiguo investigador de Google DeepMind y miembro clave del equipo de AlphaGo.
En un análisis publicado por MIT Technology Review, Graepel sostiene que los LLM actuales siguen siendo, fundamentalmente, sistemas de predicción del siguiente token. Afirma que una inteligencia artificial confiable necesitará una arquitectura de razonamiento separada que registre creencias, ponga a prueba posibles explicaciones, actualice sus conclusiones con evidencia y haga auditable su proceso de decisión.
El argumento importa porque los desarrolladores de IA y los compradores empresariales despliegan cada vez más modelos para programación, investigación, diagnóstico, planificación y otras tareas en las que una respuesta plausible no basta. La propuesta de Graepel no es un anuncio de producto ni un nuevo resultado de referencia. Es una crítica técnica de un investigador destacado que dejó recientemente Google DeepMind y pide una dirección diferente para el desarrollo de la IA.
La distinción central de Graepel es entre la finalización fluida de patrones y el razonamiento deliberativo. Un LLM genera un token tras otro basándose en relaciones estadísticas aprendidas de los datos. Ese proceso puede producir explicaciones útiles, soluciones matemáticas y código, pero el mecanismo subyacente sigue siendo el mismo incluso cuando el modelo genera pasos intermedios.
Esos pasos intermedios suelen llamarse cadena de pensamiento. Graepel reconoce que la cadena de pensamiento puede mejorar el rendimiento, especialmente en matemáticas y programación. Su objeción es que generar más texto no crea un sistema de razonamiento independiente. El modelo sigue prolongando una secuencia mediante la predicción del siguiente token, en lugar de manipular un conjunto explícito de proposiciones o hipótesis.
Identifica tres debilidades. Por lo general, los modelos actuales carecen de un registro persistente y auditable de lo que creen, de cuánta confianza tienen, de qué evidencia respalda cada afirmación y de qué preguntas siguen sin resolverse. También combinan el conocimiento almacenado con las operaciones utilizadas para manipularlo dentro de los pesos de la red neuronal, en vez de mantener una separación clara entre conocimiento y razonamiento. Por último, sus explicaciones escritas pueden no representar fielmente cómo se produjo una respuesta.
Este último problema es especialmente importante para los sistemas de alto riesgo. Si una IA comete un error en medicina, ingeniería o investigación científica, los usuarios necesitan determinar si el fallo se debió a evidencia deficiente, una suposición inválida o una inferencia defectuosa. Una explicación convincente generada después de la respuesta quizá no proporcione esa información diagnóstica.
Graepel utiliza AlphaGo para ilustrar el tipo de arquitectura que, a su juicio, necesita la IA moderna. Durante su partida de 2016 contra el campeón surcoreano Lee Sedol, AlphaGo jugó una jugada inusual conocida como la jugada 37. Al principio pareció un error, pero AlphaGo acabó ganando la partida y el encuentro por 4-1.
El punto importante, sostiene Graepel, es que la jugada no surgió únicamente de la intuición. AlphaGo combinó una red neuronal de política, que estimaba las jugadas prometedoras, con un sistema de búsqueda que exploraba posibles continuaciones. La búsqueda construía un árbol de juego con posiciones alternativas y jugadas futuras, y después evaluaba esas ramas antes de seleccionar una acción.
En este diseño, las redes neuronales proporcionaban juicios rápidos, mientras que la búsqueda aportaba deliberación estructurada. Graepel compara esta disposición con la distinción conductual entre el pensamiento rápido e intuitivo y el pensamiento más lento y analítico. Ambos componentes se apoyaban mutuamente: la intuición reducía las posibilidades, mientras que la búsqueda probaba esas posibilidades frente a sus consecuencias futuras.
La comparación tiene límites. Go ofrece un tablero definido, un conjunto fijo de acciones legales y reglas que determinan el resultado de cada jugada. Los problemas abiertos de la ciencia o los negocios no ofrecen esas condiciones. El estado del mundo es incompleto, las acciones disponibles varían y las consecuencias pueden ser inciertas.
Aun así, Graepel afirma que la arquitectura ofrece una plantilla útil. Un sistema de razonamiento de propósito general podría mantener un “estado epistémico”: un registro estructurado de afirmaciones establecidas, dudas, explicaciones rechazadas, preguntas abiertas y evidencia de respaldo. Cada paso de razonamiento actualizaría ese estado, en lugar de limitarse a añadir más texto generado.
Las afirmaciones más contundentes de esta historia proceden del análisis de Graepel en MIT Technology Review, no de un experimento recién publicado ni de una evaluación independiente de un producto. El artículo aporta detalles históricos y arquitectónicos sobre AlphaGo, pero no presenta un nuevo benchmark que compare los LLM actuales con un sistema de estado epistémico propuesto.
Graepel también cita investigaciones que muestran que los modelos de lenguaje pueden producir explicaciones que no reflejan de forma fiable los procesos que condujeron a sus respuestas. El artículo proporcionado no identifica estudios, conjuntos de datos ni resultados de modelos concretos con suficiente detalle para evaluar aquí el tamaño o la generalidad de ese efecto.
Esa distinción es importante. La crítica no significa que los modelos actuales sean inútiles o incapaces de resolver problemas de varios pasos. Significa que el rendimiento en una tarea no debe considerarse automáticamente una prueba de que un modelo razona en el mismo sentido que un sistema que sigue explícitamente alternativas, evidencia y revisiones de sus creencias.
El artículo también presenta la propia orientación de diseño de Graepel. Propone usar LLM para sugerir estrategias, interactuar con herramientas mediante API o código y evaluar si las afirmaciones están respaldadas por evidencia. Después, un evaluador independiente juzgaría si cada paso realmente reduce la incertidumbre antes de permitir que el sistema actualice sus conocimientos.
Para los desarrolladores de IA, la señal práctica será si los nuevos sistemas van más allá de prompts más largos y trazas de razonamiento generadas más extensas. Los desarrolladores deberían observar arquitecturas que mantengan estados intermedios auditables, separen la memoria factual de los procedimientos de inferencia y registren cómo la evidencia cambia una conclusión.
El uso de herramientas será otra área clave. Un sistema capaz de ejecutar código, consultar bases de datos, recuperar documentos o diseñar un experimento podría ser más fiable si esas acciones están conectadas a pruebas explícitas, en lugar de tratarse como adornos alrededor de una respuesta de un modelo de lenguaje. La pregunta relevante no es simplemente si un agente utiliza una herramienta, sino si el resultado modifica un estado de creencias estructurado de forma rastreable.
Los compradores empresariales también deberían preguntar a los proveedores cómo auditan las decisiones del modelo, reproducen los fallos y distinguen la evidencia recuperada de las afirmaciones generadas. Las interfaces actuales de cadena de pensamiento pueden hacer que una respuesta parezca más razonada sin volver más verificable el proceso subyacente.
Mientras tanto, los investigadores tendrán que demostrar si las arquitecturas inspiradas en AlphaGo pueden afrontar tareas de mundo abierto sin resultar demasiado caras o lentas. Mantener y evaluar muchas hipótesis puede mejorar la fiabilidad, pero también aumentar el cómputo, la latencia, la complejidad de ingeniería y la carga de validar cada actualización.
La intervención de Graepel se entiende mejor como un desafío a la forma en que la industria de la IA denomina el progreso. Mejores resultados en benchmarks de razonamiento y explicaciones más elaboradas son valiosos, pero por sí solos no demuestran que un modelo tenga un proceso de razonamiento auditable.
La prueba más difícil es operativa: ¿puede un sistema conservar la incertidumbre, exponer la evidencia detrás de una conclusión, revisar sus creencias cuando llega nueva información y mostrar dónde se produjo un fallo? Si la IA va a apoyar el descubrimiento científico, la medicina y otros flujos de trabajo de alto impacto, esas capacidades podrían importar tanto como la escala bruta del modelo. La próxima generación de sistemas de IA no será juzgada únicamente por las respuestas que produzca, sino por si los usuarios pueden inspeccionar y confiar en el camino seguido para alcanzarlas.