Um estudo da KAIST e do Naver AI Lab constata que os modelos codificam internamente operações de raciocínio distintas, abrindo novas possibilidades e limites para a supervisão de IA.

Um estudo de pesquisadores da KAIST, na Coreia do Sul, e do Naver AI Lab constata que várias operações de raciocínio visíveis na solução escrita de um modelo de IA também aparecem como padrões separáveis em suas representações internas. O sinal foi mais forte nas camadas intermediárias dos modelos testados, sugerindo que a atividade interna pode revelar mais sobre o cálculo de um modelo do que o texto final sozinho.
A descoberta importa porque os desenvolvedores usam cada vez mais o raciocínio escrito como uma janela imperfeita para entender como os modelos resolvem problemas. Se os estados internos distinguem atividades como recuperar uma fórmula, decompor uma tarefa ou realizar um cálculo, os pesquisadores talvez consigam, um dia, monitorar ou intervir nesses processos diretamente. O estudo ainda não mostra que esses padrões possam detectar erros de forma confiável ou controlar a geração em tempo real.
A equipe examinou três modelos — Qwen2.5-7B, Qwen3-8B e Gemma4-31B — enquanto resolviam problemas de matemática. Os pesquisadores dividiram as soluções geradas em segmentos e classificaram cada segmento segundo uma de oito operações recorrentes. As categorias incluíam extrair informações, dividir um problema em partes, lembrar uma fórmula, dedução e cálculo.
Os rótulos de classificação foram produzidos com GPT-5, segundo o relato do The Decoder sobre a pesquisa. Em seguida, os pesquisadores testaram se as representações numéricas internas dos modelos continham informação suficiente para distinguir essas operações.
Nos três modelos, classificadores conseguiram separar as categorias de raciocínio a partir das representações internas. A distinção foi mais pronunciada nas camadas intermediárias do que no começo ou no fim das redes. Esse padrão sugere que os modelos podem inicialmente processar a linguagem em uma forma relativamente misturada antes de organizá-la em estados internos mais específicos por operação.
Os pesquisadores também descobriram que palavras comuns podiam assumir representações internas diferentes dependendo da atividade de raciocínio ao redor. Termos como “a”, “is” e “the” apareciam em muitas categorias na superfície, mas seus estados internos se separavam conforme a operação em andamento.
Esse resultado é importante porque vai contra uma explicação simples baseada apenas no vocabulário. Um classificador que usava os próprios tokens teve desempenho pior do que um que usava representações internas. A posição de um segmento na solução também não explicava a separação.
O estudo incluiu vários testes destinados a estabelecer que o sinal refletia mais do que padrões textuais superficiais. Em uma intervenção, os pesquisadores bloquearam a atenção aos 30 tokens anteriores. A representação associada à operação atual enfraqueceu, indicando que uma etapa de raciocínio depende do contexto anterior em vez de se formar de maneira independente.
As categorias de operação também permaneceram identificáveis quando o modelo chegou a uma resposta incorreta. Um cálculo defeituoso ainda parecia internamente um cálculo, enquanto a recuperação de fórmulas e a dedução mantiveram suas respectivas assinaturas. Essa distinção pode, no futuro, ajudar pesquisadores a separar o tipo de processo que um modelo tenta realizar do fato de esse processo ter produzido um resultado correto.
O efeito relatado foi replicado com Llama-3-8B. Para o Qwen3-8B, classificadores treinados em um conjunto de tarefas transferiram-se para GPQA-Diamond e MATH-500, segundo o The Decoder. Esses testes adicionais sugerem que as representações podem generalizar além dos exemplos iniciais, mas não estabelecem ampla confiabilidade entre modelos ou domínios.
As evidências continuam restritas. Os experimentos se concentraram em tarefas de matemática e em um pequeno grupo de modelos de linguagem. O relato disponível não traz detalhes suficientes para avaliar o conjunto completo de dados, o desenho do classificador, as margens estatísticas ou se a pesquisa foi reproduzida independentemente. A transferência para outros domínios, rastros de raciocínio mais longos, sistemas multimodais e modelos em escala de produção permanece sem teste nas evidências disponíveis.
A implicação central é que a cadeia de pensamento visível de um modelo pode ser apenas um relato parcial de seu cálculo interno. O The Decoder cita trabalhos anteriores da Anthropic indicando que os modelos revelaram as pistas usadas em seu raciocínio em apenas 25% a 39% dos casos. Também aponta pesquisas sugerindo que o Claude Opus 4.6 processa informações que não aparecem no seu raciocínio de saída.
Essa limitação complica sistemas de supervisão construídos em torno da leitura de explicações geradas. Um modelo pode produzir uma explicação com aparência plausível enquanto se apoia em etapas internas ausentes do texto, ou pode descrever uma operação de raciocínio sem executá-la corretamente. O resultado da KAIST e do Naver AI Lab não resolve esse problema, mas fornece evidências de que as representações internas contêm informação estruturada sobre o tipo de raciocínio em andamento.
Para pesquisadores de modelos, a próxima oportunidade é treinar sondas que identifiquem operações durante a geração. Essas ferramentas poderiam, potencialmente, sinalizar um cálculo inesperado, detectar uma mudança de dedução para suposição sem fundamento ou ajudar a diagnosticar por que uma solução falhou. Para equipes de produto, porém, essas possibilidades ainda são direções de pesquisa, e não salvaguardas prontas para implantação.
A descoberta também pode se tornar relevante à medida que mais sistemas movem o raciocínio para estados numéricos ocultos. O The Decoder relaciona o trabalho ao OpenAI Astra e à sua técnica Recurrent Depth, que desloca parte do processo de raciocínio para fora do texto visível comum. Se os modelos passam a fazer cada vez mais cálculo internamente, métodos que inspecionam representações podem se tornar mais importantes do que aqueles que analisam apenas explicações geradas.
O acompanhamento mais importante é saber se as assinaturas de operação permanecem estáveis fora da matemática. Testes em programação, análise científica, planejamento e uso de ferramentas mostrariam se os padrões descrevem funções gerais de raciocínio ou refletem principalmente a estrutura de soluções matemáticas.
Os pesquisadores também precisarão determinar se os sinais internos conseguem identificar erros antes de um modelo terminar uma resposta. O resultado atual mostra que um cálculo incorreto ainda pode ser reconhecido como um cálculo; não mostra que um monitor consegue dizer quando o cálculo deu errado.
Outra questão em aberto é a intervenção. O estudo demonstrou que remover o contexto anterior enfraquece o sinal, mas não mostrou que fortalecer ou modificar uma representação pode conduzir de maneira confiável o modelo a uma operação desejada. A reprodutibilidade em modelos maiores e mais diversos será outro teste-chave.
Compradores corporativos de IA devem acompanhar ferramentas de monitoramento que façam afirmações sobre raciocínio oculto. Até que esses métodos sejam validados em tarefas diversas e avaliados contra comportamento adversarial, a análise do estado interno deve complementar — e não substituir — testes de saída, verificação de resultados de ferramentas e controles de segurança convencionais.
Este estudo reforça uma visão cautelosa do monitoramento da cadeia de pensamento: o raciocínio escrito é uma evidência útil, mas não uma transcrição completa do cálculo do modelo. Os padrões internos identificados pelos pesquisadores mostram que os modelos codificam distinções entre atividades de raciocínio, mas a lacuna entre identificar um processo e avaliá-lo ou controlá-lo ainda é grande.
Para quem constrói, a lição prática é tratar sondas de interpretabilidade como uma camada diagnóstica emergente. Elas podem, no futuro, apoiar depuração de modelos e avaliação de segurança, especialmente em sistemas que escondem mais do seu raciocínio. Por ora, a afirmação mais forte sustentada pelas evidências é mais restrita: as representações internas contêm sinais estruturados sobre que tipo de passo de raciocínio um modelo parece estar executando, mesmo quando a resposta está errada.