Por que um ex-pesquisador do AlphaGo diz que os LLMs atuais ainda não raciocinam

O ex-pesquisador do AlphaGo Thore Graepel argumenta que os LLMs precisam de estados de crença auditáveis e busca, não simplesmente de cadeias de pensamento mais longas.

AI News

Os grandes modelos de linguagem ficaram melhores em produzir respostas passo a passo, mas essa aparente deliberação não equivale necessariamente a raciocínio, segundo Thore Graepel, ex-pesquisador do Google DeepMind e membro central da equipe do AlphaGo.

Em uma análise publicada pelo MIT Technology Review, Graepel argumenta que os LLMs atuais continuam sendo, fundamentalmente, sistemas de previsão do próximo token. Ele afirma que uma inteligência de máquina confiável exigirá uma arquitetura de raciocínio separada, que registre crenças, teste possíveis explicações, atualize suas conclusões com base em evidências e torne seu processo de decisão inspecionável.

O argumento é relevante porque desenvolvedores de IA e compradores empresariais estão cada vez mais implantando modelos para programação, pesquisa, diagnóstico, planejamento e outras tarefas nas quais uma resposta plausível não é suficiente. A proposta de Graepel não é um anúncio de produto nem um novo resultado de benchmark. É uma crítica técnica de um pesquisador proeminente que deixou recentemente o Google DeepMind e defende uma direção diferente para o desenvolvimento da IA.

O argumento por trás da manchete

A distinção central de Graepel é entre completar padrões com fluência e raciocinar deliberadamente. Um LLM gera um token após o outro com base em relações estatísticas aprendidas a partir dos dados. Esse processo pode produzir explicações úteis, soluções matemáticas e código, mas o mecanismo subjacente continua sendo o mesmo mesmo quando o modelo gera etapas intermediárias.

Essas etapas intermediárias são geralmente chamadas de cadeia de pensamento. Graepel reconhece que a cadeia de pensamento pode melhorar o desempenho, especialmente em matemática e programação. Sua objeção é que gerar mais texto não cria um sistema de raciocínio independente. O modelo continua estendendo uma sequência por meio da previsão do próximo token, em vez de manipular um conjunto explícito de proposições ou hipóteses.

Ele identifica três fraquezas. Os modelos atuais geralmente não têm um registro persistente e inspecionável do que acreditam, de quão confiantes estão, de quais evidências sustentam cada afirmação e de quais questões continuam sem solução. Eles também combinam o conhecimento armazenado com as operações usadas para manipulá-lo dentro dos pesos da rede neural, em vez de manter uma separação clara entre conhecimento e raciocínio. Por fim, suas explicações escritas podem não representar fielmente como uma resposta foi produzida.

Esse último problema é especialmente importante em sistemas de alto risco. Se uma IA cometer um erro na medicina, na engenharia ou na pesquisa científica, os usuários precisam determinar se a falha veio de evidências ruins, de uma suposição inválida ou de uma inferência equivocada. Uma explicação convincente gerada depois da resposta pode não fornecer essa informação diagnóstica.

O que o AlphaGo fez de diferente

Graepel usa o AlphaGo para ilustrar o tipo de arquitetura que, em sua opinião, a IA moderna precisa. Durante sua partida de 2016 contra o campeão sul-coreano Lee Sedol, o AlphaGo fez uma jogada incomum conhecida como jogada 37. A jogada inicialmente pareceu um erro, mas o AlphaGo acabou vencendo a partida e o confronto por 4 a 1.

O ponto importante, argumenta Graepel, é que a jogada não veio apenas da intuição. O AlphaGo combinou uma rede neural de política, que estimava jogadas promissoras, com um sistema de busca que explorava possíveis continuações. A busca construía uma árvore do jogo contendo posições alternativas e jogadas futuras, avaliando esses ramos antes de selecionar uma ação.

Nesse projeto, as redes neurais forneciam julgamentos rápidos, enquanto a busca oferecia deliberação estruturada. Graepel compara a combinação à distinção comportamental entre o pensamento rápido e intuitivo e o pensamento mais lento e analítico. Os dois componentes se apoiavam: a intuição reduzia as possibilidades, enquanto a busca testava essas possibilidades diante de consequências futuras.

A comparação tem limites. O Go oferece um tabuleiro definido, um conjunto fixo de ações legais e regras que determinam o resultado de cada jogada. Problemas abertos na ciência ou nos negócios não oferecem essas condições. O estado do mundo é incompleto, as ações disponíveis variam e as consequências podem ser incertas.

Ainda assim, Graepel afirma que a arquitetura oferece um modelo útil. Um sistema de raciocínio de propósito geral poderia manter um “estado epistêmico” — um registro estruturado de afirmações estabelecidas, dúvidas, explicações rejeitadas, questões em aberto e evidências de apoio. Cada etapa do raciocínio atualizaria esse estado, em vez de simplesmente acrescentar mais texto gerado.

Evidências e afirmações

As afirmações mais fortes desta história vêm da análise de Graepel no MIT Technology Review, não de um experimento recém-relatado ou de uma avaliação independente de produto. O artigo fornece detalhes históricos e arquitetônicos sobre o AlphaGo, mas não apresenta um novo benchmark comparando os LLMs atuais com um sistema de estado epistêmico proposto.

Graepel também menciona pesquisas que mostram que os modelos de linguagem podem produzir explicações que não refletem de forma confiável os processos que levaram às suas respostas. O artigo fornecido não identifica estudos, conjuntos de dados ou resultados de modelos com detalhes suficientes para avaliar aqui o tamanho ou a generalidade desse efeito.

Essa distinção é importante. A crítica não significa que os modelos atuais sejam inúteis ou incapazes de resolver problemas com várias etapas. Significa que o desempenho em uma tarefa não deve ser automaticamente tratado como prova de que um modelo raciocina no mesmo sentido que um sistema que acompanha explicitamente alternativas, evidências e revisões de crenças.

O artigo também apresenta a direção de projeto do próprio Graepel. Ele propõe usar LLMs para sugerir estratégias, interagir com ferramentas por meio de APIs ou código e avaliar se as afirmações são apoiadas por evidências. Um avaliador independente então julgaria se cada etapa realmente reduz a incerteza antes de permitir que o sistema atualizasse seu conhecimento.

O que observar a seguir

Para os desenvolvedores de IA, o sinal prático será saber se os novos sistemas vão além de prompts mais longos e rastros de raciocínio gerados mais extensos. Os desenvolvedores devem observar arquiteturas que mantenham estados intermediários inspecionáveis, separem a memória factual dos procedimentos de inferência e registrem como as evidências alteram uma conclusão.

O uso de ferramentas será outra área importante. Um sistema capaz de executar código, consultar bancos de dados, recuperar documentos ou projetar um experimento pode se tornar mais confiável se essas ações estiverem ligadas a testes explícitos, em vez de serem tratadas como enfeites em torno de uma resposta de modelo de linguagem. A questão relevante não é simplesmente se um agente chama uma ferramenta, mas se o resultado altera um estado de crença estruturado de maneira rastreável.

Os compradores empresariais também devem perguntar aos fornecedores como auditam as decisões dos modelos, reproduzem falhas e distinguem evidências recuperadas de afirmações geradas. As interfaces atuais de cadeia de pensamento podem fazer uma resposta parecer mais fundamentada sem tornar o processo subjacente mais verificável.

Enquanto isso, os pesquisadores precisarão mostrar se arquiteturas inspiradas no AlphaGo conseguem lidar com tarefas de mundo aberto sem se tornarem caras ou lentas demais. Manter e avaliar muitas hipóteses pode melhorar a confiabilidade, mas também aumentar o uso de computação, a latência, a complexidade de engenharia e o esforço de validar cada atualização.

A perspectiva da Creati.ai

A intervenção de Graepel deve ser entendida principalmente como um desafio à forma como a indústria de IA rotula o progresso. Melhores resultados em benchmarks de raciocínio e explicações mais elaboradas são valiosos, mas não estabelecem por si só que um modelo tenha um processo de raciocínio auditável.

O teste mais difícil é operacional: um sistema consegue preservar a incerteza, expor as evidências por trás de uma conclusão, revisar suas crenças quando chegam novas informações e mostrar onde ocorreu uma falha? Se a IA pretende apoiar a descoberta científica, a medicina e outros fluxos de trabalho de alto impacto, essas capacidades podem ser tão importantes quanto a escala bruta do modelo. A próxima geração de sistemas de IA será julgada não apenas pelas respostas que produz, mas também pela possibilidade de os usuários inspecionarem e confiarem no caminho seguido para chegar a elas.

Anúncios