전직 AlphaGo 연구자 Thore Graepel은 LLM에 단순히 더 긴 사고 사슬이 아니라 감사 가능한 신념 상태와 탐색이 필요하다고 주장한다.

대규모 언어 모델은 단계별 답변을 생성하는 능력이 향상됐다. 그러나 전 Google DeepMind 연구자이자 AlphaGo 팀의 핵심 구성원이었던 Thore Graepel에 따르면, 이러한 겉보기 숙고가 반드시 추론을 의미하는 것은 아니다.
MIT Technology Review에 게재된 분석에서 Graepel은 현재의 LLM이 근본적으로 여전히 다음 토큰을 예측하는 시스템이라고 주장한다. 신뢰할 수 있는 기계 지능을 위해서는 신념을 기록하고, 가능한 설명을 검증하며, 증거에 따라 결론을 갱신하고, 의사결정 과정을 점검할 수 있게 하는 별도의 추론 아키텍처가 필요하다는 것이다.
이 주장이 중요한 이유는 AI 개발자와 기업 구매자들이 코딩, 연구, 진단, 계획 등 그럴듯한 답변만으로는 충분하지 않은 작업에 모델을 점점 더 도입하고 있기 때문이다. Graepel의 제안은 제품 발표도, 새로운 벤치마크 결과도 아니다. 최근 Google DeepMind를 떠난 저명한 연구자가 AI 개발의 다른 방향을 요구하는 기술적 비판이다.
Graepel이 제시하는 핵심적인 구분은 유창한 패턴 완성과 숙고적 추론 사이에 있다. LLM은 데이터에서 학습한 통계적 관계에 기반해 토큰을 하나씩 생성한다. 이 과정은 유용한 설명, 수학적 해답, 코드를 만들어낼 수 있지만, 모델이 중간 단계를 생성하더라도 근본적인 메커니즘은 동일하다.
이러한 중간 단계는 흔히 사고 사슬이라고 불린다. Graepel은 사고 사슬이 특히 수학과 코딩에서 성능을 높일 수 있다는 점을 인정한다. 하지만 더 많은 텍스트를 생성한다고 해서 독립적인 추론 시스템이 만들어지는 것은 아니라고 지적한다. 모델은 명시적인 명제나 가설의 집합을 조작하는 것이 아니라 여전히 다음 토큰 예측을 통해 시퀀스를 연장한다.
그는 세 가지 약점을 지적한다. 현재 모델은 일반적으로 자신이 무엇을 믿는지, 얼마나 확신하는지, 각 주장을 뒷받침하는 증거가 무엇인지, 어떤 질문이 미해결 상태인지에 대한 지속적이고 점검 가능한 기록이 없다. 또한 지식과 추론을 명확히 분리하지 않고, 저장된 지식과 이를 조작하는 작업을 신경망의 가중치 안에서 결합한다. 마지막으로 모델이 작성한 설명은 답변이 어떻게 생성됐는지를 충실히 나타내지 않을 수 있다.
마지막 문제는 고위험 시스템에서 특히 중요하다. AI가 의료, 공학 또는 과학 연구에서 실수를 하면 사용자는 실패가 부실한 증거, 잘못된 가정, 오류가 있는 추론 중 무엇에서 비롯됐는지 판단해야 한다. 답변 이후에 생성된 설득력 있는 설명이 이러한 진단 정보를 제공하지 못할 수도 있다.
Graepel은 현대 AI에 필요하다고 생각하는 아키텍처를 설명하기 위해 AlphaGo를 활용한다. AlphaGo는 2016년 한국의 챔피언 이세돌과 대국하던 중 37수로 알려진 이례적인 수를 뒀다. 처음에는 실수처럼 보였지만, AlphaGo는 결국 해당 대국과 전체 매치를 4-1로 승리했다.
Graepel이 말하는 중요한 점은 그 수가 직관만으로 나온 것이 아니라는 사실이다. AlphaGo는 유망한 수를 추정하는 신경망 정책 네트워크와 가능한 진행을 탐색하는 검색 시스템을 결합했다. 검색 시스템은 대안적인 국면과 미래의 수를 포함하는 게임 트리를 구축한 뒤 행동을 선택하기 전에 각 가지를 평가했다.
이 설계에서 신경망은 빠른 판단을 제공했고, 검색은 구조화된 숙고를 제공했다. Graepel은 이러한 구성을 빠르고 직관적인 사고와 느리고 분석적인 사고의 행동적 구분에 비유한다. 두 요소는 서로를 보완했다. 직관은 가능성을 좁혔고, 검색은 미래의 결과에 비춰 그 가능성을 검증했다.
하지만 이 비교에는 한계가 있다. 바둑에는 정의된 바둑판, 고정된 합법적 행동의 집합, 각 수의 결과를 결정하는 규칙이 있다. 과학이나 비즈니스의 개방형 문제에는 이러한 조건이 없다. 세계의 상태는 불완전하고, 가능한 행동은 달라지며, 결과는 불확실할 수 있다.
그럼에도 Graepel은 이 아키텍처가 유용한 청사진을 제공한다고 말한다. 범용 추론 시스템은 확정된 주장, 의심, 기각된 설명, 열린 질문, 뒷받침하는 증거를 구조화한 기록인 ‘인식론적 상태’를 유지할 수 있다. 추론의 각 단계는 생성된 텍스트를 단순히 덧붙이는 대신 이 상태를 갱신하게 된다.
이 기사에서 가장 강한 주장은 새로 보고된 실험이나 독립적인 제품 평가가 아니라 MIT Technology Review에 실린 Graepel의 분석에서 나온다. 기사는 AlphaGo에 관한 역사적·구조적 세부사항을 제공하지만, 현재의 LLM과 제안된 인식론적 상태 시스템을 비교하는 새로운 벤치마크를 제시하지는 않는다.
Graepel은 언어 모델이 답변에 이르는 과정을 신뢰성 있게 반영하지 않는 설명을 생성할 수 있다는 연구도 언급한다. 제공된 기사에는 이 효과의 규모나 일반성을 여기서 평가할 수 있을 만큼 구체적인 연구, 데이터 세트 또는 모델 결과가 제시되어 있지 않다.
이 구분은 중요하다. 이 비판은 현재 모델이 쓸모없거나 여러 단계를 거치는 문제를 해결할 수 없다는 뜻이 아니다. 과제 수행 성능을, 대안과 증거 및 신념의 수정을 명시적으로 추적하는 시스템과 같은 의미에서 모델이 추론한다는 증거로 자동 간주해서는 안 된다는 뜻이다.
이 기사는 Graepel이 제시하는 설계 방향도 설명한다. 그는 LLM을 사용해 전략을 제안하고, API나 코드를 통해 도구와 상호작용하며, 주장이 증거로 뒷받침되는지 평가하자고 제안한다. 그런 다음 독립적인 평가자가 시스템의 지식 갱신을 허용하기 전에 각 단계가 실제로 불확실성을 줄이는지 판단하게 된다.
AI 개발자에게 실질적인 신호는 새로운 시스템이 더 긴 프롬프트와 더 긴 생성 추론 기록을 넘어서는지 여부가 될 것이다. 개발자들은 점검 가능한 중간 상태를 유지하고, 사실 기억과 추론 절차를 분리하며, 증거가 결론을 어떻게 바꾸는지 기록하는 아키텍처를 주목해야 한다.
도구 사용도 핵심 영역이 될 것이다. 코드를 실행하고, 데이터베이스를 조회하고, 문서를 검색하고, 실험을 설계할 수 있는 시스템은 이러한 행동이 언어 모델 응답을 꾸미는 장식으로 취급되는 대신 명시적인 검증과 연결될 때 더 신뢰할 수 있게 될 가능성이 있다. 중요한 질문은 에이전트가 도구를 호출하는지 여부가 아니라, 그 결과가 추적 가능한 방식으로 구조화된 신념 상태를 변화시키는지 여부다.
기업 구매자들은 모델의 의사결정을 어떻게 감사하고, 실패를 재현하며, 검색된 증거와 생성된 주장을 구분하는지 공급업체에 물어야 한다. 기존의 사고 사슬 인터페이스는 답변이 더 합리적으로 보이게 만들 수 있지만, 근본적인 과정을 더 검증 가능하게 만들지는 않는다.
한편 연구자들은 AlphaGo에서 영감을 얻은 아키텍처가 지나치게 비싸거나 느려지지 않으면서 개방형 세계의 작업을 처리할 수 있는지 보여줘야 한다. 많은 가설을 유지하고 평가하면 신뢰성이 향상될 수 있지만, 계산량, 지연 시간, 엔지니어링 복잡성, 각 갱신을 검증해야 하는 부담도 커질 수 있다.
Graepel의 개입은 AI 업계가 발전을 어떻게 명명하는지에 대한 도전으로 이해하는 것이 가장 적절하다. 추론 벤치마크에서 더 나은 결과를 내고 더 정교한 설명을 제공하는 것은 가치가 있지만, 그것만으로 모델이 감사 가능한 추론 과정을 갖고 있다는 사실이 입증되지는 않는다.
더 어려운 시험은 운영상의 문제다. 시스템이 불확실성을 보존하고, 결론을 뒷받침하는 증거를 공개하며, 새로운 정보가 들어오면 신념을 수정하고, 어디에서 실패가 발생했는지 보여줄 수 있는가? AI가 과학적 발견, 의료 및 기타 결과가 중대한 업무 흐름을 지원하려면 이러한 능력은 순수한 모델 규모만큼 중요할 수 있다. 차세대 AI 시스템은 답변을 생성하는 능력뿐 아니라 사용자가 그 답변에 도달한 경로를 검사하고 신뢰할 수 있는지에 따라서도 평가받게 될 것이다.