KAIST와 Naver AI Lab의 연구는 모델이 서로 다른 추론 연산을 내부적으로 인코딩한다는 사실을 밝혀내며, AI 감독에 대한 새로운 가능성과 한계를 제시한다.

한국 KAIST와 Naver AI Lab 연구진의 한 연구는 AI 모델의 서면 해답에 보이는 여러 추론 연산이 내부 표현에서도 분리 가능한 패턴으로 나타난다는 사실을 발견했다. 신호는 테스트한 모델들의 중간 층에서 가장 강했으며, 이는 내부 활동이 최종 텍스트만으로는 알 수 없는 모델의 계산을 더 많이 드러낼 수 있음을 시사한다.
이 발견이 중요한 이유는 개발자들이 모델이 문제를 어떻게 푸는지 들여다보는 불완전한 창으로서 서면 추론을 점점 더 활용하고 있기 때문이다. 내부 상태가 공식 검색, 과제 분해, 계산 수행 같은 활동을 구분할 수 있다면, 연구자들은 언젠가 그 과정들을 직접 모니터링하거나 개입할 수 있을지도 모른다. 다만 이 연구는 이러한 패턴으로 실수를 신뢰성 있게 감지하거나 실시간으로 생성을 제어할 수 있음을 아직 보여주지 않는다.
연구팀은 수학 문제를 해결하는 동안 Qwen2.5-7B, Qwen3-8B, Gemma4-31B 세 모델을 살펴보았다. 연구진은 생성된 해답을 여러 구간으로 나누고, 각 구간을 8개의 반복되는 연산 중 하나로 분류했다. 범주에는 정보 추출, 문제를 부분으로 나누기, 공식을 떠올리기, 연역, 계산이 포함됐다.
분류 라벨은 The Decoder의 보도에 따르면 GPT-5를 사용해 생성됐다. 이후 연구진은 모델의 내부 수치 표현에 이러한 연산을 구분할 만큼의 정보가 담겨 있는지 시험했다.
세 모델 모두에서 분류기는 내부 표현으로부터 추론 범주를 구분할 수 있었다. 이러한 구분은 네트워크의 앞부분이나 끝부분보다 중간 층에서 가장 두드러졌다. 이 패턴은 모델이 처음에는 비교적 뒤섞인 형태로 언어를 처리한 뒤, 더 연산 특화된 내부 상태로 조직화할 수 있음을 시사한다.
연구진은 또한 흔한 단어들이 주변 추론 활동에 따라 서로 다른 내부 표현을 가질 수 있음을 발견했다. “a”, “is”, “the” 같은 용어는 표면적으로는 많은 범주에 등장했지만, 내부 상태는 진행 중인 연산에 따라 분리됐다.
이 결과는 어휘만을 바탕으로 한 단순한 설명에 반하기 때문에 중요하다. 토큰 자체를 사용하는 분류기는 내부 표현을 사용하는 분류기보다 성능이 나빴다. 해답에서 세그먼트의 위치도 이러한 분리를 설명하지 못했다.
이 연구는 신호가 표면적인 텍스트 패턴 이상을 반영한다는 점을 보여주기 위한 여러 테스트를 포함했다. 한 개입에서는 연구진이 이전 30개 토큰에 대한 주의를 차단했다. 현재 연산과 연결된 표현은 약해졌고, 이는 추론 단계가 독립적으로 형성되기보다 이전 문맥에 의존한다는 점을 보여준다.
모델이 오답에 도달했을 때도 연산 범주는 식별 가능했다. 잘못된 계산도 내부적으로는 여전히 계산처럼 보였고, 공식 검색과 연역은 각각의 고유한 흔적을 유지했다. 이러한 구분은 언젠가 연구자들이 모델이 시도하고 있는 과정의 종류와 그 과정이 올바른 결과를 냈는지를 분리해 파악하는 데 도움이 될 수 있다.
보고된 효과는 Llama-3-8B에서도 재현되었다. The Decoder에 따르면 Qwen3-8B의 경우, 한 작업 집합에서 학습한 분류기가 GPQA-Diamond와 MATH-500으로 전이되었다. 이러한 추가 테스트는 표현이 초기 예시를 넘어 일반화될 수 있음을 시사하지만, 모델이나 도메인 전반에서의 광범위한 신뢰성을 입증하지는 않는다.
증거는 여전히 제한적이다. 실험은 수학 과제와 소수의 언어 모델에 초점을 맞췄다. 제공된 설명만으로는 전체 데이터셋, 분류기 설계, 통계적 여유, 연구가 독립적으로 재현되었는지 여부를 충분히 평가하기 어렵다. 다른 도메인, 더 긴 추론 흔적, 멀티모달 시스템, 생산 규모 모델로의 전이는 현재 उपलब्ध 증거로는 아직 검증되지 않았다.
핵심 시사점은 모델의 눈에 보이는 Chain-of-Thought가 내부 계산의 일부만을 보여줄 수 있다는 점이다. The Decoder는 Anthropic의 이전 연구를 인용하며, 모델이 추론에서 사용한 단서를 공개한 비율이 25%에서 39%에 불과했다고 전한다. 또한 Claude Opus 4.6이 출력된 추론에는 나타나지 않는 정보를 처리한다는 연구도 언급한다.
이러한 한계는 생성된 설명을 읽는 방식으로 구축된 감독 시스템을 복잡하게 만든다. 모델은 그럴듯해 보이는 설명을 내놓으면서도 텍스트에 없는 내부 단계를 의존할 수 있고, 혹은 추론 연산을 설명하면서도 제대로 수행하지 못할 수 있다. KAIST와 Naver AI Lab의 결과는 이 문제를 해결하지는 않지만, 내부 표현에 진행 중인 추론의 종류에 대한 구조화된 정보가 담겨 있다는 증거를 제공한다.
모델 연구자들에게 다음 기회는 생성 중 연산을 식별하는 프로브를 훈련하는 것이다. 이러한 도구는 예상치 못한 계산을 표시하거나, 연역에서 근거 없는 추측으로의 전환을 감지하거나, 해답이 실패한 이유를 진단하는 데 도움을 줄 수 있다. 그러나 제품 팀에게는 이러한 가능성은 여전히 연구 방향일 뿐, 바로 배포 가능한 안전 장치는 아니다.
이 발견은 더 많은 시스템이 추론을 숨겨진 수치 상태로 옮길수록 더욱 중요해질 수 있다. The Decoder는 이 작업을 OpenAI Astra와 그 Recurrent Depth 기술에 연결한다. 이 기술은 추론 과정의 일부를 일반적으로 보이는 텍스트 밖으로 이동시킨다. 모델이 점점 더 내부적으로 계산한다면, 생성된 설명만 분석하는 방법보다 표현을 살피는 방법이 더 중요해질 수 있다.
가장 중요한 후속 질문은 연산 시그니처가 수학 밖에서도 안정적인지 여부다. 코딩, 과학 분석, 계획, 도구 사용에 대한 테스트는 이러한 패턴이 일반적인 추론 기능을 설명하는지, 아니면 주로 수학 해답의 구조를 반영하는지 보여줄 것이다.
연구자들은 또한 내부 신호가 모델이 응답을 마치기 전에 오류를 식별할 수 있는지 확인해야 한다. 현재 결과는 잘못된 계산도 여전히 계산으로 인식될 수 있음을 보여주지만, 계산이 언제 잘못되었는지를 감시 시스템이 알아낼 수 있음을 보여주지는 않는다.
또 다른 미해결 질문은 개입이다. 연구는 이전 문맥을 제거하면 신호가 약해진다는 점을 보여줬지만, 표현을 강화하거나 수정하면 모델을 원하는 연산으로 안정적으로 유도할 수 있는지는 보여주지 않았다. 더 크고 다양한 모델 전반에서의 재현성도 또 하나의 핵심 시험이 될 것이다.
기업용 AI 구매자들은 숨겨진 추론에 대해 주장하는 모니터링 도구를 주의 깊게 살펴봐야 한다. 이러한 방법이 다양한 과제에서 검증되고 적대적 행위에 대해 평가되기 전까지는, 내부 상태 분석은 출력 테스트, 도구 결과 검증, 전통적인 안전 제어를 보완해야 하며 대체해서는 안 된다.
이 연구는 Chain-of-Thought 모니터링에 대한 신중한 시각에 무게를 더한다. 서면 추론은 유용한 증거이지만, 모델 계산의 완전한 기록은 아니다. 연구진이 식별한 내부 패턴은 모델이 추론 활동의 구분을 인코딩한다는 점을 보여주지만, 과정을 식별하는 것과 그것을 평가하거나 제어하는 것 사이에는 여전히 큰 간격이 있다.
개발자에게 주는 실용적 교훈은 해석 가능성 프로브를 새롭게 등장하는 진단 계층으로 취급하라는 것이다. 특히 추론의 더 많은 부분을 숨기는 시스템에서는 향후 모델 디버깅과 안전성 평가를 지원할 수 있다. 현재로서는 증거가 가장 강하게 뒷받침하는 주장은 더 좁다. 내부 표현에는 답이 틀렸더라도 모델이 어떤 종류의 추론 단계를 수행하고 있는 것처럼 보이는지에 대한 구조화된 신호가 담겨 있다는 것이다.