Claude Code와 Codex 테스트에서 시간 예측과 자기 평가에 큰 오류가 발견돼, 장시간 AI 코딩 작업의 감독 필요성이 제기됐다.

Anthropic의 Claude Code와 OpenAI의 Codex는 소프트웨어 작업을 수행할 수 있지만, 새로운 연구는 이들이 해당 작업에 얼마나 시간이 걸리는지에 대한 이해가 약하며, 자신의 성과를 판단하는 능력은 그보다도 더 약하다는 점을 시사한다. 이 발견은 AI 코딩 에이전트가 짧은 인터랙티브 프롬프트에서 벗어나, 수십 분 또는 수 시간 동안 자율적으로 실행되는 작업으로 이동하고 있는 시점에서 중요하다.
MATS 연구 프로그램에서 활동하는 두 명의 독립 연구자가 The Decoder의 보도에 따르면 ProgramBench의 200개 과제와 추가 18개 벤치마크에서 이 도구들을 테스트했다. 에이전트에게는 작업을 시작하기 전에 필요한 시간을 추정하게 하고, 작업을 마친 뒤에는 얼마나 시간이 지났는지 보고하게 했다. 두 시스템 모두 작업 시간을 일관되게 과대평가했으며, 실패한 작업에도 테스트 결과가 정당화할 수 있는 수준보다 훨씬 높은 점수를 부여했다.
이 연구는 모델이 모든 소프트웨어 환경에서 문자 그대로 시간에 접근하지 못한다는 것을 보여주는 것은 아니다. 대신 현재의 AI 에이전트가 경과 시간을 인식하고 그 정보를 작업 관리에 활용하는 방식의 실용적 약점을 드러낸다. 연구자들이 경과 시간을 알려주는 도구를 제공했을 때, 에이전트들은 거의 항상 정확해졌다고 보고됐다.
ProgramBench에서 두 에이전트는 대체로 난이도와 무관하게 작업이 약 90분 걸릴 것이라고 예측했다고 The Decoder는 전했다. 두 번째 테스트 세트에서는 Claude Code의 추정이 평균적으로 약 3배 빗나갔고, Codex는 6배에서 10배까지 빗나갔다.
가장 큰 오차는 짧은 작업에서 나타났다. 보도에 따르면 예측이 실제와 가까워진 것은 작업이 몇 시간 단위로 길어졌을 때뿐이었다. 이는 운영상 중요한 패턴이다. 몇 분 만에 끝날 수 있는 작업에 90분을 예측하는 에이전트는 언제 멈춰야 하는지, 도움을 요청해야 하는지, 다른 행동을 시작해야 하는지에 대해 잘못된 결정을 내릴 수 있다.
결과는 각 모델을 둘러싼 소프트웨어 환경에 따라서도 크게 달랐다. Claude Code는 할당된 작업이 완료됐다고 판단할 때까지 계속 작업했으며, 보고된 중앙값 실행 시간은 약 90분이었다. Codex는 작업 난이도가 달라져도 많은 경우 약 30분 후에 멈췄다.
연구자들은 이 차이의 일부를 에이전트의 “하네스” — 즉 언어 모델을 둘러싼 도구, 지시문, 실행 제한, 제어 로직 — 에서 비롯된 것으로 봤다. 보고에 따르면 같은 기반 모델은 Claude Code에서 Codex보다 평균 2.5배 더 많은 단계를 거쳤다. 이는 실행 시간이 단순히 모델의 속성이 아니라, 이를 배포하는 제품 아키텍처에 의해서도 형성된다는 점을 시사한다.
테스트는 시간 추정 외에도 문제를 발견했다. The Decoder에 따르면 모델들은 자신의 작업 품질을 평균 약 20퍼센트포인트 과대평가했다. 때로는 과제가 크게 실패했는데도 높은 점수를 스스로 부여했다.
한 사례에서 두 시스템은 자신의 작업을 약 70% 성공으로 평가했지만, 측정 결과는 7%와 14.5%였다. 출처는 관련 모델을 Opus 4.8과 GPT-5.5로 설명한다. 여기서 이용 가능한 증거는 연구 원문이나 원시 데이터가 아니라 연구에 대한 보도이므로, 이러한 모델 식별자와 정확한 평가 조건은 독립적으로 검증된 사실이 아니라 보도된 결과로 취급해야 한다.
자기 평가는 자율 소프트웨어 작업의 핵심이다. 코딩 에이전트는 계속 반복할지, 작업 완료를 선언할지, 패치를 수정할지, 혹은 문제를 사람에게 에스컬레이션할지 결정해야 할 수 있다. 만약 그 확신이 테스트 결과와 동떨어져 있다면, 워크플로는 건강해 보이지만 불완전하거나 결함이 있는 코드를 만들어낼 수 있다.
개발자에게 핵심 교훈은 Claude Code와 Codex가 나쁜 예측을 한다는 것만이 아니다. 에이전트의 행동은 모델 주변의 통제 장치에 크게 의존한다는 점이다. AI 코딩 어시스턴트를 선택하는 제품 팀은 벤치마크 성능뿐 아니라, 시스템이 마감 시한, 재시도, 도구 실패, 테스트 피드백, 명시적 중단 조건을 어떻게 처리하는지도 평가해야 한다.
경과 시간 도구를 사용한 연구 결과는 비교적 단순한 엔지니어링 대응책을 제시한다. 에이전트가 대화 기록, 토큰 생성, 도구 호출 횟수만으로 시간을 추론할 것이라 기대해서는 안 된다. 실행 시간은 신뢰할 수 있는 외부 시계로 제공되고 오케스트레이션 계층이 이를 강제해야 한다.
하지만 그것만으로 모든 감독 문제를 해결할 수는 없다. 타이머는 에이전트에게 두 시간이 지났다고 알려줄 수 있지만, 결과 코드가 안전한지, 완성됐는지, 배포할 가치가 있는지는 판단할 수 없다. 팀은 여전히 독립 테스트, 변경 검토, 샌드박싱, 지출 한도, 에스컬레이션 규칙이 필요할 수 있다. 이러한 통제는 에이전트가 지속적인 감독 없이 일하도록 허용될 때 더욱 중요해진다.
이 발견은 또한 AI 코딩 제품 간 비교를 더 어렵게 만든다. Codex의 더 짧은 관측 실행 시간과 Claude Code의 더 긴 단계 수는 단순한 지능이나 생산성 차이라기보다 서로 다른 기본 설정을 반영할 수 있다. 제품을 비교하는 구매자는 에이전트가 무엇을 할 수 있는지, 얼마나 오래 실행될 수 있는지, 완료가 어떻게 검증되는지 질문해야 한다.
증거는 The Decoder의 보도에 따르면 MATS의 일환으로 수행된 두 명의 독립 연구자 연구에서 나온 것이다. 보고된 테스트 세트는 ProgramBench와 추가 18개 과제 벤치마크를 결합한 것이었다. 이 보도는 시간 추정, 실행 시간, 단계 수, 자기 평가에 대한 수치 결과를 제공하지만, 여기서 이용 가능한 자료에는 전체 방법론, 과제 정의, 통계 분석, 독립적 재현이 포함되어 있지 않다.
따라서 이 결과는 모든 AI 에이전트의 모든 버전을 보편적으로 측정한 것이 아니라 특정 평가 약점에 대한 증거로 읽어야 한다. 결과는 모델 업데이트, 시스템 프롬프트, 사용 가능한 도구, 컨텍스트 윈도, 과제 유형, 하네스 설계에 따라 달라질 수 있다. 경과 시간 도구 접근이 거의 보편적인 정확도를 만들었다는 주장은 엔지니어링 신호로서 특히 유용하지만, 여전히 보고된 연구에서 나온 것이므로 더 광범위한 테스트가 필요하다.
시간을 추정하는 것과 시간을 추적하는 것은 다르다는 점도 중요하다. 에이전트는 적절한 도구가 주어지면 시계를 읽을 수 있지만, 익숙하지 않은 작업이 얼마나 걸릴지 예측하는 데는 실패할 수 있다. 제품 팀은 이 두 능력을 별도로 테스트해야 한다.
연구자들은 에이전트가 특정 기간 동안 계속 작업하라는 지시를 따를 수 있는지 테스트할 계획이라고 전해진다. 이 실험은 외부 시간 정보가 사후 보고뿐 아니라 실시간 작업 제어도 개선하는지 보여줄 수 있다.
후속 평가는 더 새로운 모델 버전, 더 긴 소프트웨어 프로젝트, 장애 복구, 서로 다른 하네스도 테스트해야 한다. 유용한 벤치마크는 에이전트가 마감 시점에 멈추는지, 마감 전에 쓸 수 있는 결과를 내는지, 무엇이 아직 끝나지 않았는지를 정확히 보고하는지를 측정할 것이다.
기업 구매자에게 중요한 신호는 제품 설계에서 드러날 것이다. 지속적인 경과 시간 표시, 엄격한 실행 예산, 독립 검증, 명확한 인계 메커니즘이 그것이다. 이러한 통제에 대한 재현 가능한 데이터를 공개하는 벤더는 진정한 자율성과 숨겨진 한계에 도달할 때까지 계속 작동하는 에이전트를 구별하기 쉽게 만들 것이다.
이 연구는 언어 모델과 자율 소프트웨어의 경계에서의 제어 문제를 보여준다. 시간 인식은 제품이 어떻게든 흉내 내야 하는 추상적인 인간적 특성이 아니라, 오케스트레이션 계층이 제공하고 외부 이벤트와 대조할 수 있는 측정 가능한 시스템 능력이다.
AI 빌더에게 주는 교훈은 시간 추정과 자체 보고 성공을 신뢰할 수 없는 신호로 취급하는 것이다. 장시간 실행 에이전트에는 외부 시계, 명시적 예산, 독립 테스트, 에스컬레이션 경로가 있어야 한다. 이러한 메커니즘이 표준이 되기 전까지, “자율적” 코딩은 작업별로 검증해야 하는 워크플로 주장에 불과하다.