Тесты Claude Code и Codex выявили серьёзные ошибки в оценках времени и самооценке, что вызывает опасения по поводу контроля при длительных задачах программирования с ИИ.

Claude Code от Anthropic и Codex от OpenAI могут выполнять программные задачи, однако новое исследование показывает, что они слабо понимают, сколько времени эти задачи занимают, — и ещё слабее умеют оценивать собственную работу. Это важно, поскольку агенты ИИ для программирования переходят от коротких интерактивных запросов к задачам, которые автономно выполняются десятки минут или часы.
Два независимых исследователя, работавшие в рамках исследовательской программы MATS, протестировали помощников на 200 задачах из ProgramBench и 18 дополнительных бенчмарках, согласно пересказу исследования The Decoder. Агентов попросили сначала оценить необходимую длительность, а затем после завершения работы сообщить, сколько времени прошло. Обе системы регулярно завышали длительность задач, а также оценивали неудачную работу значительно выше, чем это оправдывали результаты тестов.
Исследование не показывает, что модели буквально не имеют доступа ко времени в любой программной среде. Вместо этого оно подчёркивает практическую слабость того, как современные агенты ИИ воспринимают прошедшее время и используют эту информацию для управления работой. Когда исследователи предоставили инструмент, сообщающий прошедшее время, агенты, как сообщается, почти всегда становились точными.
На ProgramBench обе системы в целом предсказывали, что задачи займут около 90 минут, независимо от сложности, сообщил The Decoder. Во второй серии тестов оценки Claude Code в среднем ошибались примерно в три раза, а у Codex — в шесть–десять раз.
Наибольшие ошибки наблюдались на коротких задачах. Согласно отчёту, прогнозы приближались к реальности только тогда, когда работа растягивалась на несколько часов. Это важно с точки зрения эксплуатации: агент, который прогнозирует 90 минут для задачи, которую может завершить за несколько минут, может принимать неверные решения о том, когда остановиться, попросить помощи или начать другое действие.
Результаты также существенно различались в зависимости от программной среды вокруг каждой модели. Claude Code продолжал работать, пока не считал задачу завершённой, при этом сообщаемое медианное время работы составляло около 90 минут. Codex во многих случаях останавливался примерно через полчаса, даже когда сложность задачи менялась.
Исследователи частично объяснили это различие «harness» агента — инструментами, инструкциями, ограничениями выполнения и логикой управления, окружающими языковую модель. По сообщениям, одна и та же базовая модель в Claude Code выполняла в среднем в 2,5 раза больше шагов, чем в Codex. Это говорит о том, что длительность работы — это не просто свойство модели; она также определяется архитектурой продукта, который её разворачивает.
Тесты выявили проблемы не только с оценкой длительности. По данным The Decoder, модели в среднем завышали качество собственной работы примерно на 20 процентных пунктов. Иногда они ставили себе высокие оценки даже тогда, когда задача в значительной степени проваливалась.
В одном примере обе системы, как сообщается, оценили свою работу примерно в 70% успеха, тогда как измеренные результаты составили 7% и 14,5%. Источник описывает задействованные модели как Opus 4.8 и GPT-5.5. Поскольку доступные здесь сведения представляют собой пересказ исследования, а не саму статью или исходные данные, эти идентификаторы моделей и точные условия оценки следует рассматривать как сообщённые выводы, а не как независимо подтверждённые факты.
Самооценка — ключевой элемент автономной работы с ПО. Агент программирования может должен решить, продолжать ли итерации, объявить задачу завершённой, пересмотреть патч или эскалировать проблему человеку. Если его уверенность не связана с результатами тестов, рабочий процесс может выглядеть здоровым, хотя на деле он производит неполный или дефектный код.
Для разработчиков главный урок состоит не просто в том, что Claude Code и Codex делают плохие прогнозы. Важно, что поведение агента сильно зависит от контролей вокруг модели. Команда продукта, выбирающая помощника по программированию на базе ИИ, должна оценивать не только результаты бенчмарков, но и то, как система обрабатывает дедлайны, повторные попытки, сбои инструментов, обратную связь от тестов и явные условия остановки.
Сообщённый результат исследования с инструментом для измерения прошедшего времени предлагает относительно простое инженерное решение. Не следует ожидать, что агент сможет выводить время из истории диалога, генерации токенов или количества вызовов инструментов. Время выполнения должно предоставляться надёжными внешними часами и обеспечиваться уровнем оркестрации.
Это не решает всех проблем контроля. Таймер может сообщить агенту, что прошло два часа, но не способен определить, безопасен ли полученный код, завершён ли он и стоит ли его развёртывать. Командам по-прежнему могут быть нужны независимые тесты, проверка изменений, изоляция, лимиты расходов и правила эскалации. Эти меры становятся ещё важнее, когда агенту разрешают работать без постоянного наблюдения.
Это открытие также усложняет сравнение продуктов для кодирования с ИИ. Более короткое наблюдаемое время работы Codex и более длинная последовательность шагов Claude Code могут отражать разные настройки по умолчанию, а не простую разницу в интеллекте или производительности. Покупателям, сравнивающим продукты, следует спрашивать, что агенту разрешено делать, как долго ему позволено работать и как проверяется завершение.
Доказательства основаны на исследовании двух независимых учёных, проведённом в рамках MATS, как сообщает The Decoder. Сообщённый набор тестов объединял ProgramBench с дополнительным набором из 18 заданий. В пересказе приводятся числовые результаты по оценке времени, длительности выполнения, числу шагов и самооценке, но доступные здесь материалы не включают полную методологию, определения задач, статистический анализ или независимую репликацию.
Следовательно, выводы следует читать как доказательство конкретной слабости оценки, а не как универсальное измерение всех версий всех агентов ИИ. Результаты могут меняться в зависимости от обновлений модели, системных промптов, доступных инструментов, контекстного окна, типов задач и конструкции harness. Утверждение о том, что доступ к инструменту для измерения прошедшего времени дал почти универсальную точность, особенно полезно как инженерный сигнал, но оно всё же основано на сообщённом исследовании и требует более широкого тестирования.
Есть также важное различие между оценкой времени и отслеживанием времени. Агент может уметь считывать часы, если ему предоставлен соответствующий инструмент, и при этом не уметь предсказывать, сколько займёт незнакомая задача. Продуктовым командам следует тестировать обе способности отдельно.
По сообщениям, исследователи планируют проверить, могут ли агенты следовать инструкциям вроде непрерывной работы в течение заданного времени. Этот эксперимент может показать, улучшает ли внешняя информация о времени не только ретроспективную отчётность, но и управление задачами в реальном времени.
Последующие оценки также должны тестировать более новые версии моделей, более длинные программные проекты, восстановление после сбоев и разные harness. Полезный бенчмарк измерял бы, останавливается ли агент к дедлайну, выдаёт ли полезный результат до дедлайна и точно ли сообщает, что осталось незавершённым.
Для корпоративных покупателей практические сигналы будут видны в дизайне продукта: постоянные индикаторы прошедшего времени, жёсткие лимиты выполнения, независимая проверка и чёткие механизмы передачи. Поставщики, публикующие воспроизводимые данные по этим мерам контроля, упростят различение настоящей автономности и агентов, которые просто продолжают работать, пока не достигнут скрытого лимита.
Исследование указывает на проблему контроля на границе между языковыми моделями и автономным ПО. Осведомлённость о времени — это не абстрактная человеческая черта, которую продукты должны как-то имитировать; это измеримая системная способность, которую можно обеспечить на уровне оркестрации и проверить по внешним событиям.
Для создателей ИИ вывод заключается в том, чтобы относиться к оценкам длительности и самоотчитанному успеху как к ненадёжным сигналам. У долго работающих агентов должны быть внешний часы, явные бюджеты, независимые тесты и пути эскалации. Пока такие механизмы не станут стандартом, «автономное» программирование остаётся утверждением о рабочем процессе, которое необходимо проверять для каждой задачи отдельно.