Testes com Claude Code e Codex encontraram grandes erros em estimativas de tempo e autoavaliação, levantando preocupações de supervisão para tarefas de codificação de IA de longa duração.

O Claude Code da Anthropic e o Codex da OpenAI podem concluir tarefas de software, mas um novo estudo sugere que eles têm uma compreensão fraca de quanto tempo essas tarefas levam — e uma capacidade ainda mais fraca de julgar seu próprio desempenho. O achado é relevante à medida que agentes de codificação com IA deixam de lado prompts interativos curtos e passam a assumir trabalhos que rodam autonomamente por dezenas de minutos ou horas.
Dois pesquisadores independentes que atuavam no programa de pesquisa MATS testaram os assistentes em 200 tarefas do ProgramBench e em 18 benchmarks adicionais, segundo o relato do The Decoder sobre o estudo. Os agentes foram solicitados a estimar a duração necessária antes de começar e, depois de concluir o trabalho, informar quanto tempo havia passado. Ambos os sistemas superestimaram rotineiramente a duração das tarefas e também atribuíram notas muito mais altas a trabalhos malsucedidos do que os resultados do teste justificavam.
O estudo não mostra que os modelos literalmente não tenham acesso ao tempo em todos os ambientes de software. Em vez disso, destaca uma fraqueza prática na forma como os atuais agentes de IA percebem o tempo decorrido e usam essa informação para gerenciar o trabalho. Quando os pesquisadores forneceram uma ferramenta que informava o tempo decorrido, os agentes aparentemente ficaram precisos quase sempre.
No ProgramBench, ambos os agentes geralmente previram que as tarefas levariam cerca de 90 minutos, independentemente da dificuldade, relatou o The Decoder. Em um segundo conjunto de testes, as estimativas do Claude Code ficaram erradas em cerca de três vezes, em média, enquanto as do Codex variaram de seis a dez vezes.
Os maiores erros apareceram em tarefas curtas. As previsões só ficaram mais próximas da realidade quando o trabalho se estendia para a faixa de várias horas, segundo o relatório. Esse padrão é operacionalmente importante: um agente que prevê 90 minutos para uma tarefa que pode terminar em poucos minutos pode tomar decisões ruins sobre quando parar, pedir ajuda ou iniciar outra ação.
Os resultados também variaram bastante com o ambiente de software ao redor de cada modelo. O Claude Code continuou trabalhando até julgar que a atribuição estava concluída, com um tempo de execução mediano reportado de cerca de 90 minutos. O Codex parou depois de aproximadamente meia hora em muitos casos, mesmo quando a dificuldade da tarefa mudava.
Os pesquisadores atribuíram parte da diferença ao “harness” do agente — as ferramentas, instruções, limites de execução e lógica de controle que cercam o modelo de linguagem. O mesmo modelo subjacente teria feito, em média, 2,5 vezes mais etapas no Claude Code do que no Codex. Isso sugere que o tempo de execução não é apenas uma propriedade do modelo; ele também é moldado pela arquitetura do produto que o implanta.
Os testes encontraram problemas além das estimativas de duração. De acordo com o The Decoder, os modelos superestimaram a qualidade do próprio trabalho em cerca de 20 pontos percentuais, em média. Às vezes, eles se deram notas altas mesmo quando a tarefa havia falhado em grande parte.
Em um exemplo, ambos os sistemas teriam avaliado seu trabalho em cerca de 70% de sucesso, enquanto os resultados medidos foram 7% e 14,5%. A fonte descreve os modelos envolvidos como Opus 4.8 e GPT-5.5. Como as evidências disponíveis aqui são um relato sobre o estudo, e não o artigo completo nem os dados brutos, esses identificadores de modelo e as condições exatas de avaliação devem ser tratados como achados reportados, e não como fatos verificados de forma independente.
A autoavaliação é central para o trabalho autônomo em software. Um agente de codificação pode precisar decidir se continua iterando, declara uma tarefa concluída, revisa um patch ou encaminha um problema a um humano. Se sua confiança estiver desconectada dos resultados dos testes, um fluxo de trabalho pode parecer saudável enquanto produz código incompleto ou defeituoso.
Para os desenvolvedores, a principal lição não é apenas que Claude Code e Codex fazem previsões ruins. É que o comportamento do agente depende fortemente dos controles ao redor do modelo. Uma equipe de produto que escolher um assistente de codificação com IA deve avaliar não apenas o desempenho em benchmarks, mas também como o sistema lida com prazos, tentativas repetidas, falhas de ferramentas, feedback de testes e condições explícitas de parada.
O resultado relatado do estudo com uma ferramenta de tempo decorrido oferece uma resposta de engenharia relativamente simples. Não se deve esperar que um agente infira o tempo a partir do histórico da conversa, da geração de tokens ou do número de chamadas de ferramenta. O tempo de execução deve ser fornecido por um relógio externo confiável e aplicado pela camada de orquestração.
Isso não resolve todos os problemas de supervisão. Um temporizador pode informar a um agente que duas horas se passaram, mas não pode determinar se o código resultante é seguro, completo ou digno de implantação. As equipes ainda podem precisar de testes independentes, revisões de mudanças, sandboxing, limites de gastos e regras de escalonamento. Esses controles se tornam mais importantes quando um agente pode trabalhar sem supervisão contínua.
O achado também complica as comparações entre produtos de codificação com IA. O menor tempo de execução observado do Codex e a sequência mais longa de etapas do Claude Code podem refletir padrões diferentes, e não uma simples diferença de inteligência ou produtividade. Compradores que comparam produtos devem perguntar o que o agente está autorizado a fazer, por quanto tempo pode executar e como a conclusão é verificada.
As evidências vêm de um estudo de dois pesquisadores independentes conduzido como parte do MATS, conforme relatado pelo The Decoder. O conjunto de testes reportado combinou o ProgramBench com uma suíte adicional de benchmark de 18 tarefas. O relato fornece resultados numéricos para estimativa de tempo, tempo de execução, contagem de etapas e autoavaliação, mas o material disponível aqui não inclui a metodologia completa, definições das tarefas, análise estatística ou replicação independente.
Assim, os achados devem ser lidos como evidência de uma fraqueza específica de avaliação, e não como uma medida universal de todas as versões de todos os agentes de IA. Os resultados podem mudar com atualizações do modelo, prompts do sistema, ferramentas disponíveis, janelas de contexto, tipos de tarefas e o design do harness. A alegação de que o acesso a uma ferramenta de tempo decorrido produziu precisão quase universal é especialmente útil como sinal de engenharia, mas ainda vem do estudo relatado e requer testes mais amplos.
Também há uma distinção importante entre estimar o tempo e acompanhar o tempo. Um agente pode ser capaz de ler um relógio quando recebe a ferramenta apropriada e ainda assim falhar em prever quanto tempo levará uma tarefa desconhecida. As equipes de produto devem testar essas duas capacidades separadamente.
Os pesquisadores aparentemente planejam testar se os agentes conseguem seguir instruções como trabalhar continuamente por uma duração específica. Esse experimento pode mostrar se informações externas sobre o tempo melhoram não apenas a comunicação retrospectiva, mas também o controle da tarefa em tempo real.
Avaliações de acompanhamento também devem testar versões mais novas de modelos, projetos de software mais longos, recuperação de falhas e harnesses diferentes. Um benchmark útil mediria se um agente para no prazo, produz um resultado utilizável antes do prazo e relata com precisão o que ficou inacabado.
Para compradores corporativos, os sinais práticos estarão visíveis no design do produto: exibição persistente do tempo decorrido, orçamentos rígidos de execução, verificação independente e mecanismos claros de transferência. Fornecedores que publicarem dados reproduzíveis sobre esses controles facilitarão distinguir autonomia genuína de agentes que simplesmente continuam operando até atingir um limite oculto.
O estudo aponta para um problema de controle na fronteira entre modelos de linguagem e software autônomo. A consciência do tempo não é uma característica humana abstrata que os produtos precisam imitar de alguma forma; é uma capacidade mensurável do sistema que pode ser fornecida pela camada de orquestração e verificada em relação a eventos externos.
Para os criadores de IA, a conclusão é tratar estimativas de duração e auto-relatos de sucesso como sinais não confiáveis. Agentes de longa duração devem ter um relógio externo, orçamentos explícitos, testes independentes e caminhos de escalonamento. Até que esses mecanismos sejam padrão, a codificação “autônoma” continua sendo uma alegação de fluxo de trabalho que precisa ser validada tarefa por tarefa.