Argo-Bench informa que o principal agente de IA resolveu 34,8% de 210 tarefas
Um resultado divulgado do Argo-Bench mostra que o principal agente de IA resolveu 34,8% de 210 tarefas, destacando limites de confiabilidade ainda não resolvidos para sistemas autônomos.
