Argo-Bench 보고서: 최고 AI 에이전트, 210개 작업 중 34.8%만 해결
보고된 Argo-Bench 결과에 따르면 선두 AI 에이전트가 210개 작업 중 34.8%를 해결했으며, 이는 자율 시스템의 해결되지 않은 신뢰성 한계를 보여준다.
AI 성능에 대한 최신 뉴스 및 분석
보고된 Argo-Bench 결과에 따르면 선두 AI 에이전트가 210개 작업 중 34.8%를 해결했으며, 이는 자율 시스템의 해결되지 않은 신뢰성 한계를 보여준다.
Anthropic은 더 낮은 토큰 가격, 더 빠른 출력, 그리고 Fable급 결과를 내세운 Opus 5.5를 출시하며 효율적인 엔터프라이즈 AI의 기준을 높였다.
NVIDIA는 Vera Rubin NVL72가 GB300보다 메가와트당 최대 30배 더 높은 에이전틱 추론 처리량을 제공할 수 있다고 밝히며, 이는 독립적인 벤치마크 검토를 기다리고 있다고 설명했습니다.
Meta의 Muse Spark 1.3은 에이전트형 작업과 코딩 점수를 개선했지만, 아직 완성되지 않은 최전선 과제보다 낮은 작업당 비용이 더 중요할 수 있다.
NVIDIA는 Vera Rubin NVL72가 GB300보다 메가와트당 최대 30배 더 높은 에이전틱 AI 처리량을 제공해 장문맥 추론 비용을 겨냥한다고 말한다.
메타가 OpenAI와 Anthropic과 경쟁하는 가운데 코딩 및 에이전트형 작업 성능 개선을 내세운 Muse Spark 1.3을 출시했다.
NVIDIA는 Vera Rubin NVL72가 GB300보다 메가와트당 최대 30배 더 높은 에이전틱 AI 처리량을 제공할 수 있어 추론 경제를 바꿀 수 있다고 말합니다.
OpenAI는 Jalapeño 칩이 여러 모델에서 AI 추론 속도와 전력 효율을 개선한다고 말하지만, 결과는 배포 전 공급업체 보고 수치에 머물러 있습니다.
OpenAI는 속도와 효율성에서 Nvidia 시스템을 앞선 Jalapeño 추론 벤치마크를 공개했지만, 제한적인 배포와 공급업체 제공 데이터가 이 주장을 다소 완화한다.
NVIDIA는 Vera Rubin NVL72가 GB300보다 메가와트당 최대 30배 더 높은 에이전틱 처리량을 제공해 AI 구축자들의 추론 경제성을 바꿀 것이라고 말한다.
프린스턴대와 UC 샌디에이고의 연구는 AI agents의 skills가 지식보다 실행을 더 개선하지만, 라이브러리가 커질수록 검색이 무너진다고 밝혔다.
NVIDIA는 자사의 AVO 에이전트가 ARC-AGI-3에서 만점을 받았다고 밝히며, 메모리·감독·도구가 모델 성능을 어떻게 확장할 수 있는지 강조했다.
NVIDIA는 실제 실행에서 에이전트 스킬이 작업 결과, 안전성, 효율성을 개선하는지 테스트하는 오픈소스 프레임워크 SkillEvaluator를 공개했다.
OpenAI는 GPT-5.6 Sol을 최대 14배 더 빠르게 실행하는 API 계층 Ultrafast를 미리 공개하며, Cerebras와 함께 실시간 기업 워크플로우를 겨냥하고 있다.
Nvidia의 Nemotron 3.5 Lightning은 희소 활성화와 양자화를 사용해 빠른 오픈웨이트 추론을 제공하며, 최고 점수보다 대량의 AI 에이전트를 목표로 한다.
옥스퍼드가 AI 정보작전 위험을 위한 라이브 벤치마크를 공개하면서, 모델 제작자와 구매자에게 시간이 지나도 추적할 수 있는 새로운 안전 신호를 제공했다.
OpenAI는 두 개의 API 설정으로 ARC-AGI-3에서 GPT-5.6 점수가 세 배가 됐다고 밝히며, 추론 구성이 모델 성능을 어떻게 바꿀 수 있는지 강조했다.
Anthropic의 Claude Opus 5가 ARC-AGI-3에서 새로운 최고 점수를 기록하며, 실제 추론 능력 향상인지 벤치마크 대응인지에 대한 질문이 다시 불거졌다.
독일의 오픈 모델 Soofi S는 완전 오픈 영어·독일어 벤치마크에서 최고 성과를 주장하는 한편, 개발자들은 테스트 데이터 유출을 공개하고 수정했다.
NVIDIA는 LangChain이 튜닝한 Nemotron 3 Ultra가 오픈 모델 에이전트 벤치마크에서 최고 수준의 결과를 달성해 더 낮은 비용의 기업 AI 스택을 부각했다고 말한다.