Argo-Bench: лучший ИИ-агент решил 34,8% из 210 задач
Согласно опубликованному результату Argo-Bench, ведущий ИИ-агент решил 34,8% из 210 задач, что подчёркивает нерешённые ограничения надёжности автономных систем.
Последние Новости и Анализ по Теме Производительность AI
Согласно опубликованному результату Argo-Bench, ведущий ИИ-агент решил 34,8% из 210 задач, что подчёркивает нерешённые ограничения надёжности автономных систем.
Anthropic выпустила Opus 5.5 с более низкими ценами на токены, более быстрым выводом и заявленными результатами уровня Fable, подняв планку для эффективного корпоративного ИИ.
NVIDIA заявляет, что Vera Rubin NVL72 может обеспечивать до 30 раз больший агентный inference throughput на мегаватт, чем GB300, в ожидании независимой проверки бенчмарка.
Muse Spark 1.3 от Meta улучшает показатели в агентных задачах и программировании, но низкая стоимость за задачу может оказаться важнее, чем его все еще незавершенный вызов на переднем крае.
NVIDIA говорит, что Vera Rubin NVL72 может обеспечить до 30 раз больший агентный AI throughput на мегаватт, чем GB300, нацеливаясь на стоимость инференса с длинным контекстом.
Meta запустила Muse Spark 1.3, заявляя о лучшей производительности в кодинге и агентных задачах в конкуренции с OpenAI и Anthropic.
NVIDIA говорит, что Vera Rubin NVL72 может обеспечить до 30 раз больший агентный ИИ-пропускной способности на мегаватт, чем GB300, меняя экономику инференса.
OpenAI утверждает, что чип Jalapeño повышает скорость инференса ИИ и энергоэффективность across models, но результаты пока исходят от самого вендора и предшествуют внедрению.
OpenAI представила бенчмарки инференса Jalapeño, которые обгоняют системы Nvidia по скорости и эффективности, но ограниченное развёртывание и данные, предоставленные поставщиком, смягчают это утверждение.
NVIDIA утверждает, что Vera Rubin NVL72 обеспечивает до 30 раз больший агентный throughput на мегаватт, чем GB300, меняя экономику инференса для создателей ИИ.
Исследование Princeton и UC San Diego показывает, что skills у AI agents сильнее улучшают выполнение задач, чем знания, но поиск резко ухудшается по мере роста библиотек.
NVIDIA заявляет, что её агент AVO получил идеальный результат в ARC-AGI-3, подчёркивая, как память, надзор и инструменты могут расширять возможности модели.
NVIDIA выпустила SkillEvaluator — open-source фреймворк, который проверяет, улучшают ли навыки агентов результаты задач, безопасность и эффективность в реальных запусках.
OpenAI предварительно показывает Ultrafast — API-уровень, который запускает GPT-5.6 Sol до 14 раз быстрее, ориентируясь на корпоративные рабочие процессы в реальном времени вместе с Cerebras.
Nemotron 3.5 Lightning от Nvidia использует разреженную активацию и квантизацию, чтобы обеспечить быструю open-weight-инференцию, ориентируясь на массовых ИИ-агентов, а не на максимальные оценки.
Оксфорд опубликовал живой бенчмарк риска информационных операций в ИИ, предоставив разработчикам и покупателям моделей новый сигнал безопасности, который можно отслеживать со временем.
OpenAI утверждает, что две настройки API утроили показатели GPT-5.6 на ARC-AGI-3, подчеркивая, как конфигурация инференса может перестраивать производительность модели.
Claude Opus 5 от Anthropic установил новый максимум ARC-AGI-3, вновь подняв вопросы о реальном росте способности к рассуждению versus оптимизация под бенчмарк.
Открытая модель Soofi S из Германии заявляет о лидерстве среди полностью открытых англоязычных и немецкоязычных бенчмарков, а её создатели также раскрыли и исправили утечку тестовых данных.
NVIDIA заявляет, что настроенный LangChain Nemotron 3 Ultra показал лучшие результаты в бенчмарке агентов среди открытых моделей, подчеркивая более дешевые корпоративные ИИ-стэки.