AI News

NVIDIA dice que su sistema Agentic Variation Operators, o NVIDIA AVO, logró una puntuación perfecta en el conjunto público de ARC-AGI-3, completando los 183 niveles en 25 entornos interactivos. El resultado es significativo porque plantea el rendimiento de los agentes a largo plazo como un problema de sistemas y no como una simple medida del modelo de lenguaje subyacente.

La afirmación proviene de una publicación del NVIDIA Developer Blog que describe AVO como una arquitectura de propósito general para el trabajo autónomo sostenido. La compañía dice que el mismo sistema también optimizó kernels de GPU durante una ejecución de siete días, lo que sugiere que su diseño puede trasladarse entre flujos de trabajo de ingeniería de software y tareas de razonamiento interactivo desconocidas. Sin embargo, las cifras de rendimiento son reportadas por NVIDIA, y la evidencia disponible no incluye validación independiente ni una evaluación revisada por pares.

Un resultado perfecto en ARC-AGI-3 a partir de un sistema de agente más amplio

NVIDIA informa que AVO registró una puntuación RHAE de 100,00 en el conjunto público de ARC-AGI-3. Dice que el agente completó todos los niveles en los 25 entornos del benchmark y utilizó un 12 % menos de acciones de entorno que VISTA, un sistema de comparación mencionado en la publicación de la compañía.

ARC-AGI-3 está diseñado en torno a entornos interactivos desconocidos en los que los agentes deben inferir cómo funcionan las acciones y descubrir qué se espera que logren. A diferencia de una prueba convencional de preguntas y respuestas, el benchmark exige que un agente mantenga el progreso a lo largo de múltiples pasos mientras aprende de la retroalimentación.

El argumento central de NVIDIA es que este tipo de evaluación mide algo más que la inteligencia del modelo. El agente debe decidir qué observar, qué herramientas usar, cómo preservar el estado útil y cómo recuperarse cuando un enfoque falla. En la descripción de la compañía, el arnés circundante determina con qué eficacia las capacidades de un modelo se convierten en comportamiento autónomo sostenido.

La publicación también dice que un sistema construido alrededor de Claude Opus 5 elevó el rendimiento desde una línea base del modelo del 30 % hasta el resultado reportado del 100 % cuando se incorporó a la arquitectura completa de AVO. NVIDIA presenta esa comparación como evidencia de que el diseño del sistema puede cambiar materialmente los resultados del benchmark. No debe leerse como una clasificación independiente ni de Claude Opus 5 ni de AVO sin más detalles sobre la configuración de evaluación.

Cómo funciona Agentic Variation Operators

AVO se describe como un sistema de codificación y ejecución de tareas que puede inspeccionar y editar código, ejecutar comandos, consultar documentación y validar cambios mediante la ejecución. Su característica definitoria no es una sola herramienta, dice NVIDIA, sino la capacidad de seguir trabajando a lo largo de largas secuencias de experimentos.

Se destacan especialmente dos mecanismos: memoria persistente y supervisión. La memoria persistente almacena implementaciones anteriores, resultados de pruebas, salida de compiladores y analizadores de rendimiento, y el razonamiento acumulado. Esto permite que el agente reanude desde el estado actual en lugar de reconstruir su comprensión después de cada ventana de contexto.

Un componente de supervisión observa la trayectoria más amplia. Cuando el agente principal se atasca o repite ciclos improductivos, el supervisor puede redirigirlo hacia una estrategia diferente. El agente principal sigue siendo responsable de elegir qué inspeccionar, modificar, probar y confirmar, mientras que el supervisor supervisa el progreso a lo largo de la ejecución más larga.

Para ARC-AGI-3, NVIDIA dice que conectó el mismo agente subyacente a una interfaz diferente, cambiando las herramientas de entorno disponibles y el proceso de evaluación mientras mantenía la arquitectura central. Esa portabilidad es la afirmación más relevante para los creadores de IA: el sistema está pensado para adaptarse a nuevos bucles de retroalimentación sin rediseñar todo el agente desde cero.

Evidencia de la optimización de kernels de GPU y sus límites

NVIDIA describe primero AVO a través de un experimento de optimización de kernels de GPU. En ese trabajo, el sistema exploró de forma autónoma más de 500 direcciones de optimización durante siete días y confirmó 40 versiones de kernel, según la compañía.

En sistemas NVIDIA DGX B200, NVIDIA informa que los kernels resultantes de atención multihead rindieron hasta un 3,5 % mejor que cuDNN y hasta un 10,5 % mejor que FlashAttention-4 en las configuraciones evaluadas. La compañía también dice que AVO adaptó el kernel evolucionado a atención de consultas agrupadas en unos 30 minutos adicionales de trabajo autónomo.

Estas cifras ilustran el tipo de flujo de trabajo que AVO está diseñado para manejar: realizar un cambio, ejecutar una prueba fundamentada en hardware, interpretar el resultado y decidir qué probar después. No demuestran que el sistema ofrecerá las mismas mejoras en otros kernels, configuraciones de hardware o bases de código de producción. Las comparaciones reportadas son benchmarks del proveedor, y la publicación no proporciona suficientes detalles en la evidencia suministrada para evaluar de forma independiente la metodología completa de prueba.

El resultado de ARC-AGI-3 tiene una salvedad similar. Una puntuación perfecta en el conjunto público es una señal sólida dentro de ese benchmark, pero por sí sola no prueba fiabilidad de propósito general en entornos empresariales. Las implementaciones reales introducen costos, permisos, fallos de herramientas, datos sensibles, objetivos ambiguos y requisitos de auditabilidad que un benchmark público puede no capturar.

Qué significa el resultado para los creadores y las empresas

Para los equipos de producto, la lección inmediata es arquitectónica. Aumentar la capacidad de un modelo base puede mejorar respuestas individuales, pero los flujos de trabajo de larga duración también necesitan gestión de estado, acceso controlado a herramientas, retroalimentación de ejecución, puntos de control y lógica de recuperación.

Eso importa para asistentes de programación, sistemas de investigación, herramientas de análisis de datos y otros agentes de IA que no pueden tener éxito con una sola respuesta del modelo. Un agente que optimiza código necesita conservar el historial de pruebas y distinguir una mejora real de un resultado ruidoso. Un flujo de trabajo empresarial necesita controles similares para evitar acciones repetidas, contener fallos y explicar por qué un sistema siguió una ruta particular.

El diseño de AVO también pone de relieve una compensación de implementación. La experimentación persistente puede mejorar los resultados, pero consume cómputo y puede aumentar la latencia. Una ejecución autónoma de optimización de siete días es adecuada para algunas búsquedas de ingeniería, pero no para todas las tareas orientadas al cliente. Los creadores necesitarán políticas sobre cuándo un agente puede continuar de forma independiente, cuándo debe pedir aprobación y cuánto presupuesto puede consumir.

La arquitectura también podría agudizar la competencia entre proveedores de modelos y proveedores de infraestructura. Si el rendimiento de los agentes depende cada vez más del arnés que rodea a un modelo, los benchmarks de modelos por sí solos predicen menos el rendimiento del producto. Las empresas pueden competir tanto por sistemas de memoria, evaluadores, supervisores, orquestación de herramientas y entornos de ejecución como por el entrenamiento de modelos.

Qué observar a continuación

La primera señal a observar es la reproducción independiente del resultado de ARC-AGI-3, incluido el modelo exacto, los prompts, las herramientas, los presupuestos de acciones y la configuración de supervisión. Esos detalles determinarán cuánto de la mejora proviene de la arquitectura general de AVO y cuánto de la ingeniería específica de la tarea.

La segunda es evidencia fuera de las demostraciones controladas por NVIDIA. Datos de seguimiento útiles incluirían rendimiento en otros benchmarks interactivos, tasas de fallo en ejecuciones largas, cómputo consumido por tarea completada y comparaciones con otros arneses de agentes.

Para los compradores empresariales, la evidencia de despliegue importará más que una sola puntuación de benchmark. Busque información sobre controles de permisos, registros de auditoría, aislamiento en sandbox, recuperación ante errores de herramientas, aislamiento de datos y la frecuencia con la que se requiere intervención humana.

Por último, el trabajo de kernels de GPU ofrece una prueba práctica de si la optimización autónoma puede producir ganancias repetibles en distintas cargas de trabajo y hardware. Los resultados más allá de las configuraciones reportadas harían más sólida la afirmación de ingeniería.

Perspectiva de Creati.ai

El anuncio de NVIDIA se entiende mejor como un informe sobre arquitectura de agentes, no como prueba de que un modelo haya pasado de repente a ser universalmente capaz. La puntuación reportada de ARC-AGI-3 es notable porque AVO combina memoria, supervisión, herramientas y retroalimentación en un sistema diseñado para seguir funcionando después de que falle la primera respuesta.

Para los creadores de IA, la conclusión duradera es que la fiabilidad a largo plazo puede depender del bucle de control circundante tanto como del modelo. NVIDIA ha proporcionado un benchmark interesante del proveedor; la siguiente pregunta es si equipos independientes pueden reproducir el resultado de forma económica, segura y en tareas que importan fuera del benchmark.

Destacados

NVIDIA dice que el agente AVO alcanza una puntuación perfecta en ARC-AGI-3

NVIDIA afirma que su agente AVO logró una puntuación perfecta en ARC-AGI-3, destacando cómo la memoria, la supervisión y las herramientas pueden ampliar el rendimiento del modelo.