Gemini 4 Argon de Google reduce la brecha con la frontera, pero no lidera claramente

Gemini 4 Argon de Google iguala al GPT-6 Astra de OpenAI en un índice, queda por detrás de los modelos principales de Anthropic y se lanza primero para probadores seleccionados.

AI News

Google ha presentado Gemini 4 Argon, un nuevo modelo insignia que devuelve a la empresa a la competencia directa con OpenAI y Anthropic tras más de siete meses sin lanzar un nuevo modelo de frontera. Las primeras pruebas sugieren que Argon es considerablemente más potente que el modelo anterior de Google y competitivo frente al GPT-6 Astra de OpenAI, aunque los sistemas líderes de Anthropic todavía parecen tener ventaja general.

El lanzamiento destaca menos por una victoria concreta en un benchmark que por los compromisos que revela. Argon ofrece un límite de salida de un millón de tokens y precios iniciales inusualmente bajos, mientras las pruebas independientes indican que consume muchos más tokens que algunos rivales para completar las mismas tareas. Google también está limitando el acceso mientras recopila comentarios sobre seguridad, por lo que los desarrolladores aún no pueden evaluar el modelo mediante una API ampliamente disponible.

Un lanzamiento por etapas con salidas inusualmente largas

Según The Decoder, Google está proporcionando Argon primero a determinados «defensores cibernéticos de confianza» mediante su programa Fairwind, además de a equipos internos. Al parecer, la versión inicial funciona sin barreras de seguridad cibernética en ese entorno de pruebas. Google también participa en un programa voluntario del Gobierno de Estados Unidos que ofrece a las agencias acceso anticipado a nuevos modelos.

La empresa planea usar los comentarios de los probadores para perfeccionar los mecanismos de seguridad de Argon antes de ampliar el acceso a desarrolladores, empresas y consumidores. Se espera que los clientes de API de pago y los suscriptores de Google AI Ultra obtengan acceso después, aunque Google no ha dado una fecha pública firme.

La capacidad más destacada del modelo es su límite de salida de un millón de tokens, frente a los 64.000 de la generación anterior. Argon conserva una ventana de contexto de un millón de tokens y acepta texto, imágenes, vídeo y audio, pero solo produce texto. Google está incorporando a la API de Gemini una función llamada Long Decode Continuation, que puede pausar una respuesta larga y reanudarla mediante solicitudes posteriores, en vez de permitir que un proceso de razonamiento prolongado termine por agotarse el tiempo de espera.

Este diseño está dirigido a flujos de trabajo complejos de investigación, programación y agentes, en los que un modelo puede necesitar mantener una larga cadena de razonamiento. También plantea una pregunta práctica para los compradores: si un límite de salida mayor produce mejores resultados a un coste aceptable, en lugar de generar simplemente más texto.

Las pruebas independientes muestran avances, no dominio

La evidencia de rendimiento más sólida disponible procede de Artificial Analysis, según informó The Decoder. En su configuración de razonamiento más alta, Argon obtuvo 53 puntos en el Artificial Analysis Intelligence Index. Empató con el GPT-6 Astra de OpenAI y el Claude Fable 5.1 de Anthropic, y quedó un punto por delante de GPT-6.1 Sol. El Claude Opus 5.5 de Anthropic obtuvo 58 puntos, mientras Claude Sonnet 5.5 logró 56.

El resultado supone una gran mejora frente a Gemini 3.1 Pro Preview de Google, al que Argon habría superado por 23 puntos. Sin embargo, empatar con un modelo de OpenAI no equivale a liderar claramente toda la frontera. La evaluación de The Decoder sitúa a Anthropic por delante en el índice, mientras que los resultados de los benchmarks varían mucho según la tarea.

Argon rindió especialmente bien en algunas evaluaciones de agentes. Artificial Analysis registró un 77,5 % en AutomationBench-AA, seis puntos más que Claude Sonnet 5.5. En Terminal Bench 4, Argon alcanzó el 57 %, una mejora notable frente a Gemini 3.1 Pro Preview, pero por debajo de Claude Sonnet 5.5 con 64 %, Claude Opus 5.5 con 60 % y GPT-6 Astra con 59 %.

El modelo también registró una tasa de alucinación menor que los sistemas comparados en AA-Omniscience: un 15 %, frente al 51 % del GPT-6 Astra y el 54 % de GPT-6.1 Sol. Sin embargo, su precisión en esa prueba fue del 50 %, por debajo de Gemini 3.1 Pro Preview y GPT-6 Astra. La distinción importa para las aplicaciones empresariales: negarse a adivinar puede mejorar la fiabilidad, pero no significa automáticamente que el sistema sepa más.

Los propios resultados de Google en benchmarks muestran supuestamente a Argon por delante en muchas categorías, mientras Vals AI lo situó primero con una puntuación del 68,9 %. Esas afirmaciones están vinculadas al proveedor o se basan en evaluaciones externas seleccionadas, y no deben tratarse como una clasificación universal. The Decoder también señaló que los resultados de Vals colocaron al Sonnet 5.5 de gama media de Anthropic por encima de su modelo insignia Opus 5.5, un motivo para interpretar la clasificación con cautela.

Precios bajos por token frente a un consumo elevado

Google presenta Argon a 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida. Se espera que los precios habituales suban a 4 y 20 dólares, respectivamente. Las entradas almacenadas en caché reciben un descuento del 95 %, lo que situaría el precio inicial en unos 10 centavos por millón de tokens, según las cifras comunicadas por The Decoder.

Esas tarifas parecen bajas para un modelo de frontera, pero el precio por token no determina por sí solo el coste de una aplicación. Artificial Analysis informó de que Argon utilizó una media de 62.000 tokens de salida por tarea del Intelligence Index, frente a 27.000 del GPT-6 Astra. Como resultado, el coste estimado de una tarea con Argon fue de 1,99 dólares al precio promocional, frente a 3,26 dólares para Astra. Cuando entre en vigor el precio habitual de Argon, el mismo cálculo subirá a unos 3,98 dólares.

Para los desarrolladores, la implicación es directa: Argon puede ser económico para cargas de trabajo que se beneficien de un razonamiento largo y toleren una salida adicional, pero menos cuando importen la latencia, el volumen de tokens o un gasto predecible. Los equipos tendrán que medir el coste del flujo de trabajo completo, no comparar únicamente los precios publicados por token.

El rendimiento del modelo fuera del razonamiento puro también es irregular. Según los informes, Arena.ai situó a Gemini 4 Argon en primer lugar en su Text Arena, que incluye programación, seguimiento de instrucciones, prompts difíciles y escritura creativa. Sin embargo, en la prueba WebDev de Code Arena quedó octavo. Esa diferencia refuerza la importancia de evaluar un modelo dentro de la pila de software, las herramientas, los sistemas de recuperación y la interfaz de usuario donde realmente funcionará.

Qué observar a continuación

La señal inmediata será el lanzamiento de la API pública de Google y si la empresa mantiene el precio inicial el tiempo suficiente para que los desarrolladores prueben cargas de producción. Está previsto el acceso para clientes de API de pago y suscriptores de Google AI Ultra, pero no se ha anunciado ninguna fecha.

Los compradores empresariales deberían observar mediciones independientes de latencia, uso de tokens de salida, comportamiento de rechazo y fiabilidad en el uso de herramientas. El límite de salida de un millón de tokens solo será importante si las respuestas largas mejoran la finalización de tareas sin crear costes descontrolados ni comportamientos de agentes difíciles de auditar.

La señal competitiva más amplia procederá de la integración en productos. The Decoder informó de que la aplicación Gemini de Google todavía está por detrás de productos como Claude Cowork y ChatGPT Work, pese a los sólidos resultados de Argon en benchmarks. Si Google no logra combinar el modelo con mejores interfaces de agentes, herramientas y controles de flujo de trabajo, las mejoras en benchmarks podrían tener un impacto limitado en la adopción.

La perspectiva de Creati.ai

Gemini 4 Argon parece un regreso creíble a la frontera, no una toma de liderazgo decisiva. Su progreso es importante: supuestamente cierra buena parte de la brecha con OpenAI, mejora los resultados débiles de Google en varias pruebas de agentes y ofrece un precio inicial atractivo. Pero las puntuaciones superiores de Anthropic en el Intelligence Index y el elevado consumo de tokens de Argon complican la relación entre coste y rendimiento.

Para los desarrolladores de IA, el lanzamiento se entiende mejor como otra opción potente que exige pruebas específicas para cada carga de trabajo. Los ganadores de esta ronda no se decidirán por una única clasificación. Se decidirán por el modelo que ofrezca resultados fiables, costes de inferencia controlables, ejecución útil de herramientas y un despliegue seguro cuando puedan acceder a él usuarios reales, no solo probadores seleccionados.

Anuncios