O Gemini 4 Argon, do Google, empata com o GPT-6 Astra, da OpenAI, em um índice, fica atrás dos principais modelos da Anthropic e é lançado primeiro para testadores selecionados.

O Google apresentou o Gemini 4 Argon, um novo modelo principal que recoloca a empresa na concorrência direta com OpenAI e Anthropic após mais de sete meses sem um novo lançamento de fronteira. Os primeiros testes sugerem que o Argon é substancialmente mais forte que o modelo anterior do Google e competitivo com o GPT-6 Astra, da OpenAI, mas os sistemas líderes da Anthropic ainda parecem manter a vantagem geral.
O lançamento é mais notável pelos compromissos que expõe do que por uma vitória isolada em benchmark. O Argon oferece um limite de saída de um milhão de tokens e preços iniciais excepcionalmente baixos, enquanto testes independentes indicam que ele consome muito mais tokens que alguns rivais para concluir as mesmas tarefas. O Google também está limitando o acesso enquanto coleta feedback de segurança, portanto os desenvolvedores ainda não podem avaliar o modelo por meio de uma API amplamente disponível.
Segundo o The Decoder, o Google está fornecendo o Argon primeiro a “defensores cibernéticos confiáveis” selecionados por meio do programa Fairwind, além de equipes internas. A versão inicial aparentemente opera sem barreiras de segurança cibernética nesse ambiente de testes. O Google também participa de um programa voluntário do governo dos EUA que oferece às agências acesso antecipado a novos modelos.
A empresa pretende usar o feedback dos testadores para aperfeiçoar os mecanismos de segurança do Argon antes de ampliar o acesso a desenvolvedores, empresas e consumidores. Clientes pagos da API e assinantes do Google AI Ultra devem receber acesso em seguida, embora o Google não tenha informado uma data pública definitiva.
A principal capacidade do modelo é seu limite de saída de um milhão de tokens, acima dos 64 mil da geração anterior. O Argon mantém uma janela de contexto de um milhão de tokens e aceita texto, imagens, vídeo e áudio, mas produz apenas texto. O Google está adicionando à Gemini API um recurso chamado Long Decode Continuation, que pode pausar uma resposta longa e retomá-la por meio de solicitações posteriores, em vez de deixar um processo prolongado de raciocínio expirar.
Esse design é voltado a fluxos complexos de pesquisa, programação e agentes, nos quais um modelo pode precisar sustentar uma longa cadeia de raciocínio. Ele também cria uma questão prática para os compradores: um limite de saída maior produz resultados melhores a um custo aceitável, ou simplesmente gera mais texto?
As evidências de desempenho mais fortes disponíveis vêm da Artificial Analysis, conforme relatado pelo The Decoder. Na configuração de raciocínio mais alta divulgada, o Argon marcou 53 no Artificial Analysis Intelligence Index. Empatou com o GPT-6 Astra, da OpenAI, e o Claude Fable 5.1, da Anthropic, e ficou um ponto à frente do GPT-6.1 Sol. O Claude Opus 5.5, da Anthropic, marcou 58, enquanto o Claude Sonnet 5.5 marcou 56.
O resultado representa uma grande melhoria em relação ao Gemini 3.1 Pro Preview, do Google, que o Argon teria superado por 23 pontos. No entanto, empatar com um modelo da OpenAI não é o mesmo que assumir uma liderança clara em toda a fronteira. A avaliação do The Decoder coloca a Anthropic à frente no índice, enquanto os resultados variam significativamente conforme a tarefa.
O Argon teve desempenho especialmente bom em algumas avaliações de agentes. A Artificial Analysis registrou 77,5% no AutomationBench-AA, seis pontos acima do Claude Sonnet 5.5. No Terminal Bench 4, o Argon chegou a 57%, um ganho substancial sobre o Gemini 3.1 Pro Preview, mas abaixo do Claude Sonnet 5.5, com 64%, do Claude Opus 5.5, com 60%, e do GPT-6 Astra, com 59%.
O modelo também registrou uma taxa de alucinação menor que a dos sistemas comparados no AA-Omniscience: 15%, contra 51% do GPT-6 Astra e 54% do GPT-6.1 Sol. Sua precisão nesse teste, porém, foi de 50%, abaixo da do Gemini 3.1 Pro Preview e do GPT-6 Astra. Essa distinção importa para aplicações empresariais: recusar-se a adivinhar pode melhorar a confiabilidade, mas não significa automaticamente que o sistema saiba mais.
Os próprios resultados de benchmark do Google supostamente mostram o Argon liderando em várias categorias, enquanto a Vals AI o colocou em primeiro lugar com 68,9%. Essas afirmações estão vinculadas ao fornecedor ou baseiam-se em avaliações externas selecionadas e não devem ser tratadas como um ranking universal. O The Decoder também observou que os resultados da Vals colocaram o Sonnet 5.5, modelo intermediário da Anthropic, acima do seu carro-chefe Opus 5.5, motivo para interpretar a classificação com cautela.
O Google está lançando o Argon a US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Os preços regulares devem subir para US$ 4 e US$ 20, respectivamente. Entradas armazenadas em cache recebem desconto de 95%, o que colocaria a tarifa inicial em cerca de 10 centavos por milhão de tokens, com base nos números divulgados pelo The Decoder.
Essas tarifas parecem baixas para um modelo de fronteira, mas o preço por token não determina sozinho o custo da aplicação. A Artificial Analysis informou que o Argon usou, em média, 62 mil tokens de saída por tarefa do Intelligence Index, contra 27 mil do GPT-6 Astra. Como resultado, o custo estimado de uma tarefa do Argon foi de US$ 1,99 na tarifa promocional, contra US$ 3,26 do Astra. Quando o preço regular do Argon entrar em vigor, o mesmo cálculo subirá para cerca de US$ 3,98.
Para os desenvolvedores, a implicação é direta: o Argon pode ser econômico para cargas que se beneficiam de raciocínio longo e toleram uma saída adicional, mas menos quando latência, volume de tokens ou gastos previsíveis são importantes. As equipes precisarão medir o custo do fluxo completo, em vez de comparar os preços publicados por token.
O desempenho do modelo fora do raciocínio bruto também é irregular. A Arena.ai teria colocado o Gemini 4 Argon em primeiro lugar em sua Text Arena, que inclui programação, seguimento de instruções, prompts difíceis e escrita criativa. No teste WebDev da Code Arena, porém, ele ficou em oitavo. Essa diferença reforça a importância de avaliar um modelo dentro da pilha de software, das ferramentas, dos sistemas de recuperação e da interface de usuário onde ele realmente funcionará.
O sinal imediato será o lançamento da API pública do Google e se a empresa manterá o preço inicial por tempo suficiente para que os desenvolvedores testem cargas de produção. O acesso para clientes pagos da API e assinantes do Google AI Ultra está planejado, mas nenhuma data foi anunciada.
Compradores empresariais devem acompanhar medições independentes de latência, uso de tokens de saída, comportamento de recusa e confiabilidade no uso de ferramentas. O limite de saída de um milhão de tokens só será relevante se respostas longas melhorarem a conclusão das tarefas sem criar custos descontrolados ou comportamentos de agentes difíceis de auditar.
O sinal competitivo mais amplo virá da integração ao produto. O The Decoder informou que o aplicativo Gemini do Google ainda fica atrás de produtos como Claude Cowork e ChatGPT Work, apesar dos fortes resultados do Argon em benchmarks. Se o Google não conseguir combinar o modelo com interfaces de agentes, ferramentas e controles de fluxo melhores, os ganhos nos benchmarks poderão ter impacto limitado na adoção.
O Gemini 4 Argon parece um retorno confiável à fronteira, e não uma tomada decisiva da liderança. Seu progresso é significativo: segundo os relatos, ele fecha boa parte da distância para a OpenAI, melhora os resultados fracos do Google em vários testes de agentes e oferece um preço inicial atraente. Mas as pontuações mais altas da Anthropic no Intelligence Index e o consumo elevado de tokens do Argon complicam a análise de custo-benefício.
Para desenvolvedores de IA, o lançamento deve ser entendido como mais uma opção forte que exige testes específicos para cada carga de trabalho. Os vencedores desta rodada não serão definidos por um único ranking. Serão definidos pelo modelo que entregar resultados confiáveis, custos de inferência controláveis, execução útil de ferramentas e implantação segura quando usuários reais — não apenas testadores selecionados — puderem acessá-lo.