Google의 Gemini 4 Argon은 한 지수에서 OpenAI의 GPT-6 Astra와 동률을 기록하고 Anthropic의 최고 모델에는 뒤처지며, 먼저 일부 테스터에게 출시된다.

Google이 새로운 플래그십 모델 Gemini 4 Argon을 공개했다. 이로써 7개월 넘게 새로운 프런티어 모델을 내놓지 않았던 Google은 OpenAI 및 Anthropic과의 직접 경쟁에 복귀하게 됐다. 초기 테스트에 따르면 Argon은 Google의 이전 모델보다 상당히 강력하고 OpenAI의 GPT-6 Astra와 경쟁할 수 있지만, Anthropic의 선도 시스템이 전반적으로는 여전히 우위를 보이는 것으로 보인다.
이번 출시는 단일 벤치마크 승리보다 드러난 트레이드오프 때문에 주목할 만하다. Argon은 100만 토큰 출력 한도와 이례적으로 낮은 출시 가격을 제공하지만, 독립 테스트에 따르면 같은 작업을 완료하는 데 일부 경쟁 모델보다 훨씬 많은 토큰을 사용한다. Google은 안전성 피드백을 수집하는 동안 접근도 제한하고 있어, 개발자들은 아직 널리 제공되는 API를 통해 모델을 평가할 수 없다.
The Decoder에 따르면 Google은 Fairwind 프로그램을 통해 선정된 “신뢰할 수 있는 사이버 방어 담당자”와 내부 팀에 Argon을 먼저 제공하고 있다. 초기 버전은 해당 테스트 환경에서 사이버 가드레일 없이 작동하는 것으로 알려졌다. Google은 정부 기관에 새 모델 조기 접근을 제공하는 미국 정부의 자발적 프로그램에도 참여하고 있다.
Google은 개발자, 기업, 소비자로 접근을 확대하기 전에 테스터 피드백을 활용해 Argon의 안전 메커니즘을 개선할 계획이다. 유료 API 고객과 Google AI Ultra 가입자가 다음으로 접근할 것으로 예상되지만, Google은 확정된 공개 일정을 제시하지 않았다.
모델의 핵심 기능은 이전 세대의 6만4,000토큰에서 늘어난 100만 토큰 출력 한도다. Argon은 100만 토큰 컨텍스트 창을 유지하며 텍스트, 이미지, 동영상, 오디오를 입력으로 받지만 출력은 텍스트만 생성한다. Google은 Gemini API에 Long Decode Continuation이라는 기능을 추가한다. 이 기능은 긴 응답을 일시 중지한 뒤, 긴 추론 과정이 시간 초과되는 대신 후속 요청을 통해 재개할 수 있게 한다.
이 설계는 모델이 긴 추론 과정을 유지해야 하는 복잡한 연구, 코딩, 에이전트형 워크플로를 겨냥한다. 동시에 구매자에게는 실질적인 질문을 던진다. 더 높은 출력 한도가 허용 가능한 비용으로 더 나은 결과를 내는가, 아니면 단순히 더 많은 텍스트를 생성하는가?
현재 이용 가능한 가장 강력한 성능 근거는 The Decoder가 보도한 Artificial Analysis의 결과다. 가장 높은 추론 설정에서 Argon은 Artificial Analysis Intelligence Index에서 53점을 받았다. OpenAI의 GPT-6 Astra 및 Anthropic의 Claude Fable 5.1과 동률이었고, GPT-6.1 Sol보다 1점 높았다. Anthropic의 Claude Opus 5.5는 58점, Claude Sonnet 5.5는 56점을 기록했다.
이는 Argon이 Google의 Gemini 3.1 Pro Preview보다 23점 앞선 것으로 알려진 점을 감안하면 큰 개선이다. 그러나 OpenAI 모델 하나와 동률을 이룬 것이 프런티어 전체에서 명확한 선두에 올랐다는 뜻은 아니다. The Decoder의 평가는 해당 지수에서 Anthropic을 앞선 것으로 보며, 벤치마크 결과는 작업에 따라 크게 달라진다.
Argon은 일부 에이전트형 평가에서 특히 좋은 성적을 냈다. Artificial Analysis에 따르면 AutomationBench-AA에서 77.5%를 기록해 Claude Sonnet 5.5보다 6포인트 높았다. Terminal Bench 4에서는 57%로 Gemini 3.1 Pro Preview보다 크게 개선됐지만, Claude Sonnet 5.5의 64%, Claude Opus 5.5의 60%, GPT-6 Astra의 59%에는 못 미쳤다.
AA-Omniscience에서는 비교 시스템보다 낮은 15%의 환각률도 기록했다. GPT-6 Astra는 51%, GPT-6.1 Sol은 54%였다. 그러나 해당 테스트의 정확도는 50%로 Gemini 3.1 Pro Preview와 GPT-6 Astra보다 낮았다. 이 차이는 기업용 애플리케이션에서 중요하다. 추측을 거부하면 신뢰성이 높아질 수 있지만, 시스템이 더 많이 알고 있다는 뜻은 자동으로 아니다.
Google 자체 벤치마크 결과에서는 Argon이 여러 부문에서 선두를 차지한 것으로 알려졌고, Vals AI도 68.9%의 점수로 Argon을 1위에 올렸다. 이러한 주장은 특정 공급업체와 연관돼 있거나 선별된 외부 평가에 기반하므로 보편적인 순위로 받아들여서는 안 된다. The Decoder는 Vals 결과에서 Anthropic의 중간급 모델 Sonnet 5.5가 플래그십 Opus 5.5보다 높게 평가됐다고도 지적했으며, 이는 순위를 신중하게 해석해야 할 이유다.
Google은 Argon을 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러에 출시한다. 정규 가격은 각각 4달러와 20달러로 오를 예정이다. 캐시된 입력에는 95% 할인이 적용되며, The Decoder가 보도한 수치에 따르면 출시 가격은 캐시 입력 100만 토큰당 약 10센트가 된다.
이 요금은 프런티어 모델치고 낮아 보이지만, 토큰 가격만으로 애플리케이션 비용이 결정되지는 않는다. Artificial Analysis에 따르면 Argon은 Intelligence Index 작업 하나당 평균 6만2,000개의 출력 토큰을 사용한 반면 GPT-6 Astra는 2만7,000개를 사용했다. 그 결과 프로모션 가격 기준 Argon 작업의 추정 비용은 1.99달러, Astra는 3.26달러였다. Argon의 정규 가격이 적용되면 같은 계산은 약 3.98달러로 오른다.
개발자에게 시사하는 바는 분명하다. Argon은 긴 추론의 이점을 얻고 추가 출력을 감당할 수 있는 워크로드에는 경제적일 수 있지만, 지연 시간, 토큰량 또는 예측 가능한 지출이 중요할 때는 그렇지 않을 수 있다. 팀은 공개된 토큰 단가가 아니라 전체 워크플로 비용을 측정해야 한다.
순수한 추론 능력 외의 성능도 고르지 않다. Arena.ai는 코딩, 지시 따르기, 어려운 프롬프트, 창작 글쓰기를 포함하는 Text Arena에서 Gemini 4 Argon을 1위에 올린 것으로 알려졌다. 그러나 Code Arena의 WebDev 테스트에서는 8위였다. 이 격차는 실제로 모델이 작동할 소프트웨어 스택, 도구, 검색 시스템, 사용자 인터페이스 안에서 평가하는 것이 중요함을 보여준다.
즉각적인 신호는 Google의 공개 API 출시와, 개발자가 실제 운영 워크로드를 테스트할 수 있을 만큼 회사가 출시 가격을 유지하는지 여부가 될 것이다. 유료 API 고객과 Google AI Ultra 가입자에 대한 접근은 예정돼 있지만 날짜는 발표되지 않았다.
기업 구매자는 지연 시간, 출력 토큰 사용량, 거부 행동, 도구 사용 신뢰성에 대한 독립적인 측정을 지켜봐야 한다. 100만 토큰 출력 한도는 긴 응답이 작업 완료를 개선하면서도 비용 폭증이나 감사하기 어려운 에이전트 행동을 만들지 않을 때에만 중요하다.
더 큰 경쟁 신호는 제품 통합에서 나올 것이다. The Decoder는 Argon의 강력한 벤치마크 결과에도 불구하고 Google의 Gemini 앱이 여전히 Claude Cowork와 ChatGPT Work 같은 제품에 뒤처진다고 보도했다. Google이 더 나은 에이전트 인터페이스, 도구, 워크플로 제어와 모델을 결합하지 못한다면 벤치마크의 개선은 도입에 제한적인 영향을 미칠 수 있다.
Gemini 4 Argon은 결정적인 장악이라기보다 프런티어로의 신뢰할 만한 복귀로 보인다. 발전은 의미 있다. 보도에 따르면 OpenAI와의 격차 상당 부분을 좁혔고, 여러 에이전트형 테스트에서 Google의 약한 결과를 개선했으며, 매력적인 출시 가격도 제공한다. 그러나 Anthropic의 더 높은 Intelligence Index 점수와 Argon의 높은 토큰 소비는 비용 대비 성능에 대한 평가를 복잡하게 만든다.
AI 개발자에게 이번 출시는 워크로드별 테스트가 필요한 또 하나의 강력한 선택지로 이해하는 것이 가장 적절하다. 이번 경쟁의 승자는 단일 순위표로 결정되지 않는다. 선정된 테스터가 아니라 실제 사용자가 접근할 수 있게 된 뒤, 신뢰할 수 있는 결과와 관리 가능한 추론 비용, 유용한 도구 실행, 안전한 배포를 제공하는 모델이 승자가 될 것이다.