Google DeepMind가 낮은 API 가격의 Gemini 3.8 Live 오디오 모델을 출시하며, 비용·품질·개발자 채택 측면에서 OpenAI의 GPT-Live-1에 도전한다.

Google DeepMind가 대화형 음성 애플리케이션을 만드는 개발자를 위해 설계된 두 개의 오디오 모델, Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 공개했다. Gemini API와 Google AI Studio를 통해 제공되는 이 모델들은 Google이 OpenAI의 GPT-Live-1과 경쟁에 새로 진입하는 동시에, 음성 대화에 대해 상당히 낮은 공개 가격을 제시한다.
이번 출시는 실시간 음성 시스템이 전사와 기본 채팅을 넘어 발전하고 있기 때문에 중요하다. The Decoder에 따르면 Gemini 3.8 Live는 백그라운드에서 API 호출을 수행하고, 시각 입력을 처리하며, 그 작업 중에도 계속 말하는 음성 에이전트를 지원할 수 있다. Google은 또한 이 모델들이 97개 이상의 언어를 지원한다고 밝혔지만, 출처에는 언어별 성능이나 제공 여부에 대한 추가 세부사항은 없다.
Gemini 3.8 Live는 표준 실시간 오디오 모델로, Gemini 3.8 Live Extended Thinking은 추론 지향 변형을 추가한 버전으로 포지셔닝된다. 둘 다 소비자용 기능이 아니라 개발자를 위한 모델이다. The Decoder에 따르면 이번 출시에는 GitHub의 샘플 애플리케이션도 포함되어 있어, 제품 팀이 음성 워크플로를 시험해 볼 출발점을 제공한다.
이 기능 세트는 음성과 도구 사용, 멀티모달 컨텍스트를 결합하는 애플리케이션을 가리킨다. 예를 들어 음성 에이전트는 외부 API 요청을 처리하면서 시각 입력을 해석하고, 음성 상호작용을 계속 유지할 수 있다. 출처는 Gemini API와 Google AI Studio를 통한 접근 외에, 특정 기업 통합, 실제 고객, 일반 제공 조건을 밝히지 않는다.
이 차이는 빌더에게 중요하다. 자연스럽게 말할 수 있는 모델은 음성 제품의 한 부분일 뿐이다. 개발자는 신뢰할 수 있는 도구 실행, 중단 처리, 지연 시간 제어, 로깅, 음성 요청에서 촉발된 작업에 대한 안전장치도 필요하다. Google이 설명한 기능은 그 아키텍처의 일부를 다루지만, 이용 가능한 증거만으로는 모델이 실제 운영 환경에서 얼마나 일관되게 동작하는지 알 수 없다.
가장 분명한 경쟁 차이는 비용이다. The Decoder는 Google이 오디오 입력에 분당 0.005달러, 오디오 출력에 분당 0.018달러를 청구한다고 보도했다. 해당 매체의 계산에 따르면 Google의 가격 가정 하에서 1시간의 음성 대화는 약 1.38달러다.
같은 보도는 OpenAI의 GPT-Live-1을 분당 0.05달러로 소개하며, 1시간 대화 비용을 대략 3달러 이상으로 만든다. 어떤 애플리케이션의 정확한 총액은 입력 대 출력 오디오 비율, 일시정지, 재시도, 도구 호출, 기타 과금 항목에 따라 달라지므로, 시간당 비교는 보편적 운영 비용이 아니라 설명용 추정치로 봐야 한다.
그럼에도 이 가격 차이는 팀이 음성 제품을 설계하는 방식에 영향을 줄 수 있다. 추론 비용이 낮으면 더 긴 대화를 시험하기 쉽고, 비즈니스 모델이 검증되기 전에도 더 많은 사용자에게 음성 기능을 제공하며, 실험을 진행하기 쉬워진다. 스타트업에게는 음성 워크플로가 아예 실현 가능한지 여부를 비용이 결정할 수 있다. 대기업에게는 음성을 주 인터페이스로 제공할지, 아니면 비싼 추가 기능으로 둘지에 영향을 준다.
하지만 가격만으로 결정되지는 않는다. The Decoder는 OpenAI의 모델이 더 자연스럽게 들릴 것이라고 말하는데, GPT-Live-1이 full duplex를 사용해 동시에 듣고 말할 수 있기 때문이다. 또한 이 매체는 OpenAI의 데모가 더 좋게 들렸다고 평가하며, Google의 눈에 띄는 장점을 명확히 더 나은 대화 품질이 아니라 가격 효율성이라고 설명했다.
이 보고서에서 가장 강한 성능 주장은 Artificial Analysis Speech-to-Speech Leaderboard에서 나온다. The Decoder는 Gemini 3.8 Live Extended Thinking이 82.6%를 기록해 OpenAI의 최신 GPT-Live-1 모델들보다 앞서 1위를 차지했다고 전했다.
이는 벤치마크 결과일 뿐, Google 모델이 모든 애플리케이션에서 최고의 경험을 제공한다는 증거는 아니다. 리더보드 점수는 테스트 설계, 프롬프트, 평가 기준, 모델 버전에 따라 달라질 수 있다. 출처는 리더보드의 방법론, 신뢰구간, 모델별 득점·실점 내역을 제공하지 않는다.
보고서의 대화 자연스러움 평가는 데모를 듣고 내린 판단이기도 하다. 이는 유용한 시장 맥락이지만, 지연 시간, 중단 복구, 사실 정확성, 도구 사용 신뢰성, 사용자 만족도를 통제한 평가가 아니다. 출처와 이용 가능한 증거 모두 Gemini 3.8 Live에 대한 독립적인 채택 수치, 고객 사례, 실운영 신뢰성 데이터를 제공하지 않는다.
이 출시를 평가하는 팀에게 실질적인 테스트는 단일 speech-to-speech 점수보다 작업 수준의 성능일 가능성이 높다. 빌더는 응답 지연, 턴테이킹, 중간 끼어들기(barge-in) 동작, 발음, 다국어 일관성, 다양한 말하기 패턴에서의 대화 비용을 비교해야 한다. 또한 모델이 시각적 맥락과 API 동작을 안전하거나 혼란스러운 중단 없이 올바르게 처리하는지도 테스트해야 한다.
Google의 전략은 분명하다. 실시간 음성 개발 비용을 낮추면서도 이미 AI 에이전트를 실험 중인 개발자를 끌어들일 만큼 충분한 멀티모달 및 도구 사용 기능을 제공하는 것이다. Gemini API와 Google AI Studio를 통한 접근은 프로토타이핑 장벽을 낮추고, GitHub 샘플은 팀이 데모에서 초기 애플리케이션으로 더 빨리 넘어가도록 도울 수 있다.
가장 큰 기회는 음성 상호작용이 잦지만, 가장 인간 같은 대화까지는 필요하지 않은 제품에 있다. 고객 지원 트리아지, 내부 어시스턴트, 음성 검색, 현장 서비스 도구, 핸즈프리 워크플로는 모두 낮은 오디오 비용의 혜택을 받을 수 있다. 그러나 영업, 의료, 금융 또는 기타 민감한 대화를 다루는 애플리케이션은 가격보다 자연스러운 턴테이킹, 예측 가능한 동작, 데이터 통제, 감사 가능성을 더 중시할 수 있다.
이번 출시는 또한 모델 제공업체를 선택하는 기업에게 배포상의 질문을 던진다. 분당 요금이 낮아도 모델이 더 많은 재시도를 필요로 하거나, 더 어색한 턴을 생성하거나, 경쟁사의 경험에 맞추기 위해 추가 오케스트레이션이 필요하다면 엔지니어링 작업으로 상쇄될 수 있다. 따라서 팀은 오디오 토큰이나 분당 가격만이 아니라, 완료된 작업당 총비용을 계산해야 한다.
첫 번째 신호는 지연 시간, 중단, 시각 추론, 다국어 음성, 도구 실행에 대한 Gemini 3.8 Live와 GPT-Live-1의 독립 테스트일 것이다. Artificial Analysis 순위는 초기 기준점을 제공하지만, 더 광범위한 평가는 해당 결과가 벤치마크 환경 밖에서도 유지되는지 보여줄 것이다.
개발자는 실제 운영 사용의 증거도 주시해야 한다. 명시된 고객, 공개 사례 연구, 사용 데이터, 더 명확한 서비스 제한이 그것이다. Google의 가격은 실험을 끌어들일 수 있지만, 지속적인 채택은 신뢰성, 가용성, 주변 API 도구의 품질에 달려 있다.
마지막으로 두 회사의 모델 업데이트는 비교를 빠르게 바꿀 수 있다. OpenAI는 더 낮은 가격이나 개선된 접근성으로 대응할 수 있고, Google은 더 자연스러운 턴테이킹을 우선시할 수 있다. 경쟁의 핵심은 단순히 오늘 어떤 모델이 더 싼가가 아니라, 어떤 제공업체가 규모 있게 수용 가능한 음성 품질과 신뢰할 수 있는 에이전트 동작을 제공할 수 있는가이다.
Gemini 3.8 Live는 개발자에게 음성 AI의 경제성을 다시 생각할 그럴듯한 이유를 제공한다. Google의 보고된 가격 우위는 특히 빈번하거나 긴 대화를 중심으로 한 애플리케이션에서 제품 실험을 바꿀 만큼 충분히 크다.
하지만 이번 출시는 비용과 상호작용 품질 사이의 핵심적인 trade-off를 없애지는 못한다. 가장 유용한 평가는 보고된 벤치마크를 실제 워크플로와 결합하는 것이며, 그 안에서는 지연 시간, 중단, 도구 호출, 안전성이 리더보드 점수만큼 중요하다. 지금까지 Google은 비용 측면의 논리를 제시했다. 개발자들은 여전히 이 경험이 사용자에게 충분히 강력한지 확인해야 한다.