Google DeepMind запускает аудиомодели Gemini 3.8 Live с низкими ценами API, бросая вызов GPT-Live-1 от OpenAI по стоимости, качеству и принятию разработчиками.

Google DeepMind выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — две аудиомодели, предназначенные для разработчиков, создающих разговорные голосовые приложения. Доступные через Gemini API и Google AI Studio, эти модели дают Google новый вход в конкуренцию с GPT-Live-1 от OpenAI, одновременно устанавливая существенно более низкую опубликованную цену для голосовых разговоров.
Запуск важен потому, что системы голосового взаимодействия в реальном времени выходят за рамки расшифровки и базового чата. По данным The Decoder, Gemini 3.8 Live может поддерживать голосовых агентов, которые выполняют вызовы API в фоновом режиме, обрабатывают визуальные данные и продолжают говорить во время этих операций. Google также заявляет, что модели поддерживают более 97 языков, хотя источники не приводят дополнительных подробностей о производительности или доступности по языкам.
Gemini 3.8 Live позиционируется как стандартная модель аудио в реальном времени, а Gemini 3.8 Live Extended Thinking добавляет вариант, ориентированный на рассуждение. Обе модели доступны разработчикам, а не представлены только как функции для конечных пользователей. По данным The Decoder, релиз включает примерные приложения на GitHub, давая продуктовым командам отправную точку для тестирования голосовых сценариев.
Набор функций указывает на приложения, сочетающие речь с использованием инструментов и мультимодальным контекстом. Например, голосовой агент может интерпретировать визуальные данные, обрабатывая внешний запрос к API и поддерживая голосовое взаимодействие. Источник не указывает конкретные корпоративные интеграции, клиентов в продакшене или условия общей доступности, кроме доступа через Gemini API и Google AI Studio.
Это различие важно для разработчиков. Модель, которая может естественно говорить, — лишь одна часть голосового продукта. Разработчикам также нужны надёжное выполнение инструментов, обработка прерываний, управление задержкой, логирование и защитные механизмы для действий, инициированных голосовыми запросами. Заявленные Google возможности закрывают часть этой архитектуры, но доступные данные не показывают, насколько стабильно модели работают в производственной среде.
Самое очевидное конкурентное отличие — стоимость. The Decoder сообщает, что Google берёт 0,005 доллара за минуту аудиовхода и 0,018 доллара за минуту аудиовыхода. Согласно расчёту издания, час голосового разговора при ценах Google стоит около 1,38 доллара.
В том же материале GPT-Live-1 от OpenAI указан по 0,05 доллара за минуту, что делает час разговора примерно 3 доллара и выше. Точная итоговая сумма для любого приложения будет зависеть от соотношения входного и выходного аудио, пауз, повторных попыток, вызовов инструментов и другой тарифицируемой активности, поэтому почасовое сравнение следует воспринимать как иллюстративную оценку, а не как универсальную операционную стоимость.
Даже с этим оговоркой ценовой разрыв может повлиять на то, как команды проектируют голосовые продукты. Более низкие затраты на инференс упрощают тестирование более длинных разговоров, предоставление голосовых функций большему числу пользователей и проведение экспериментов до подтверждения бизнес-модели. Для стартапов стоимость может решать, жизнеспособен ли вообще голосовой сценарий. Для крупных компаний она может влиять на то, будет ли речь основным интерфейсом или дорогим дополнением.
Однако одной цены недостаточно для выбора. The Decoder пишет, что модель OpenAI должна звучать естественнее, поскольку GPT-Live-1 использует full duplex, позволяя слушать и говорить одновременно. Издание также сочло демонстрации OpenAI более качественными на слух, характеризуя очевидный компромисс Google как более высокую ценовую эффективность, а не как явно превосходящее качество диалога.
Самое сильное заявление о производительности в отчёте связано с таблицей лидеров Artificial Analysis Speech-to-Speech Leaderboard. The Decoder сообщает, что Gemini 3.8 Live Extended Thinking набрал 82,6% и занял первое место, опередив последние модели GPT-Live-1 от OpenAI.
Это результат бенчмарка, а не доказательство того, что модель Google даст лучший опыт во всех приложениях. Баллы в рейтингах могут зависеть от дизайна теста, промптов, критериев оценки и версий модели. Источники не приводят методологию рейтинга, доверительные интервалы или разбивку, где модели набирали или теряли баллы.
Оценка естественности общения в отчёте также основана на прослушивании демонстраций. Это полезный рыночный контекст, но не контролируемая оценка задержки, восстановления после прерываний, фактической точности, надёжности использования инструментов или удовлетворённости пользователей. Ни источник, ни доступные данные не предоставляют независимых цифр по внедрению, клиентских ссылок или данных о надёжности в продакшене для Gemini 3.8 Live.
Для команд, оценивающих релиз, практическим тестом, вероятно, будет производительность на уровне задачи, а не один балл speech-to-speech. Разработчикам следует сравнить задержку ответа, очередность реплик, поведение при барж-ин, произношение, согласованность в многоязычном режиме и стоимость разговоров при разных моделях речи. Им также следует проверить, корректно ли модель обрабатывает визуальный контекст и действия API, не создавая небезопасных или запутывающих прерываний.
Стратегия Google проста: сделать разработку голосового ИИ в реальном времени дешевле, предлагая при этом достаточно мультимодальных возможностей и инструментов, чтобы привлечь разработчиков, уже экспериментирующих с ИИ-агентами. Доступ через Gemini API и Google AI Studio снижает барьер для прототипирования, а примеры на GitHub могут помочь командам быстрее перейти от демонстрации к первому приложению.
Главная возможность — в продуктах, где голосовое взаимодействие часто, но не требует максимально человекоподобного общения. Триаж поддержки клиентов, внутренние ассистенты, голосовой поиск, инструменты для выездных специалистов и hands-free рабочие сценарии могут выиграть от более низкой стоимости аудио. Однако приложения, связанные с продажами, здравоохранением, финансами или другими чувствительными разговорами, могут больше ценить естественную очередность реплик, предсказуемое поведение, контроль данных и возможность аудита, чем цену.
Запуск также поднимает вопрос развертывания для компаний, выбирающих между поставщиками моделей. Более низкая цена за минуту может быть нивелирована инженерными затратами, если модели требуется больше повторных попыток, если она создаёт более неловкие переходы между репликами или если нужна дополнительная оркестрация, чтобы соответствовать опыту конкурента. Поэтому командам следует рассчитывать общую стоимость за выполненную задачу, а не только цену за аудиотокен или минуту.
Первым сигналом станут независимые тесты Gemini 3.8 Live против GPT-Live-1 по задержке, прерываниям, визуальному рассуждению, многоязычной речи и выполнению инструментов. Рейтинг Artificial Analysis даёт первоначальную точку отсчёта, но более широкие оценки покажут, сохраняется ли результат вне бенчмарк-среды.
Разработчикам также следует следить за признаками реального продакшена: названными клиентами, публичными кейсами, данными об использовании и более чёткими ограничениями сервиса. Цена Google может стимулировать эксперименты, но устойчивое внедрение будет зависеть от надёжности, доступности и качества сопутствующих API-инструментов.
Наконец, обновления моделей обеих компаний могут быстро изменить сравнение. OpenAI может ответить более низкими ценами или лучшим доступом, а Google может сделать акцент на более естественной очередности реплик. Конкурентный вопрос заключается не просто в том, какая модель дешевле сегодня, а в том, какой поставщик сможет обеспечить приемлемое качество голоса и надёжное поведение агента в масштабе.
Gemini 3.8 Live даёт разработчикам вескую причину пересмотреть экономику голосового ИИ. Заявленное ценовое преимущество Google достаточно велико, чтобы изменить продуктовые эксперименты, особенно для приложений, построенных вокруг частых или длительных разговоров.
Но релиз не снимает ключевой компромисс между стоимостью и качеством взаимодействия. Наиболее полезная оценка должна сочетать заявленный бенчмарк с реальными рабочими сценариями, где задержка, прерывания, вызовы инструментов и безопасность важны не меньше, чем результат в рейтинге. Пока что Google представила аргумент в пользу низкой стоимости; разработчикам ещё предстоит определить, достаточно ли сильный опыт она даёт для их пользователей.