A Google DeepMind lança os modelos de áudio Gemini 3.8 Live com preços baixos de API, desafiando o GPT-Live-1 da OpenAI em custo, qualidade e adoção por desenvolvedores.

A Google DeepMind lançou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos de áudio projetados para desenvolvedores que constroem aplicações de voz conversacional. Disponíveis por meio da Gemini API e do Google AI Studio, os modelos dão à Google uma nova entrada na competição com o GPT-Live-1 da OpenAI, ao mesmo tempo em que definem um preço publicado substancialmente mais baixo para conversas por voz.
O lançamento importa porque os sistemas de voz em tempo real estão indo além da transcrição e do chat básico. Segundo o The Decoder, o Gemini 3.8 Live pode dar suporte a agentes de voz que fazem chamadas de API em segundo plano, processam entradas visuais e continuam falando durante essas operações. A Google também afirma que os modelos oferecem suporte a mais de 97 idiomas, embora a evidência da fonte não forneça detalhes adicionais sobre desempenho ou disponibilidade por idioma.
O Gemini 3.8 Live é posicionado como o modelo de áudio padrão em tempo real, enquanto o Gemini 3.8 Live Extended Thinking adiciona uma variante orientada ao raciocínio. Ambos estão disponíveis para desenvolvedores, e não apenas como recursos voltados ao consumidor. O lançamento inclui aplicações de exemplo no GitHub, segundo o The Decoder, oferecendo aos times de produto um ponto de partida para testar fluxos de trabalho de voz.
O conjunto de recursos aponta para aplicações que combinam fala com uso de ferramentas e contexto multimodal. Um agente de voz poderia, por exemplo, interpretar entradas visuais enquanto lida com uma solicitação externa de API e mantém uma interação falada. A fonte não identifica integrações empresariais específicas, clientes em produção ou condições de disponibilidade geral além do acesso por meio da Gemini API e do Google AI Studio.
Essa distinção é importante para builders. Um modelo capaz de falar naturalmente é apenas uma parte de um produto de voz. Os desenvolvedores também precisam de execução confiável de ferramentas, tratamento de interrupções, controles de latência, registros e salvaguardas em torno de ações disparadas por solicitações faladas. As capacidades descritas pela Google abordam parte dessa arquitetura, mas a evidência disponível não estabelece quão consistentemente os modelos funcionam em ambientes de produção.
A diferença competitiva mais clara é o custo. O The Decoder informa que a Google cobra US$ 0,005 por minuto para entrada de áudio e US$ 0,018 por minuto para saída de áudio. Com base no cálculo da publicação, uma hora de conversa por voz custa cerca de US$ 1,38 sob as premissas de preço da Google.
O mesmo relatório lista o GPT-Live-1 da OpenAI a US$ 0,05 por minuto, o que coloca uma hora de conversa em cerca de US$ 3 ou mais. O total exato para qualquer aplicação dependerá da proporção entre áudio de entrada e de saída, pausas, tentativas повторadas, chamadas de ferramentas e outras atividades cobradas, portanto a comparação por hora deve ser tratada como uma estimativa ilustrativa, e não como um custo operacional universal.
Mesmo com essa ressalva, a diferença de preço pode afetar como as equipes projetam produtos de voz. Custos de inferência mais baixos facilitam testar conversas mais longas, oferecer recursos de voz para mais usuários e executar experimentos antes que um modelo de negócios seja comprovado. Para startups, o custo pode determinar se um fluxo de trabalho de voz é viável ou não. Para empresas maiores, ele pode influenciar se a voz é oferecida como interface principal ou como um complemento caro.
O preço sozinho não decide. O The Decoder diz que o modelo da OpenAI deve soar mais natural porque o GPT-Live-1 usa full duplex, permitindo ouvir e falar ao mesmo tempo. A publicação também considerou que as demonstrações da OpenAI soavam melhor, enquanto caracterizou a aparente troca da Google como maior eficiência de preço, e não como qualidade conversacional claramente superior.
A alegação de desempenho mais forte do relatório vem do Artificial Analysis Speech-to-Speech Leaderboard. O The Decoder diz que o Gemini 3.8 Live Extended Thinking marcou 82,6% e ficou em primeiro lugar à frente dos modelos mais recentes GPT-Live-1 da OpenAI.
Isso é um resultado de benchmark, não uma prova de que o modelo da Google produzirá a melhor experiência em todas as aplicações. As pontuações do leaderboard podem depender do desenho do teste, dos prompts, dos critérios de avaliação e das versões do modelo. A evidência da fonte não fornece a metodologia do leaderboard, intervalos de confiança ou um detalhamento de onde os modelos ganharam ou perderam pontos.
A avaliação de naturalidade conversacional no relatório também se baseia em ouvir demonstrações. É um contexto de mercado útil, mas não é uma avaliação controlada de latência, recuperação de interrupções, precisão factual, confiabilidade no uso de ferramentas ou satisfação do usuário. Nem a fonte nem a evidência disponível fornecem números independentes de adoção, referências de clientes ou dados de confiabilidade em produção para o Gemini 3.8 Live.
Para equipes que avaliam o lançamento, o teste prático provavelmente será o desempenho em nível de tarefa, e não uma única pontuação speech-to-speech. Os builders devem comparar latência de resposta, alternância de turnos, comportamento de barging in, pronúncia, consistência multilíngue e o custo das conversas com diferentes padrões de fala. Eles também devem testar se o modelo trata corretamente o contexto visual e as ações de API sem criar interrupções inseguras ou confusas.
A estratégia da Google é simples: tornar o desenvolvimento de voz em tempo real mais barato, oferecendo capacidade multimodal e de uso de ferramentas suficiente para atrair desenvolvedores que já estão experimentando agentes de IA. O acesso por meio da Gemini API e do Google AI Studio reduz a barreira para prototipagem, e os exemplos no GitHub podem ajudar as equipes a passar mais rapidamente de uma demonstração para uma aplicação inicial.
A principal oportunidade está em produtos em que a interação por voz é frequente, mas não exige a conversa mais parecida possível com a humana. Triagem de atendimento ao cliente, assistentes internos, busca por voz, ferramentas de trabalho em campo e fluxos de trabalho sem uso das mãos podem se beneficiar de custos de áudio mais baixos. No entanto, aplicações envolvendo vendas, saúde, finanças ou outras conversas sensíveis podem dar mais peso à alternância natural de turnos, ao comportamento previsível, aos controles de dados e à auditabilidade do que ao preço.
O lançamento também levanta uma questão de implantação para empresas que escolhem entre provedores de modelos. Uma taxa por minuto mais baixa pode ser compensada por trabalho de engenharia se o modelo precisar de mais tentativas, produzir turnos mais desajeitados ou exigir orquestração adicional para igualar a experiência de um concorrente. Assim, as equipes devem calcular o custo total por tarefa concluída, e não apenas o preço por token de áudio ou por minuto.
O primeiro sinal será o teste independente do Gemini 3.8 Live contra o GPT-Live-1 em latência, interrupções, raciocínio visual, fala multilíngue e execução de ferramentas. O ranking da Artificial Analysis fornece um ponto de referência inicial, mas avaliações mais amplas mostrarão se o resultado se sustenta fora do ambiente de benchmark.
Os desenvolvedores também devem observar evidências de uso real em produção: clientes identificados, estudos de caso públicos, dados de uso e limites de serviço mais claros. O preço da Google pode atrair experimentação, mas a adoção sustentada dependerá de confiabilidade, disponibilidade e da qualidade das ferramentas de API ao redor.
Por fim, atualizações de modelo das duas empresas podem mudar rapidamente a comparação. A OpenAI pode responder com preços mais baixos ou melhor acesso, enquanto a Google pode priorizar uma alternância de turnos mais natural. A questão competitiva não é simplesmente qual modelo é mais barato hoje, mas qual provedor consegue entregar qualidade de voz aceitável e comportamento confiável de agentes em escala.
O Gemini 3.8 Live dá aos desenvolvedores um motivo crível para reconsiderar a economia da IA de voz. A vantagem de preço relatada pela Google é grande o suficiente para mudar experimentos de produto, especialmente para aplicações baseadas em conversas frequentes ou prolongadas.
Mas o lançamento não elimina a compensação central entre custo e qualidade da interação. A avaliação mais útil combinará o benchmark relatado com fluxos de trabalho reais, onde latência, interrupções, chamadas de ferramentas e segurança importam tanto quanto a pontuação de um leaderboard. Por enquanto, a Google apresentou o argumento de custo; os desenvolvedores ainda precisam verificar se a experiência é forte o suficiente para seus usuários.