Google DeepMind lanza los modelos de audio Gemini 3.8 Live con precios bajos de API, desafiando a GPT-Live-1 de OpenAI en costo, calidad y adopción por desarrolladores.

Google DeepMind ha lanzado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de audio diseñados para desarrolladores que crean aplicaciones de voz conversacional. Disponibles a través de la Gemini API y Google AI Studio, los modelos brindan a Google una nueva entrada en la competencia con GPT-Live-1 de OpenAI, al tiempo que fijan un precio publicado sustancialmente más bajo para las conversaciones por voz.
El lanzamiento importa porque los sistemas de voz en tiempo real están yendo más allá de la transcripción y el chat básico. Según The Decoder, Gemini 3.8 Live puede respaldar agentes de voz que realizan llamadas a API en segundo plano, procesan entradas visuales y siguen hablando durante esas operaciones. Google también dice que los modelos admiten más de 97 idiomas, aunque la evidencia de la fuente no ofrece más detalles sobre el rendimiento o la disponibilidad idioma por idioma.
Gemini 3.8 Live se presenta como el modelo de audio estándar en tiempo real, mientras que Gemini 3.8 Live Extended Thinking añade una variante orientada al razonamiento. Ambos están disponibles para desarrolladores y no se presentan solo como funciones dirigidas al consumidor. El lanzamiento incluye aplicaciones de ejemplo en GitHub, según The Decoder, ofreciendo a los equipos de producto un punto de partida para probar flujos de trabajo de voz.
El conjunto de funciones apunta a aplicaciones que combinan voz con uso de herramientas y contexto multimodal. Un agente de voz podría, por ejemplo, interpretar entradas visuales mientras gestiona una solicitud de API externa y mantiene una interacción hablada. La fuente no identifica integraciones empresariales específicas, clientes en producción ni condiciones de disponibilidad general más allá del acceso mediante la Gemini API y Google AI Studio.
Esa distinción es importante para los desarrolladores. Un modelo que puede hablar con naturalidad es solo una parte de un producto de voz. Los desarrolladores también necesitan ejecución fiable de herramientas, manejo de interrupciones, controles de latencia, registro y salvaguardas en torno a acciones activadas por solicitudes habladas. Las capacidades descritas por Google abordan parte de esa arquitectura, pero la evidencia disponible no establece cuán consistentemente funcionan los modelos en entornos de producción.
La diferencia competitiva más clara es el costo. The Decoder informa que Google cobra 0,005 dólares por minuto para la entrada de audio y 0,018 dólares por minuto para la salida de audio. Según el cálculo de la publicación, una hora de conversación por voz cuesta aproximadamente 1,38 dólares con los supuestos de precios de Google.
El mismo informe sitúa GPT-Live-1 de OpenAI en 0,05 dólares por minuto, lo que lleva una hora de conversación a unos 3 dólares o más. El total exacto para cualquier aplicación dependerá de la proporción entre audio de entrada y de salida, las pausas, los reintentos, las llamadas a herramientas y otra actividad facturable, por lo que la comparación por hora debe tratarse como una estimación ilustrativa y no como un costo operativo universal.
Incluso con esa salvedad, la brecha de precios podría afectar cómo los equipos diseñan productos de voz. Unos costos de inferencia más bajos facilitan probar conversaciones más largas, ofrecer funciones de voz a más usuarios y realizar experimentos antes de demostrar un modelo de negocio. Para las startups, el costo puede determinar si un flujo de trabajo de voz es viable en absoluto. Para las empresas más grandes, puede influir en si la voz se ofrece como interfaz principal o como un complemento caro.
El precio por sí solo no decide. The Decoder dice que el modelo de OpenAI debería sonar más natural porque GPT-Live-1 usa full duplex, lo que le permite escuchar y hablar al mismo tiempo. La publicación también juzgó que las demostraciones de OpenAI sonaban mejor, mientras que caracterizó el aparente intercambio de Google como una mayor eficiencia de precio en lugar de una calidad conversacional claramente superior.
La afirmación de rendimiento más fuerte del informe proviene del Artificial Analysis Speech-to-Speech Leaderboard. The Decoder dice que Gemini 3.8 Live Extended Thinking obtuvo un 82,6 por ciento y quedó en primer lugar por delante de los modelos GPT-Live-1 más recientes de OpenAI.
Eso es un resultado de benchmark, no una prueba de que el modelo de Google producirá la mejor experiencia en todas las aplicaciones. Las puntuaciones del leaderboard pueden depender del diseño de las pruebas, los prompts, los criterios de evaluación y las versiones del modelo. La evidencia de la fuente no ofrece la metodología del leaderboard, intervalos de confianza ni un desglose de dónde los modelos ganaron o perdieron puntos.
La evaluación de la naturalidad conversacional del informe también se basa en escuchar demostraciones. Es un contexto útil de mercado, pero no es una evaluación controlada de latencia, recuperación ante interrupciones, precisión factual, fiabilidad en el uso de herramientas ni satisfacción del usuario. Ni la fuente ni la evidencia disponible proporcionan cifras de adopción independientes, referencias de clientes o datos de fiabilidad en producción para Gemini 3.8 Live.
Para los equipos que evalúan el lanzamiento, la prueba práctica probablemente será el rendimiento a nivel de tarea más que una sola puntuación de speech-to-speech. Los desarrolladores deberían comparar la latencia de respuesta, la gestión de turnos, el comportamiento ante interrupciones, la pronunciación, la consistencia multilingüe y el costo de las conversaciones con distintos patrones de habla. También deberían probar si el modelo maneja correctamente el contexto visual y las acciones de API sin crear interrupciones inseguras o confusas.
La estrategia de Google es sencilla: abaratar el desarrollo de voz en tiempo real y, al mismo tiempo, ofrecer suficiente capacidad multimodal y de uso de herramientas para atraer a desarrolladores que ya experimentan con agentes de IA. El acceso mediante la Gemini API y Google AI Studio reduce la barrera para crear prototipos, y los ejemplos de GitHub pueden ayudar a los equipos a pasar más rápido de una demostración a una aplicación inicial.
La principal oportunidad está en productos en los que la interacción por voz es frecuente pero no requiere la conversación más parecida a la humana posible. La triage de atención al cliente, los asistentes internos, la búsqueda hablada, las herramientas de servicio de campo y los flujos de trabajo sin manos podrían beneficiarse de unos costos de audio más bajos. Sin embargo, las aplicaciones que impliquen ventas, salud, finanzas u otras conversaciones sensibles pueden dar más peso al turn-taking natural, al comportamiento predecible, a los controles de datos y a la auditabilidad que al precio.
El lanzamiento también plantea una cuestión de despliegue para las empresas que eligen entre proveedores de modelos. Una tarifa por minuto más baja puede verse compensada por trabajo de ingeniería si el modelo necesita más reintentos, produce turnos más torpes o requiere una orquestación adicional para igualar la experiencia de un competidor. Por tanto, los equipos deberían calcular el costo total por tarea completada, no solo el precio por token de audio o por minuto.
La primera señal será la prueba independiente de Gemini 3.8 Live frente a GPT-Live-1 en latencia, interrupciones, razonamiento visual, voz multilingüe y ejecución de herramientas. El ranking de Artificial Analysis ofrece un punto de referencia inicial, pero evaluaciones más amplias mostrarán si el resultado se mantiene fuera del entorno de benchmark.
Los desarrolladores también deberían vigilar pruebas de uso real en producción: clientes identificados, estudios de caso públicos, datos de uso y límites de servicio más claros. El precio de Google puede atraer experimentación, pero la adopción sostenida dependerá de la fiabilidad, la disponibilidad y la calidad de las herramientas API que rodean al modelo.
Por último, las actualizaciones de modelos de ambas empresas podrían cambiar rápidamente la comparación. OpenAI podría responder con precios más bajos o mejor acceso, mientras que Google podría priorizar un turn-taking más natural. La cuestión competitiva no es simplemente qué modelo es más barato hoy, sino qué proveedor puede ofrecer calidad de voz aceptable y comportamiento fiable de los agentes a escala.
Gemini 3.8 Live ofrece a los desarrolladores una razón creíble para replantearse la economía de la IA de voz. La ventaja de precio reportada por Google es lo bastante grande como para cambiar los experimentos de producto, especialmente en aplicaciones basadas en conversaciones frecuentes o prolongadas.
Pero el lanzamiento no elimina la compensación central entre costo y calidad de la interacción. La evaluación más útil combinará el benchmark reportado con flujos de trabajo reales, donde la latencia, las interrupciones, las llamadas a herramientas y la seguridad importan tanto como la puntuación del leaderboard. Por ahora, Google ha presentado el argumento de costo; los desarrolladores todavía deben determinar si la experiencia es lo bastante sólida para sus usuarios.