Gemini 3.8 Live lleva el razonamiento en segundo plano a la voz
Google estrena dos modelos de voz que pueden conversar, interpretar imágenes y ejecutar tareas en segundo plano sin cortar el diálogo.

Google ha lanzado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de diálogo en tiempo real que ya están disponibles en la API de Gemini y empiezan a llegar a productos como Search Live, la aplicación de Gemini y Workspace. La novedad importante no es que una IA hable: es que puede mantener la conversación mientras razona, observa información visual y espera a que terminen herramientas externas.
La versión estándar prioriza rapidez y coste. Extended Thinking está pensada para encargos con varios pasos, como coordinar una reserva o convertir un boceto comentado por voz en una interfaz funcional. La conversación deja de ser una pausa entre órdenes y pasa a acompañar el trabajo mientras sucede.
-IA Crew dice:Por fin una IA puede decir «un momento, lo estoy mirando» y que no sea solo una elegante forma de ganar tiempo.-
La voz ya no es una capa pegada al modelo
Gemini 3.8 Live es un sistema audio a audio: recibe voz y puede responder con voz sin depender necesariamente de una cadena separada de transcripción, modelo de texto y sintetizador. También admite imágenes, vídeo y texto, con una ventana de contexto* de hasta 128.000 tokens según la ficha técnica de Google DeepMind.
Esa combinación permite que el asistente escuche una explicación, vea lo que muestra una cámara o una pantalla y mantenga el hilo de una sesión larga. Google afirma además que puede cambiar automáticamente entre 97 idiomas durante una conversación.
El detalle más interesante está en la llamada asíncrona a herramientas. El modelo puede iniciar una consulta, una búsqueda o una acción en otro servicio, reconocer que está trabajando en ello y seguir hablando mientras espera el resultado. En los asistentes actuales, ese tiempo suele convertirse en silencio, una animación o una conversación bloqueada.
-IA Crew dice:El círculo girando sigue ahí, pero ahora al menos tiene conversación.-
Extended Thinking intenta razonar sin romper el ritmo
La variante Extended Thinking añade más razonamiento para tareas complejas. Google la presenta como capaz de pensar y hablar a la vez, dar señales tempranas de que ha entendido el encargo y narrar el progreso cuando coordina varios pasos.
Esto importa especialmente para los agentes de voz. Un sistema que reserva una cita, consulta disponibilidad y aplica condiciones necesita usar herramientas reales; hablar con naturalidad es solo una parte del problema. Si cada llamada externa congela la interacción, la experiencia se parece menos a conversar y más a escuchar música de espera generada por IA.
Google muestra ejemplos de reservas, resolución de problemas y creación de componentes de software. Son demostraciones del proveedor, no pruebas de que cualquier integración vaya a funcionar igual. La calidad final dependerá de las herramientas conectadas, sus permisos y cómo esté construida cada aplicación.
Los benchmarks ayudan, pero no cierran el caso
Google sitúa Extended Thinking en el primer puesto del Speech to Speech Quality Index de Artificial Analysis con 82,6 puntos y publica resultados del 68,6% en τ-Voice y del 35,1% en una variante bancaria de esa prueba. También declara un 97,7% en Big Bench Audio.
Las cifras sirven para ubicar el modelo, pero hay que leerlas con cuidado. Algunas evaluaciones son externas y otras se ejecutaron en plataformas o configuraciones vinculadas a Google. Medir calidad de voz, razonamiento y finalización de una tarea no es lo mismo, y una buena puntuación no garantiza que un agente gestione bien un caso imprevisible.
-IA Crew dice:Una voz puede sonar impecable y aun así reservarte mesa para seis en una ciudad donde no vives. La dicción no arregla la agenda.-
Disponible hoy, con límites bastante terrenales
Gemini 3.8 Live se distribuye mediante la API, AI Studio, la aplicación de Gemini, Search Live y servicios empresariales. Extended Thinking también llega a la API y a suscriptores de Google AI en distintas funciones de Workspace, con disponibilidad que varía según producto y cuenta.
La ficha de modelo reconoce limitaciones conocidas de los modelos fundacionales: alucinaciones, posibles problemas de resistencia a ataques, lentitud ocasional y tiempos de espera agotados. Todo el audio generado incorpora la marca imperceptible SynthID.
El salto no consiste en una voz más humana, sino en una voz que puede seguir presente mientras el sistema hace trabajo real. Falta comprobar cuánto aguanta esa promesa fuera de las demostraciones, con herramientas de terceros, conexiones inestables y usuarios que cambian de idea a mitad de frase.
Diccionario de la Crew
Audio a audio* — Modelo que procesa voz y genera voz directamente, sin convertir obligatoriamente toda la interacción en una cadena de módulos separados.
Ventana de contexto* — Cantidad de información que el modelo puede mantener disponible durante una sesión para responder con continuidad.
Llamada asíncrona a herramientas* — Acción externa que se ejecuta en segundo plano mientras el modelo continúa interactuando con el usuario.