Google DeepMind anunció Gemini 3.8 Live y un modo complementario, Gemini 3.8 Live Extended Thinking, que extiende su API de voz y vídeo en tiempo real con la capacidad de razonamiento antes reservada para los modelos Gemini de texto no en vivo.
Gemini Live ha impulsado agentes conversacionales hablados de baja latencia —el tipo utilizado en asistentes de voz, soporte dentro de aplicaciones y bots telefónicos de cara al cliente. Hasta ahora, esa baja latencia tenía un costo: el modelo respondía con rapidez pero con capacidad limitada para razonar solicitudes condicionales o de varios pasos en medio de la conversación. Extended Thinking cierra esa brecha al permitir que el modelo en vivo inserte un paso de razonamiento antes de responder, de modo que pueda resolver lógica secuencial —verificar una condición antes de actuar sobre otra— sin salir de la conversación en tiempo real hacia una llamada de razonamiento separada y más lenta.
La publicación de Google DeepMind presenta esto como un acercamiento entre la interacción hablada en vivo y el razonamiento más profundo disponible en los modelos estándar de razonamiento de Gemini. El anuncio no detalló precios específicos, referencias de latencia ni plazos de disponibilidad, que permanecen sin confirmar al momento de escribir esto.
El cambio práctico afecta a cualquiera que construya o adquiera automatización basada en voz. Los agentes de voz en vivo se han posicionado generalmente para tareas simples y acotadas —reserva de citas, preguntas frecuentes básicas, consultas de pedidos— precisamente porque no podían razonar con fiabilidad nada más complejo sin romper el flujo en tiempo real. Un modo en vivo con capacidad de razonamiento sugiere que los proveedores y los equipos internos pueden llevar los agentes de voz más lejos, hacia la clasificación de soporte, la calificación de ventas de varios pasos o tareas operativas que implican verificar un dato contra otro antes de responder.
La salvedad es que razonar toma tiempo, y las interacciones de voz son sensibles a la latencia de una manera que el chat de texto no lo es. Un cliente en una línea telefónica nota una pausa de dos segundos más que alguien escribiendo en una ventana de chat. Las empresas que piloteen esto deberían medir el desempeño de Extended Thinking frente a sus propios flujos de llamada, tanto en precisión como en el retraso de respuesta percibido, antes de asumir que se trata de una actualización directa a un despliegue de voz existente.