Skip to content

Google incorpora razonamiento a su IA de voz en tiempo real, abriendo la puerta a agentes telefónicos más capaces

Respuesta corta

Google DeepMind lanzó Gemini 3.8 Live y Live Extended Thinking, sumando un modo de razonamiento a su API de voz/vídeo en tiempo real. Los agentes de voz construidos sobre esta base ahora pueden detenerse a resolver solicitudes de varios pasos —como diagnósticos técnicos o agendamientos con condiciones— antes de responder, en lugar de depender de flujos guionizados de un solo turno.

Qué significa para las operaciones

Para una empresa B2B de 10 a 200 personas que opera soporte telefónico o una línea de calificación de ventas mediante IA de voz, esto cierra la brecha más grande de los agentes de voz actuales: manejar algo más allá de una consulta de un solo turno. Una llamada de soporte que requiere verificar el estado de un pedido, luego aplicar una regla de reembolso condicional y después confirmar con el cliente, antes necesitaba derivarse a un humano o seguir un árbol de decisión guionizado. Extended Thinking permite que el agente razone esa secuencia en vivo, durante la llamada, lo que se traduce en menos escalamientos y un tiempo medio de gestión más corto para la cola de primer nivel. Los equipos que evalúan o ya operan bots de voz para soporte entrante o calificación saliente deberían tomar esto como el momento de volver a probar la latencia y precisión con sus guiones de llamada reales: los modos de razonamiento suelen añadir tiempo de procesamiento, por lo que el equilibrio entre profundidad y velocidad de respuesta debe medirse antes de incorporarlo a una cola en producción, no asumirse.

Google DeepMind anunció Gemini 3.8 Live y un modo complementario, Gemini 3.8 Live Extended Thinking, que extiende su API de voz y vídeo en tiempo real con la capacidad de razonamiento antes reservada para los modelos Gemini de texto no en vivo.

Gemini Live ha impulsado agentes conversacionales hablados de baja latencia —el tipo utilizado en asistentes de voz, soporte dentro de aplicaciones y bots telefónicos de cara al cliente. Hasta ahora, esa baja latencia tenía un costo: el modelo respondía con rapidez pero con capacidad limitada para razonar solicitudes condicionales o de varios pasos en medio de la conversación. Extended Thinking cierra esa brecha al permitir que el modelo en vivo inserte un paso de razonamiento antes de responder, de modo que pueda resolver lógica secuencial —verificar una condición antes de actuar sobre otra— sin salir de la conversación en tiempo real hacia una llamada de razonamiento separada y más lenta.

La publicación de Google DeepMind presenta esto como un acercamiento entre la interacción hablada en vivo y el razonamiento más profundo disponible en los modelos estándar de razonamiento de Gemini. El anuncio no detalló precios específicos, referencias de latencia ni plazos de disponibilidad, que permanecen sin confirmar al momento de escribir esto.

El cambio práctico afecta a cualquiera que construya o adquiera automatización basada en voz. Los agentes de voz en vivo se han posicionado generalmente para tareas simples y acotadas —reserva de citas, preguntas frecuentes básicas, consultas de pedidos— precisamente porque no podían razonar con fiabilidad nada más complejo sin romper el flujo en tiempo real. Un modo en vivo con capacidad de razonamiento sugiere que los proveedores y los equipos internos pueden llevar los agentes de voz más lejos, hacia la clasificación de soporte, la calificación de ventas de varios pasos o tareas operativas que implican verificar un dato contra otro antes de responder.

La salvedad es que razonar toma tiempo, y las interacciones de voz son sensibles a la latencia de una manera que el chat de texto no lo es. Un cliente en una línea telefónica nota una pausa de dos segundos más que alguien escribiendo en una ventana de chat. Las empresas que piloteen esto deberían medir el desempeño de Extended Thinking frente a sus propios flujos de llamada, tanto en precisión como en el retraso de respuesta percibido, antes de asumir que se trata de una actualización directa a un despliegue de voz existente.

Fuente: Google DeepMind

Siguiente paso

Visibility Analyzer

Esto es lo que el Visibility Analyzer mide en un sitio real: qué respuestas te citan, qué páginas el motor no puede recuperar y qué arreglar primero. Ejecutarlo es gratis.

Lanzar una auditoría de visibilidad gratuita

Lanzarlo es gratis. Sin tarjeta.

Precio
Gratis
Duración
Una ejecución, minutos

Plan gratuito: dos análisis al día, sin tarjeta.