Google DeepMind объявила о выпуске Gemini 3.8 Live и сопутствующего режима Gemini 3.8 Live Extended Thinking, расширив свой голосовой и видео API реального времени возможностью рассуждений, ранее доступной только в текстовых, не-live моделях Gemini.
Gemini Live уже обеспечивала низкозадержечные разговорные агенты с голосовым интерфейсом — такие используются в голосовых помощниках, поддержке внутри приложений и клиентских телефонных ботах. До сих пор эта низкая задержка имела цену: модель отвечала быстро, но с ограниченной способностью прорабатывать многошаговые или условные запросы прямо посреди разговора. Extended Thinking закрывает этот пробел, позволяя live-модели вставлять этап рассуждения перед ответом, чтобы прорабатывать последовательную логику — проверяя одно условие перед действием на основе другого — не выходя из живого разговора в отдельный, более медленный вызов рассуждающей модели.
В публикации Google DeepMind это преподносится как сокращение разрыва между живым голосовым взаимодействием и более глубокими рассуждениями, доступными в стандартных рассуждающих моделях Gemini. Конкретные цены, показатели задержки и сроки доступности в анонсе не раскрывались и на момент написания остаются неподтверждёнными.
Практический сдвиг касается всех, кто разрабатывает или внедряет голосовую автоматизацию. Живые голосовые агенты обычно позиционировались для простых, ограниченных задач — записи на приём, базовых FAQ, проверки статуса заказа — именно потому, что не могли надёжно рассуждать о чём-то более сложном без выхода из режима реального времени. Появление рассуждающего live-режима говорит о том, что вендоры и внутренние команды смогут продвинуть голосовых агентов дальше — в триаж обращений в поддержку, многошаговую квалификацию продаж или операционные задачи, требующие сверки одного параметра с другим перед ответом.
Оговорка в том, что рассуждения требуют времени, а голосовые взаимодействия чувствительны к задержкам иначе, чем текстовый чат. Клиент на телефонной линии заметит двухсекундную паузу гораздо быстрее, чем человек, печатающий в окне чата. Компаниям, пилотирующим эту функцию, стоит протестировать Extended Thinking на собственных сценариях звонков — и по точности, и по воспринимаемой задержке ответа — прежде чем считать это готовым к прямому внедрению обновлением существующего голосового решения.