Skip to content

Google научил голосового ИИ рассуждать в реальном времени — открывается путь к более умным телефонным агентам

Короткий ответ

Google DeepMind выпустила Gemini 3.8 Live и Live Extended Thinking, добавив режим рассуждений в свой голосовой/видео API реального времени. Голосовые агенты на его основе теперь могут делать паузу, чтобы проработать многошаговые запросы — например, диагностику проблемы или запись с условиями — вместо того чтобы полагаться на сценарные однотуровые сценарии.

Что это значит для операций

Для B2B-компании с 10-200 сотрудниками, использующей голосовой ИИ для телефонной поддержки или квалификации лидов, это закрывает главный пробел текущих голосовых агентов — работу со сложными запросами, выходящими за рамки одного обращения к базе. Звонок, требующий сначала проверить статус заказа, затем применить условное правило возврата средств, а затем подтвердить это с клиентом, раньше требовал передачи оператору-человеку или жёсткого дерева решений. Extended Thinking позволяет агенту рассуждать через эту последовательность прямо во время звонка, что означает меньше эскалаций и более короткое среднее время обработки на линии первого уровня. Командам, которые тестируют или уже используют голосовых ботов для входящей поддержки или исходящей квалификации, стоит воспринять это как повод заново протестировать задержку и точность на реальных сценариях звонков — режимы рассуждений обычно увеличивают время обработки, поэтому компромисс между глубиной анализа и скоростью ответа нужно измерить перед внедрением в реальную очередь звонков, а не принимать на веру.

Google DeepMind объявила о выпуске Gemini 3.8 Live и сопутствующего режима Gemini 3.8 Live Extended Thinking, расширив свой голосовой и видео API реального времени возможностью рассуждений, ранее доступной только в текстовых, не-live моделях Gemini.

Gemini Live уже обеспечивала низкозадержечные разговорные агенты с голосовым интерфейсом — такие используются в голосовых помощниках, поддержке внутри приложений и клиентских телефонных ботах. До сих пор эта низкая задержка имела цену: модель отвечала быстро, но с ограниченной способностью прорабатывать многошаговые или условные запросы прямо посреди разговора. Extended Thinking закрывает этот пробел, позволяя live-модели вставлять этап рассуждения перед ответом, чтобы прорабатывать последовательную логику — проверяя одно условие перед действием на основе другого — не выходя из живого разговора в отдельный, более медленный вызов рассуждающей модели.

В публикации Google DeepMind это преподносится как сокращение разрыва между живым голосовым взаимодействием и более глубокими рассуждениями, доступными в стандартных рассуждающих моделях Gemini. Конкретные цены, показатели задержки и сроки доступности в анонсе не раскрывались и на момент написания остаются неподтверждёнными.

Практический сдвиг касается всех, кто разрабатывает или внедряет голосовую автоматизацию. Живые голосовые агенты обычно позиционировались для простых, ограниченных задач — записи на приём, базовых FAQ, проверки статуса заказа — именно потому, что не могли надёжно рассуждать о чём-то более сложном без выхода из режима реального времени. Появление рассуждающего live-режима говорит о том, что вендоры и внутренние команды смогут продвинуть голосовых агентов дальше — в триаж обращений в поддержку, многошаговую квалификацию продаж или операционные задачи, требующие сверки одного параметра с другим перед ответом.

Оговорка в том, что рассуждения требуют времени, а голосовые взаимодействия чувствительны к задержкам иначе, чем текстовый чат. Клиент на телефонной линии заметит двухсекундную паузу гораздо быстрее, чем человек, печатающий в окне чата. Компаниям, пилотирующим эту функцию, стоит протестировать Extended Thinking на собственных сценариях звонков — и по точности, и по воспринимаемой задержке ответа — прежде чем считать это готовым к прямому внедрению обновлением существующего голосового решения.

Источник: Google DeepMind

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.