Главное
Google научил голосового ИИ рассуждать в реальном времени — открывается путь к более умным телефонным агентам
Google DeepMind выпустила Gemini 3.8 Live и Live Extended Thinking, добавив режим рассуждений в свой голосовой/видео API реального времени. Голосовые агенты на его основе теперь могут делать паузу, чтобы проработать многошаговые запросы — например, диагностику проблемы или запись с условиями — вместо того чтобы полагаться на сценарные однотуровые сценарии.
Что меняется для операций — Для B2B-компании с 10-200 сотрудниками, использующей голосовой ИИ для телефонной поддержки или квалификации лидов, это закрывает главный пробел текущих голосовых агентов — работу со сложными запросами, выходящими за рамки одного обращения к базе. Звонок, требующий сначала проверить статус заказа, затем применить условное правило возврата средств, а затем подтвердить это с клиентом, раньше требовал передачи оператору-человеку или жёсткого дерева решений. Extended Thinking позволяет агенту рассуждать через эту последовательность прямо во время звонка, что означает меньше эскалаций и более короткое среднее время обработки на линии первого уровня. Командам, которые тестируют или уже используют голосовых ботов для входящей поддержки или исходящей квалификации, стоит воспринять это как повод заново протестировать задержку и точность на реальных сценариях звонков — режимы рассуждений обычно увеличивают время обработки, поэтому компромисс между глубиной анализа и скоростью ответа нужно измерить перед внедрением в реальную очередь звонков, а не принимать на веру.