Google представила Gemini 3.8 Live и Extended Thinking для голосовых агентов
Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — самые продвинутые модели живого диалога в своей линейке на сегодняшний день. Обе представляют собой нативные модели «речь в речь», созданные для голосовых агентов, работающих в реальном времени. Они продолжают семейство Gemini Audio, которое компания расширила в прошлом месяце моделью Gemini 3.5 Transcribe. Выпуск закрывает конкретную нишу: голосовые агенты, способные рассуждать и выполнять инструментальные действия, не разрушая естественный ход беседы.
Можно ли это внедрять? Да, для продакшена через API. Обе модели уже доступны в Gemini Live API и Google AI Studio. Это облачные модели с закрытыми весами, поэтому варианта с самостоятельным размещением нет.
Что именно представила Google
Запуск охватывает две модели с разными задачами. Gemini 3.8 Live рассчитана на масштаб и экономичность: она сочетает разговорный интеллект с плавным диалогом и визуальной привязкой к контексту. Gemini 3.8 Live Extended Thinking создана для задач высокой сложности — она добавляет повышенный интеллект и многошаговые рассуждения прямо во время речи. Google позиционирует обе как упрощённую альтернативу каскадным речевым конвейерам, где последовательно соединяются ASR, языковая модель и синтез речи.
Результаты тестов
Gemini 3.8 Live Extended Thinking заняла первое место в общем зачёте индекса качества «речь в речь» Speech to Speech Quality Index от Artificial Analysis с результатом 82,6 балла. Она лидирует в выполнении агентных задач: 68,6% в τ-Voice и 35,1% в бенчмарке τ-Voice-banking от Sierra. Кроме того, модель набирает 97,7% в Big Bench Audio — тесте на рассуждения для аудиомоделей. Gemini 3.8 Live заняла второе место в Speech Agent Arena, где оценку дают люди. По данным Google, на EVA-Bench от ServiceNow модели сдвигают границу Парето для сложных рабочих процессов, балансируя точность выполнения задач и качество диалога; замеры проводились через Live API на платформе Gemini Enterprise Agent Platform.
Возможности для разработчиков
Live API открывает в новых моделях пять ключевых возможностей:
- Асинхронный вызов функций: модель выполняет обращения к API и инструментам в фоне. Аудиоответ продолжает поступать пользователю, пока задачи завершаются.
- Визуальный контекст: модель обрабатывает визуальные данные почти в реальном времени, поэтому агенты понимают не только то, что пользователь говорит, но и то, что он видит.
- Точность в буквенно-цифровых данных: модель корректно распознаёт коды подтверждения, номера заявок и технические данные — типичное слабое место голосовых систем.
- Многоязычность: модель автоматически определяет и переключает 97 поддерживаемых языков прямо во время разговора, сохраняя единообразие акцента.
- Инкрементальные обновления контента: модель объединяет аудио в реальном времени со структурированными данными и выдаёт ответы с учётом контекста.
Extended Thinking добавляет настраиваемое «обдумывание» для многошаговых рассуждений в фоне. Модель размышляет и говорит одновременно, используя ранние словесные сигналы вроде «Сейчас проверю», чтобы подтвердить получение запроса. Затем она шаг за шагом комментирует ход выполнения длительных задач. В демонстрациях Google модель превращает наброски вместе с голосовыми правками в работающие компоненты React и координирует многоэтапные бронирования.
Цены и экосистема
Стоимость обеих моделей — 0,005 доллара за минуту аудиовхода и 0,018 доллара за минуту аудиовыхода. Google уточняет, что оценка основана на цене 3 доллара за 1 млн входных токенов и 12 долларов за 1 млн выходных. Разработчики также могут работать через партнёров по интеграции Live API, которые обеспечивают инфраструктуру потоковой передачи медиа в реальном времени: среди них Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Кроме того, Google сотрудничает с Salesforce, Genspark и Lumeris — те отмечают низкую задержку моделей, плавность диалога и вызов инструментов. Примеры приложений доступны на GitHub.
Главное
- Gemini 3.8 Live Extended Thinking занимает первое место в Speech to Speech Quality Index от Artificial Analysis с показателем 82,6.
- Модель набирает 68,6% в τ-Voice, 35,1% в τ-Voice-banking от Sierra и 97,7% в Big Bench Audio.
- Gemini 3.8 Live выполняет обращения к инструментам и API в фоне, продолжая разговор.
- Цена составляет 0,005 доллара за минуту аудиовхода и 0,018 доллара за минуту аудиовыхода через Live API.
- Всё генерируемое аудио несёт незаметную для слуха водяную метку SynthID от Google DeepMind.
