🔊 Gemini 3.8 Live Extended Thinking — «первое место» с оговоркой в 35%
Google заявляет, что новая модель заняла #1 в Speech to Speech Quality Index (82.6) от Artificial Analysis и лидирует в агентных задачах: 68.6% на τ-Voice и 35.1% на банковском Sierra τ-Voice-banking. Первое место действительно про Extended Thinking — тяжёлую версию для сложных workflow, а не про базовую Gemini 3.8 Live, которую Google продаёт как решение для масштаба и низкой стоимости.
У обычной 3.8 Live своя метрика — второе место в Speech Agent Arena, где сравниваются предпочтения пользователей в живом диалоге. То есть по «нравится ли разговаривать» лидер не Google, а по формальному качеству речи — Google, но версией подороже.
Это лучший результат среди фронтир-моделей на банковском бенчмарке, но по сути — доля сценариев, доведённых до конца без ошибок. Даже топовая модель не закрывает две трети сложных многошаговых банковских диалогов целиком. Цифры тарифов на сами 3.8 Live модели Google в открытом прайсе пока не публикует, поэтому оценить стоимость эксплуатации против OpenAI по этому релизу нельзя.
Extended Thinking имеет смысл смотреть для сложных агентных сценариев (бронирования, многошаговые API-вызовы), обычная 3.8 Live — для потоковых голосовых интерфейсов с высокой нагрузкой, где важна цена за минуту, а не глубина рассуждений.
Источник
💬 MAX
#разбор #gemini #агенты
Google заявляет, что новая модель заняла #1 в Speech to Speech Quality Index (82.6) от Artificial Analysis и лидирует в агентных задачах: 68.6% на τ-Voice и 35.1% на банковском Sierra τ-Voice-banking. Первое место действительно про Extended Thinking — тяжёлую версию для сложных workflow, а не про базовую Gemini 3.8 Live, которую Google продаёт как решение для масштаба и низкой стоимости.
У обычной 3.8 Live своя метрика — второе место в Speech Agent Arena, где сравниваются предпочтения пользователей в живом диалоге. То есть по «нравится ли разговаривать» лидер не Google, а по формальному качеству речи — Google, но версией подороже.
35.1% на Sierra's τ-Voice-banking benchmark
Это лучший результат среди фронтир-моделей на банковском бенчмарке, но по сути — доля сценариев, доведённых до конца без ошибок. Даже топовая модель не закрывает две трети сложных многошаговых банковских диалогов целиком. Цифры тарифов на сами 3.8 Live модели Google в открытом прайсе пока не публикует, поэтому оценить стоимость эксплуатации против OpenAI по этому релизу нельзя.
Extended Thinking имеет смысл смотреть для сложных агентных сценариев (бронирования, многошаговые API-вызовы), обычная 3.8 Live — для потоковых голосовых интерфейсов с высокой нагрузкой, где важна цена за минуту, а не глубина рассуждений.
Источник
💬 MAX
#разбор #gemini #агенты