Про це йдеться в анонсі Google для розробників. Оновлення охоплює моделі Gemini 3.8 Live та Gemini 3.8 Live Extended Thinking, які здатні вести діалог і виконувати фонові завдання без переривання розмови.
Модель Gemini 3.8 Live розроблена за принципом «голос-до-голосу» і дозволяє інтегрувати голосових агентів, які сприймають візуальний контекст у реальному часі та аналізують складні технічні дані, коди підтвердження чи номери заяв. Версія Extended Thinking додатково обробляє багатокрокові запити у фоновому режимі, паралельно розповідаючи користувачеві про хід виконання завдань.
Технологія підтримує понад 97 мов та дає змогу здійснювати асинхронні виклики API під час потокової передачі аудіо. Вартість використання нових моделей становить $0,005 за хвилину аудіовходу та $0,018 за хвилину аудіовиходу. Інтеграція вже доступна через партнерські платформи, серед яких Vercel, LangChain, LiveKit, Agora, Fishjam, Pipecat та Vision Agents.
В Google також нагадали про можливості спеціалізованої системи «мова-до-тексту» Gemini 3.5 Transcribe. Вона підтримує понад 85 мов і забезпечує транскрипцію з низьким рівнем помилок у словах — 4% для потокового передавання та 2,6% для непотокового. Модель підтримує налаштування термінологічного словника до 1000 слів та інтелектуальний режим з вилученням слів-заповнювачів.
Раніше Google випустила Gemini 3.8 Flash — нову версію своєї швидкої ШІ-моделі для програмування, складних задач і автономних агентів. Разом із нею компанія запустила Gemini 3.8 Flash Cyber, яка може аналізувати код, знаходити вразливості та пропонувати для них виправлення.
/
Компанія Google розширила інструментарій для розробників і презентувала в Gemini API та Google AI Studio нові моделі Gemini Live, орієнтовані на створення продуктів із голосовим керуванням у режимі реального часу.
