Рынки
Google представляет модели текст-в-речь Gemini 3.8 для улучшения голосовых приложений
Google представил свои новые модели текст-в-речь Gemini 3.8, которые расширяют возможности создателей и разработчиков в производстве выразительных, естественных и многоязычных голосов в больших масштабах. Этот релиз является частью более широкой линейки аудиомоделей Gemini, в которую входят такие модели, как Gemini 3.8 Live и Gemini 3.8 Flash, предназначенные для взаимодействия в реальном времени и задач программирования соответственно.
Введение моделей текст-в-речь Gemini 3.8, похоже, укрепляет конкурентные позиции Google в разработке технологий ИИ. Этот релиз является частью более широкой стратегии по расширению аудиостека Gemini, что свидетельствует о комплексном подходе к аудиоприложениям на основе ИИ. Участники рынка интерпретируют это развитие как свидетельство продолжающихся достижений Google в области ИИ, что может повлиять на восприятие производительности моделей ИИ компании.
Ключевые особенности Gemini 3.8
- Улучшенная настройка голоса с тремя уровнями выбора голоса.
- Поддержка до 130 языков, что позволяет охватить глобальные рынки.
- Включает генерацию аудио как с одним, так и с несколькими говорящими.
- Предоставляет систему дизайна пользовательского голоса, позволяющую использовать естественные языковые команды для создания голоса.
Запуск TTS последовал за релизом моделей Gemini 3.8 Live, предназначенных для взаимодействия в реальном времени, что подчеркивает приверженность Google к развитию технологий голосового взаимодействия на основе ИИ. Участники рынка, вероятно, будут следить за тем, как эти модели будут работать по сравнению с конкурентами, такими как Anthropic и OpenAI, а также за их влиянием на рейтинг Chatbot Arena LLM.
Последние обновления о голосе ChatGPT
- Голос ChatGPT был обновлён, чтобы включить поддержку плагинов и три новые модели GPT-6: Astra, Sol и Luna.
- Astra — это самая мощная модель OpenAI, предназначенная для программирования и сложного логического мышления, в то время как Sol и Luna оптимизированы для повседневных задач.
- С 10 сентября 2026 года пользователи Pro-плана могут выбирать между GPT-5.6 Sol или GPT-6 Astra для голосовых взаимодействий.
- GPT-6 Sol и GPT-6 Luna были запущены 22 сентября 2026 года, с значительно сниженной ценой на API — Sol по $2 за миллион входных токенов и $10 за миллион выходных токенов, а Luna по $0.10/$0.50.
- OpenAI скорректировала суточные лимиты использования для GPT-Live, позволяя подписчикам Plus до 3 часов голосового взаимодействия и пользователям Pro 15 часов в день.
- Luna доступна пользователям бесплатного и Go-тарифа через настольное приложение, которое получило поддержку GPT-Live в июле 2026 года.
- Новая ценовая стратегия для Sol и Luna направлена на изменение поведения разработчиков, предлагая более экономичные решения для различных задач.
Новые разработки в моделях синтеза речи Google Gemini 3.8
- Gemini 3.8 Flash TTS достигла оценки 89.5% на Бенчмарке устойчивости произношения Искусственного Анализа, превзойдя своего предшественника, Gemini 3.1 Flash TTS, который набрал 88.2%.
- Модель также заняла первое место на Бенчмарке дизайна голоса Hume AI с общей оценкой 71.4, а конкретно набрала 60.8 за воспроизведение акцента.
- Gemini 3.8 Flash TTS заняла как первое, так и второе места в Индексе общего качества Hume AI.
- Запущенная 23 сентября, Gemini 3.8 Flash TTS включает более легкий вариант под названием Flash-Lite TTS, оба доступны через API Gemini и Google AI Studio.
- Модель поддерживает генеративный дизайн голоса на основе текстовых подсказок и может воспроизводить конкретный голос из примерно 30 секунд аудио.
- Она способна обрабатывать взаимодействия с несколькими говорящими, позволяя одной модели озвучивать целые разговоры между разными персонажами.
- Поддержка языков превышает 100 языков, включая различные региональные акценты, с качеством голоса студийного уровня и тонким контролем через метаданные и встроенные теги.
FAQ
Каковы ключевые особенности моделей текст-в-речь Gemini 3.8?
Ключевые особенности включают улучшенную настройку голоса с тремя уровнями выбора голоса, поддержку до 130 языков, генерацию аудио с одним и несколькими говорящими, а также систему дизайна пользовательского голоса, которая позволяет использовать естественные языковые команды для создания голоса.
Как Gemini 3.8 сравнивается с предыдущими моделями?
Gemini 3.8 основывается на предыдущих моделях, предлагая улучшенную выразительность, естественность и многоязычные возможности, что делает его более подходящим для более широкого спектра приложений в области голосовых технологий.
Каково значение аудиосемейства Gemini?
Аудиосемейство Gemini, включая модели такие как Gemini 3.8 Live и Gemini 3.8 Flash, представляет собой комплексный подход Google к аудиоприложениям на основе ИИ, улучшая взаимодействие с голосом в реальном времени и задачи кодирования.
Сколько языков поддерживает Gemini 3.8?
Gemini 3.8 поддерживает до 130 языков, обслуживая разнообразный глобальный рынок.
Какое влияние может оказать Gemini 3.8 на рынок ИИ?
Запуск Gemini 3.8 ожидается как способствующий укреплению конкурентной позиции Google в разработке технологий ИИ, потенциально влияя на восприятие производительности моделей ИИ компании и влияя на конкурентную среду против таких компаний, как Anthropic и OpenAI.