Компания Google DeepMind анонсировала выпуск своей новейшей аудио модели под названием Gemini 3.1 Flash TTS. Согласно сообщению разработчиков, эта система представляет собой следующее поколение технологий синтеза речи, ориентированное на повышенную выразительность.

Ключевой особенностью модели является внедрение гранулярных аудиометок. Этот механизм предоставляет пользователям возможность точного контроля над процессом генерации, позволяя напрямую задавать желаемые эмоциональные и интонационные характеристики создаваемого аудио.

Представленная технология позиционируется как инструмент для создания более живой и управляемой искусственной речи. Внедрение таких тегов призвано устранить ограничения предыдущих систем, где тонкая настройка голоса была затруднена.