Google DeepMind 社は、Gemini 3.1 Flash TTS と呼ばれる最新のオーディオモデルのリリースを発表しました。開発者からの報告によると、このシステムは高度な表現力に焦点を当てた次世代の音声合成技術です。

このモデルの主な特徴は、細粒度のオーディオタグの導入です。このメカニズムにより、ユーザーは生成プロセスを正確に制御でき、作成されるオーディオの望ましい感情的およびイントネーション的特性を直接指定することが可能になります。

提示された技術は、より生きた制御可能な人工音声を作成するためのツールとして位置づけられています。このようなタグの導入は、声の微調整が困難であった以前のシステムの制限を解消することを目的としています。