Das Unternehmen Google DeepMind hat die Veröffentlichung seines neuesten Audiomodells namens Gemini 3.1 Flash TTS angekündigt. Laut den Entwicklern stellt dieses System die nächste Generation der Sprachsynthesetechnologie dar, die auf eine erhöhte Ausdrucksstärke ausgerichtet ist.

Ein Schlüsselmerkmal des Modells ist die Einführung granularer Audiometadaten. Dieser Mechanismus bietet Nutzern die Möglichkeit einer präzisen Kontrolle über den Generierungsprozess und erlaubt es, gewünschte emotionale und intonatorische Eigenschaften des erzeugten Audios direkt vorzugeben.

Die vorgestellte Technologie positioniert sich als Werkzeug zur Erstellung lebendigerer und besser steuerbarer künstlicher Sprache. Die Implementierung solcher Tags soll die Einschränkungen früherer Systeme beseitigen, bei denen eine feine Abstimmung der Stimme erschwert war.