
ByteDance の Seed チームは、フルデュプレックスモードで音声と動画をネイティブに処理するマルチモーダル言語モデル『SeedRealtime』を発表した。MarkTechPost の報道によると、このモデルは音声、動画、テキストを単一のアーキテクチャに統合している。
SeedRealtime は、個別の問い合わせと応答の交換ではなく、リアルタイムの連続的なマルチモーダルストリームと対話する。これは、モデルが同時並行的にオーディオビジュアルな知覚と応答生成を行うように設計されていることを意味する。
現時点での実用性は、発表されたアーキテクチャアプローチの声明に限られている。利用可能な資料には、テスト結果、遅延時間、一般公開の有無、統合事例、あるいは他モデルとの優位性に関するデータは含まれていない。
編集部コメント
なぜ重要か
Вероятное следствие: если заявленный подход подтвердится на практике, разработчики получат основу для более непрерывных голосовых и визуальных интерфейсов. Ближайший наблюдаемый сигнал — публикация технических деталей, тестов или условий доступа. Существенная неопределённость сохраняется: доступное описание основано на одном кратком независимом сообщении без первичного источника.