Google DeepMind は、最新の Gemini モデルにおいてエージェント型ビデオ理解の開始を発表しました。同社の声明によると、この更新は精度の向上ならびにコストおよびトークン使用量の削減を目的としています。

情報源は、どのモデルが具体的にこの機能を得たのか、ユーザーがいつどのような条件で利用可能になるのか、また主張されている改善がどのテストに基づいているのかについては明らかにしていません。提示された情報は、Google DeepMind Blog の投稿のメタデータでのみ公開されています。

この開始の実践的な意義は、精度の向上が実際のビデオタスクにおいてどれほど顕著に現れるか、そしてそれが可用性の潜在的な制限を補うかどうかにかかっています。