フレーム、音声、文字起こしテキストなど、タスクに最も関連性の高い部分やシグナルを適応的に選択して動画を分析するパターン。
Googleは、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteに「エージェント型動画理解」機能を追加した。これによりモデルは、動画を固定フレームレートで処理するのではなく、検査が必要な部分やメディアを特定する。同社によると、この機能はトークン消費を最大88%、コストを最大66%削減し、精度を最大7%向上させる。