開発・企業向け

Geminiにエージェント型動画理解を導入

原題: Introducing agentic video understanding with Gemini

重要API提供中動画理解

必要な動画区間をモデルが動的に調査

Googleは9月1日、Geminiのagentic video understandingを提供開始しました。

Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteで利用できます。

従来の固定フレームレート処理と異なり、モデルが必要な動画区間、速度、映像・音声・文字起こしの情報を動的に選びます。

短時間の場面検索、長時間動画内の情報探索、異常検知、動作や物体の計数を想定しています。

動画アップロードとYouTube動画の両方に対応します。

Gemini APIを通じ、Google AI StudioとGemini Enterprise Agent Platformで利用できます。

API設定の処理方式をagenticに指定して有効化します。

追加の機能料金はなく、通常のGemini APIトークン料金が適用されます。

Googleの評価では、トークン消費を最大88%、費用を最大66%削減し、精度を最大7%改善しました。

これらの数値はGoogle自身のベンチマーク結果であり、独立評価ではありません。

原文

← 日次まとめへ戻る