Google Gemini 減少高達 88% 的標記使用量以分析視頻

By: www.diariobitcoin.com|2026/09/02 15:09:29

**Google 將基於代理的視頻分析整合到多個 Gemini Flash 模型中。該工具能夠自主選擇相關的場景、幀、音頻或文字記錄,根據公司說法,能夠將標記的使用量減少高達 88%,同時在某些評估中略微提高準確性。


Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型可以分析少於一秒的片段,包括狀態變化和可能在傳統每秒一幀的取樣中遺漏的剪接。這一能力對於自動化編輯非常重要,因為短暫的過渡或瞬時的修改可能會改變場景的意義。

該系統還可以在錄製的數小時中定位特定的時刻,而不會在過程中消耗數百萬的標記。為此,它識別潛在相關的時間窗口,並在檢測到異常或需要更高時間解析度的信號時,以更高的幀速率重新取樣。

除了找到場景外,Gemini 還可以計算隨時間重複的動作和單個物體。該工具不僅限於觀察圖像,因為它根據開發者提出的任務性質結合幀、音頻和文字記錄。

Google 認為,這種自主選擇使模型能夠將資源集中在真正重要的時刻和信號上。結果是一種不那麼僵化的分析流程,在這個流程中,人工智慧決定檢查什麼、以什麼速度進行以及以何種模式進行,然後再給出回應。

到目前為止,Gemini 使用靜態處理,預設每秒取樣視頻一幀,儘管開發者可以通過 API 調整該設置。自 2025 年推出原生視頻分析以來,該系統將幀的研究與音頻軌道的文字記錄相結合。

基於代理的方法將模型的推理直接連接到原生視頻工具。根據 Google 的說法,Gemini 可以啟動搜索循環,檢索文件的特定部分,觀察結果並決定是否需要查詢另一個片段、提高取樣速度或改變模式。

在長材料中,效率的優勢更加明顯,這些材料可以從 10 分鐘的教程到 90 分鐘的講座和數小時的文件。使用靜態方法時,開發者必須在承擔高標記消耗和使用自己的選擇性技術之間做出選擇,後者可能會忽略相關細節。

Google 表示,其在 1H-VideoQA 和 LVBench 的結果顯示標記使用量下降了 88%,同時準確性略有提高。在公司的 1H-VideoQA 評估中,Gemini 3.7 Flash 以基於代理的分析達到最低查詢成本的最高準確性,根據公司提供的數據。

該公司還將 LongVideoBench 包含在用於比較模型性能的測試中。在該評估集內,Google 將 Gemini 3.7 Flash 描述為具有最佳整體質量和最佳準確性與成本效率組合的選擇。

這些結果是 Google 的聲明,反映了其自身的基準,因此並不單獨等同於對所有使用場景的獨立驗證。儘管如此,潛在的節省對於處理大型視聽庫的應用可能是相關的,特別是當每次查詢需要尋找特定時刻而不是描述整個視頻時。

基於代理的分析已經在上傳的視頻和 YouTube 視頻中通過 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 中啟用。開發者必須在 API 中將處理模式設置為 "agentic" 以啟用選擇性行為。

Google 計劃在稍後的日期將該技術擴展到其自己的產品。該公司希望不久將其帶給所有使用 Flash 和 Flash Lite 設備的 Gemini 應用程序用戶,而在接下來的幾個月中,還計劃在播放頁面中的 Ask YouTube 功能中使用它。

-- 價格

--
--
--

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com