Meta 創建 AI 過濾器以選擇實驗,節省 GPU 時間
Meta FAIR 推出了 AI 研究偏好模型(AI Research Preference Models),這是一個在執行機器學習實驗之前對其進行分類的系統,以減少 GPU 的消耗。在 AIRS-Bench 測試中,該工具將平均分數從 0.684 提升至 0.729,並在約 15 小時內達到了與 24 小時訓練相當的結果。
- RPM 比較未執行的候選者,並允許代理僅選擇最有前景的實驗。
- 代理變體的標準化平均分數為 0.729,而沒有該系統時為 0.684。
- 這兩個版本在約 15 小時的計算中達到了 24 小時基準模型的結果。
自主研究中的人工智慧面臨著一個不那麼引人注目的問題:驗證想法需要時間、金錢和計算能力。一個代理可以提出數十種對機器學習模型的修改,但每次完整訓練可能會消耗數小時甚至數天的 GPU,因此預先選擇成為過程中最重要的決策之一。
Meta 的 FAIR 團隊與牛津大學和倫敦大學學院的研究人員共同推出了 AI 研究偏好模型,簡稱 RPM。該系統並不試圖猜測絕對分數或準確預測實驗的最終結果,而是對尚未執行的候選者進行排序,並選擇哪一個值得首先進入昂貴的訓練階段。
在計算支出之前的過濾器
該提案源於對語言模型的限制的檢測:儘管它們可以推理計劃、代碼和搜索歷史,但在直接預測執行指標時並不可靠。因此,RPM 採取了一個更狹窄的任務,對比兩個候選者並根據可用證據決定哪一個看起來是更有前景的研究方向。
該機制集成在 AIRA-dojo 中,這是一個進化樹搜索環境,貪婪地選擇父代並使用 Draft、Improve 和 Debug 操作符。代理不會生成一個子代、執行它並重複過程,而是並行應用一個操作符 15 次,收集未測試的候選者並通過配對比較組織淘汰賽。
只有該淘汰賽的獲勝者才能進入執行階段,而每次比較都會通過寬度優先搜索的路徑獲取探索過的節點的上下文。該上下文包括之前的實驗及其獲得的驗證分數,這些信息使評判者能夠區分可行的改進、冗餘的變化和仍然可以修正的錯誤。
這種方法改變了代理的核心問題。與其要求它預測每個提案的表現,不如要求它確定哪一個值得消耗下一個資源塊,這一決策更接近於研究人員在有限預算下優先考慮假設時所做的評估。
兩個版本的不同成本
該團隊評估了一個僅基於推理的 RPM 變體和一個具有代理能力的變體。在第一種情況下,一個凍結的語言模型作為評判者,檢查候選計劃、代碼和搜索歷史,而不進行額外實驗,同時一個優化的 MIPROv2 由 DSPy 指導其決策。
該評分標準試圖重現主要研究人員的標準:容忍可修正的錯誤,獎勵可以擴展的想法,並懲罰重複已探索工作的方向。該版本的離線準確率在 57.7% 到 59.0% 之間,這表明選擇相較於隨機性有所改善,儘管仍然遠未達到完美標準。
代理版本使用相同的法官,但允許在一個隔離的環境中運作,該環境克隆了代理的工作空間並包含一個唯一的 H200。它的工具包括 python、bash 和 submit_solution,通過這些工具執行小規模的試點測試,然後決定是否繼續某個方向或結束研究週期。
設計中包含兩個直接影響系統行為的決策。為了避免過早停止,剩餘預算顯示為 2,700 秒,儘管實際可用時間為 300 秒,並且試點限制為 30 次,閾值為 60 秒;此外,代理選擇器僅在 Draft 和 Improve 階段介入,因為 Debug 會回到隨機選擇,以免因額外評估而消耗時鐘。
與隨機選擇的結果比較
測試在 AIRS-Bench 上進行,包含 20 個公共文本和表格數據任務,每個任務的計算時間為 24 小時,使用一台 H200 和 10 個種子。Qwen3.6-27B 作為研究操作員和 RPM 的支柱,這是一個旨在將改進歸因於選擇層而非引入更強大法官的條件。
不使用 RPM 的隨機選擇作為參考,獲得了 0.684 的平均標準化分數。僅基於推理的模型將該數字提高到 0.711,而代理版本達到了 0.729;使用驗證預言機和測試預言機計算的上限分別為 0.748 和 0.759。
在達到基準模型結果的速度上也出現了差異。推理變體在 14.88 小時內達到了最終分數 0.684,相當於加速 1.61 倍,而代理系統在 15.50 小時內達到了 1.55 倍的改進,對比 24 小時的基準。
這一收益並未消除所有成本:自我托管的推理每次執行增加了 0.660 小時。調整該時間後,對應版本的報告性能為 0.708,耗時 23.34 小時,顯示實際優勢取決於過濾器的質量和執行基礎設施的效率。
突出結果與提案的限制
報告將兩個新的基準結果歸因於 RPM 的變體。在 WinoGrande 中,代理系統達到了 94.1%,高於之前名為 AIRA₂ 的代理系統的 90.4%;而僅基於推理的版本在 SVAMP 中獲得了 95.7%,相比之下,之前的人類結果為 94.2%。
這些數字並不意味著選擇器可以取代實驗評估,因為 RPM 仍然需要執行所選候選者並驗證其性能。它的貢獻在於減少進入該階段的提案數量,這在 GPU 能力決定團隊可以探索多少假設的場景中是一個重要的差異。
架構還顯示,自治不僅僅依賴於給予代理更多工具。當系統組織預算、保留先前測試的上下文並在承諾資源之前比較替代方案時,性能會改善,儘管設計決策,如預算的高估和 Debug 回到隨機性,揭示了仍然是實驗性的妥協。
該提案部分可部署:AIRA-dojo 和 AIRS-Bench 是開源的,所使用的 LLM 保持凍結,Qwen3.6-27B 擁有開放權重。然而,使用 H200、自我托管推理的成本以及對短期試點的依賴表明,將這些結果轉移到其他環境需要獨立測量基礎設施、任務和預算。
MarkTechPost報導,這項工作由Meta的FAIR團隊與牛津大學及倫敦大學學院共同開發,並提出了RPM作為AI研究代理的優先層。最重要的結果,超越了一個具體數字,是將實驗選擇轉變為機器學習循環中的一個明確組件,而不是依賴隨機生成或代理的直覺。
該報告還指出,相較於沒有RPM的配置,推斷變體的預估改善概率為0.5923,代理變體為0.5913,95%置信區間的下限分別為0.5066和0.5018。這些數據表明了一定的統計優勢,並建議將結果解讀為有前景的證據,而非對該方法在任何研究問題上都能有效的保證。
對於預算緊張的團隊來說,吸引力在於能在相同的可用時間內獲得更多有用的探索。這一理念仍需在更多任務和配置中得到驗證,但它為一個日益增長的緊張局勢提供了具體的解決方案:代理可以越來越快地生成實驗,而執行這些實驗的能力仍然稀缺且成本高昂。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

CZ訪問吉爾吉斯斯坦凸顯國家支持無法保證穩定幣的退出

當 Polymarket 等走向「幕後」:預測市場的下半場,在交易所之外?

2026 上半年 Polymarket 報告:高頻交易員,還是超級預測者?

IFM推出K2 Horizon,一個開放的AI系列,參數高達3750億

尼泊爾向聯合國氣候基金請求25億美元以應對毀滅性洪水

亞馬遜貨機在邁阿密著陸時墜毀,造成多名傷者

如何挖掘比特幣:新手挖掘BTC指南 - 2026年四大雲端挖礦網站
![[社論] 比民主更重要的,是自由](/public-static/29_4631d65680.png?format=avif)
[社論] 比民主更重要的,是自由

經濟:中國向金融系統注入540億美元

百度股票通行:股票在一個月內能上漲20%嗎?

日本公司能否在AI晶片領域擊敗Nvidia十倍?

2026 年 9 月 WEEX 上 AI 與人類加密貨幣交易獎勵對比

AI 交易應用程式適合加密貨幣嗎?深入了解 WEEX AI Wars 黑客松

特朗普的支持率降至33%,在期中選舉前壓力加大

墨西哥:一個與音樂家及其家人謀殺案有關的150萬美元比特幣錢包

加密貨幣:一個家庭在雷恩附近被錯誤地綁架和暴力對待

波場 TRON 行業週報:非農偏鷹但 CPI 將決定 BTC 能否站穩 8 萬,詳解構建數位內容與 IP 資產化的 KOR Protocol








![[訪談] 朴昌範韓資評董事長:應透過國內交易所允許海外幣投資](/public-static/40_d9655504cd.png?format=avif)


