Google Dream-RSI 將 Agent 探索呼叫量最高降低 162 倍:AI 自我改善的下一個競爭點是成本
Google Dream-RSI 將 Agent 探索呼叫量最高降低 162 倍:AI 自我改善的下一個競爭點是成本
Dream-RSI 沒有更換底層程式設計 Agent,而是重複利用過去的探索歷史,降低改善探索策略所需的線上執行成本。對企業而言,未來評估 AI Agent,可能不只要問能力提升多少,還要問:每一次改善需要付出多少成本?
Dream-RSI 沒有更換底層程式設計 Agent,而是重複利用過去的探索歷史,降低改善探索策略所需的線上執行成本。對企業而言,未來評估 AI Agent,可能不只要問能力提升多少,還要問:每一次改善需要付出多少成本?
談到遞迴自我改善(Recursive Self-Improvement, RSI),外界通常先想到一個問題:AI 能不能讓自己變得更強?
Google、Google DeepMind、馬里蘭大學與維吉尼亞大學研究團隊提出的 Dream-RSI,則把問題往另一個方向推進:如果 AI 要持續改善自己的探索策略,每一次改善需要付出多少成本?
Dream-RSI 沒有更換底層的程式設計 Agent,而是在 Agent 之上加入一層輕量化的編排機制,讓系統可以調整探索策略,包括如何分支、如何平行搜尋,以及何時停止。
過去完成的搜尋歷史則被保存成「歷史探索樹」,進一步成為可以重播的模擬環境,用來測試新的探索策略。
這項設計的重要性,不只是 Agent 變得比較省。
它顯示,AI 自我改善的瓶頸,可能不只在模型本身是否足夠強,也在於改善流程是否能避免一再為相同的探索付費。
162 倍成立,但不是所有任務都能降低 162 倍
Dream-RSI 最吸睛的數字,是最高 162 倍較少的探索 Agent 呼叫次數。但這個數字必須放回實驗條件中理解。官方資料顯示,162 倍出現在 Lasso 演算法工程任務,比較對象是 SimpleTES。
如果改用研究團隊設定的受控基準 Recursive Fixed Exploration,Dream-RSI 的探索 Agent 呼叫次數改善約為 1.7 倍。
其他任務的改善幅度也不同。在 GPU 核心程式工程中,Dream-RSI 在 VGG16 與 LayerNorm 上,分別以約 2.43 倍與 1.79 倍較少的生成次數達到相近表現;在 ConvDiv 與 ConvMax,則是在相近運算預算下,分別取得約 2.09 倍與 1.44 倍較高效能。
因此,企業不應把 Dream-RSI 解讀為:
AI 自我改善成本已經普遍下降 162 倍。
AI 自我改善成本已經普遍下降 162 倍。
更準確的判斷是:
在部份探索型任務中,改善探索策略所需的線上 Agent 執行成本,可以因重複利用歷史搜尋而大幅下降。
在部份探索型任務中,改善探索策略所需的線上 Agent 執行成本,可以因重複利用歷史搜尋而大幅下降。
162 倍是標題數字。真正值得追蹤的,是它背後的成本機制。
Dream-RSI 改善的不是模型,而是改善循環
Dream-RSI 與一般「推出更強模型」的路線不同。在受控實驗中,底層程式設計 Agent 保持不變;改善發生在探索策略與編排層。
這個差異很重要。假設一個 Agent 每次要改善工作策略,都必須重新跑數百或數千次提案、評估與執行,那麼即使每一輪都能找到更好的策略,自我改善本身也可能變得非常昂貴。
Dream-RSI 的做法,是把過去已經完成的探索流程保存成歷史探索樹。
新的探索策略,不需要立即重新執行完整搜尋,而是先在這些歷史紀錄中重播,取得對替代策略的回饋。表現較好的策略,才重新部署到線上探索環境。
這等於把過去已經支付過成本的探索經驗,轉化成下一輪改善的測試環境。
它不是零成本。
新的探索樹仍需要真正的 Agent 呼叫建立,策略產生、評分、編排與其他計算本身也需要成本。
但重播機制可以減少大量重複的線上探索。
新的觀察單位,可能不只是基準測試,而是改善效率
這讓 AI Agent 的能力評估出現一個值得企業開始追蹤的新維度。
過去企業與研究團隊通常會看:
基準測試提高多少
模型準確率提高多少
Agent 任務成功率提高多少
每次推論成本降低多少
如果 Agent 開始具備持續改善探索策略的能力,還可能需要多看一個指標: 能力提升 ÷ 改善成本
這不是 Dream-RSI 論文原始指標,而是 InfoAI 對這項研究提出的 Decision Intelligence 視角。
它要回答的問題是:
為了得到下一單位的能力提升,系統需要支付多少額外探索、推論、評估與執行成本?
為了得到下一單位的能力提升,系統需要支付多少額外探索、推論、評估與執行成本?
這和單純追基準測試有很大差異。
一個系統可能每一輪都能提高效能,但如果每次改善循環都需要重新支付大量模型呼叫與搜尋成本,商業上未必划算。
另一個系統即使使用相同底層模型,如果能夠重播歷史探索、降低重複測試成本,就可能產生完全不同的經濟性。
底層模型可以相同。
改善成本卻可能完全不同。
Agent 的歷史紀錄,可能從稽核資料變成改善資產
這項研究也帶出另一個值得企業注意的第二層影響。
今天企業保存 Agent 執行紀錄,主要理由通常是:
稽核
問題追蹤
合規
安全調查
執行追溯
Dream-RSI 提出的機制,則讓歷史紀錄多出另一種可能用途:成為未來 Agent 改善策略的重播環境。
如果這類以歷史重播為基礎的改善方式,未來證明具有企業部署價值,企業可能需要重新思考 Agent 歷史資料的角色。
重要的可能不只是保存「Agent 做了什麼」,還包括是否保存足夠完整的:
探索路徑
分支決策
工具呼叫
中間結果
評估結果
停止判斷
這些紀錄未來有可能從一般稽核資料,轉變成可以被重新利用的經驗資產。
但目前這仍然是合理推論,而不是成熟的企業架構。
Dream-RSI 目前仍是一篇預印本,公開程式與重現工具也尚不足以讓外部團隊把這項方法視為已獨立驗證的正式生產技術。
對企業而言,真正需要追蹤的是改善循環的成本效率
Dream-RSI 現在還不構成企業應立即部署遞迴自我改善系統的理由。但它提供了一個值得納入 Agent 技術評估的新問題:這個 Agent 是否只會完成工作,還是能以可接受的成本持續改善完成工作的方式?
如果答案開始變成後者,那麼企業未來比較 Agent 系統時,就不能只比較基礎模型與基準測試。還需要比較:
每次改善需要多少 Agent 呼叫
是否能重複利用過去探索
改善週期需要多久
歷史探索是否可以重播
每一單位能力提升的邊際成本
改善後的效能是否足以覆蓋額外成本
這些變數最後都指向同一個問題:自我改善的成本效率。
Decision Intelligence
Dream-RSI 最值得注意的,不是 162 倍本身。162 倍只是一個特定實驗設定下的結果。真正值得企業追蹤的,是 AI 自我改善開始可以被拆解成一個更具體的工程問題:能力能不能提升,是第一個問題。提升一次需要付出多少成本,是第二個問題。
如果未來 AI Agent 能夠持續重複利用自己的搜尋歷史,讓每一次策略改善的成本逐步下降,那麼不同 Agent 系統之間的差距,可能不只來自誰用了更強的模型。
還可能來自誰擁有更有效率的改善循環。
對企業而言,未來評估 AI Agent 的問題,可能因此從:
這個 Agent 有多強?
這個 Agent 有多強?
逐漸增加另一個維度:
這個 Agent 能以多高的效率持續改善?
這個 Agent 能以多高的效率持續改善?
這才是 Dream-RSI 比「最高降低 162 倍」更值得持續觀察的訊號。
作者=InfoAI 編輯部
你不需要讀完所有 AI 新聞。你需要掌握的是:哪些變化值得關注、哪些應用值得理解、哪些風險不能忽略,以及這些訊號可能如何影響企業決策。
訂閱 InfoAI 電子報,把全球 AI 訊號,轉化為更清楚的商業判斷。
InfoAI Line 群提供最新文章發佈通知,讓你不用每天上網查看,也能快速掌握新上線的 AI 產業解讀、應用案例與知識內容。
版權聲明與授權須知
本內容由 InfoAI 擁有著作權。如有引用、轉載或任何商業用途的需求,請來信聯絡: contentpower688@gmail.com。
AI 協作與人工編輯聲明
本文由 InfoAI 編輯部進行主題判斷、內容策劃、事實查核與文字編輯,並使用 AI 工具協助資料整理與內容製作。最終觀點、內容取捨與發佈版本均由人工編輯確認。
你不需要讀完所有 AI 新聞,你需要知道的是:
有哪些變化值得注意,可能會如何影響你的產業、工作與決策。


