EPISODE · Sep 15, 2026 · 2 MIN
RSIAgent 讓代理累積操作經驗,再用唯讀記憶處理任務
from EasyVibeCoding Podcast · host Biwei Huang
RSIAgent 讓代理累積操作經驗,再用唯讀記憶處理任務。Biwei Huang 的貼文運作機制 RSIAgent 以 Kimi-K3 與 GLM-5.3 作為基礎模型,在不更新模型權重的情況下,讓代理自行探索環境、執行任務、驗證結果,再把穩定的經驗存入持久記憶。作者將這套做法稱為遞迴自我改良(RSI),流程分成三個階段:廣泛探索:平行嘗試多種任務,取得不同面向的經驗。 深度探索:延續既有練習,把經驗連結到目標任務。 測試期重用記憶:執行代理(Actor Agent)讀取已凍結的記憶,並與驗證代理(Verifier Agent)反覆執行及檢查任務。這裡的驗證是代理檢查工作結果;正式評測則在任務執行與驗證結束後,另外以封存的評分流程計分。獨立嘗試之間會重設任務環境與互動歷史,代理框架維持不變。成功與失敗都能成為學習材料;正式評測分數不進入學習迴圈。示範案例 影片以 REAPER 音訊編輯與 FreeCAD 3D 建模說明探索、整理經驗與重用記憶的流程。這些是壓縮重播與選取的歷史學習記錄,不是一次新的代理執行。REAPER 案例顯示記憶檔案由 13 個增至 17 個,測試時只讀取既有記憶。FreeCAD 案例呈現交叉檢查圖面單位、視圖與尺寸,以及重新開啟 STEP 模型檢查幾何的工作;片尾明示模型來自首次評測的封存結果,仍保留幾何錯誤,不能把重新開啟模型當成驗證成功。RSIAgent 在 REAPER 與 FreeCAD 中探索與重用記憶的歷史示範重播評測結果 作者報告了未啟用 RSI 與啟用後的平均部分得分。部分得分會計入任務完成部分要求時取得的分數,不能當作完整任務成功率。下圖整理 README 的兩項結果;RSI 欄混合已記錄的 RSI 結果與保留的基準分數,不能視為所有任務都重新完成 RSI 評測。作者報告的平均部分得分;RSI 聚合結果混合已記錄結果與保留的基準分數,評測條件不完全一致。來源:RSIAgent README 與評測報告。評測範圍與限制 這些是作者報告的聚合結果,評測條件並不完全一致。OSWorld 的 82 項任務中,41 項使用已記錄的 RSI 分數,另外 41 項沿用基準分數。Agents’ Last Exam 的 67 項近期任務中,19 項使用 RSI 欄位結果,其餘 48 項保留基準分數,包含 3 項 GPU 基準結果。聚合資料也納入特定重試、檢查點、不同預算、本機重新評分與評測流程變體。因此,這些分數不能證明 RSIAgent 在相同評測條件下全面勝過 GPT-6 Astra。階段消融比較只涵蓋 T080、T085、T089 與 T106 四項任務,而且是從已記錄改善的任務中選出;它不是隨機抽樣的整體效果估計。失敗模式 作者指出,探索可能錯過真正的弱點,驗證代理可能接受未完成的成果,記憶彙整也可能保留錯誤規則。改善幅度取決於探索、驗證與記憶整合的品質,光增加練習次數仍不足以保證進步。原文:https://easyvibecoding.app/curated/3339-rsiagent-reusable-memory-raises-osworld-2-0-score-78-98
Embed this episode
Ready to play
RSIAgent 讓代理累積操作經驗,再用唯讀記憶處理任務
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.