Datawhale 乾貨
作者:Google Research 團隊
一個 Agent 到底憑什麼越來越強?有人靠更大的模型,有人靠更多數據。就在前天,Google Research 最新發布的 WikiSkill 給出了另一條答案:給 Agent 搭一套三層知識架構,讓技能自己進化。
論文連結:https://arxiv.org/abs/2608.27454
這套架構的核心是把「經驗」和「知識」分開。以前的技能進化方法(EvoSkill、Trace2Skill、SkillOpt)分析完執行軌跡就直接改 Skill,經驗用一次就丟。WikiSkill 在中間加了一層持久知識庫,讓經驗先沉澱、再重用。
一、三層架構:把經驗、知識和技能分開
第一層 Raw Layer:保留原始軌跡,給進化留下事實依據
Raw Layer 儲存每次迭代的執行軌跡,包括 Agent 的完整推理過程、工具調用、輸出結果。這一層不可變,目的是保留「到底發生了什麼」的原始記錄。
為什麼單獨存一層?因為後續兩層都需要回溯原始軌跡來分析問題。Wiki Maintainer 要從中提取成功和失敗模式,Skill Proposer 要按需查閱具體任務是怎麼執行的。如果原始數據被覆蓋或丟失,整個進化過程就失去了事實基礎。
第二層 Wiki Layer:讓一次性經驗變成可重用知識
Wiki Layer 是整個架構的核心。它把原始軌跡編譯成結構化知識,跨迭代持續累積。包含三個部分:
• patterns/:每個模式一個 markdown 檔案,記錄具體的失敗原因或成功策略,帶可操作的修復方案
• logs.md:進化日誌,按迭代記錄發現了什麼、改了什麼
• skill-impact.md:哪些 Skill 改動被接受、哪些被拒絕,帶完整 diff
這一層有兩個關鍵設計。
第一,Wiki 永不回滾。Skill 被拒絕時,Skills Layer 回到上一版本,但 Wiki 保留所有累積的知識。下一輪 Proposer 能看到「上次這個改法為什麼被拒」,避免重複踩坑。
第二,Knowledge 和 Skill 分離。知識回答「我們知道什麼」,技能回答「我們該怎麼做」。以前的方法把兩者混在一起,改技能時丟失了背後的推理脈絡。WikiSkill 讓知識持續累積,技能從知識裡生長。
第三層 Skills Layer:可執行技能,帶溯源
Skills Layer 是當前生效的技能集合。每個技能目錄有兩個檔案:
• SKILL.md:技能內容,Agent 執行任務時直接讀取
• PURPOSE.md:記錄這個技能是為了解決 Wiki 裡的哪個 Pattern 而建立的
PURPOSE.md 解決的是「這個技能為什麼存在」的問題。當技能需要修改時,Proposer 可以透過 PURPOSE.md 回溯到對應的知識模式,理解當初的設計意圖,而不是盲目地打補丁。
二、進化循環:從執行軌跡到 Skill 更新
每輪迭代跑四步:
1. Inference Agent:用當前 Skill 在訓練集上跑 rollout,產出軌跡到 Raw Layer。訓練時不能存取 Wiki,否則 Agent 會直接查答案,導致軌跡失去參考價值。
2. Wiki Maintainer:分析採樣後的成功和失敗軌跡,做根因分析,更新 Wiki 的 Pattern 目錄和日誌。
3. Skill Proposer:以 ReAct 方式讀 Wiki 索引、查 skill-impact 歷史、按需讀具體 Pattern 頁面和軌跡,然後提出一次 Skill 建立或補丁。
4. Gating:在驗證集上評估候選 Skill,分數提升就接受,否則回滾。Wiki 不受影響。
這個循環的關鍵是第二步和第三步的配合。Wiki Maintainer 把零散軌跡編譯成結構化知識,Skill Proposer 從結構化知識裡生成技能更新。沒有 Wiki 層,Proposer 每次都在從零開始分析原始軌跡。
三、實驗結果:9B 加 Skill,超過 27B 裸模型
在五個基準、五個模型上的實驗結果:
技能進化與模型規模互補。Qwen 家族內,WikiSkill 帶來的提升隨模型規模遞增:4B +12.3 分,9B +17.5 分,27B +23.9 分。越強的模型從技能進化中獲益越多。
技能可以彌補規模差距。Qwen-3.5-9B + WikiSkill 平均 47.4%,超過 Qwen-3.6-27B 無技能時的 39.4%。9B 加 Skill 超越 27B 裸模型。
技能跨模型家族遷移。Qwen-3.5-9B 用 Qwen-3.6-27B 進化的技能達到 70.2%,用它自己的技能只有 63.4%。這說明「發現策略」和「執行策略」是兩種能力,可以跨模型分工。
消融實驗確認 Wiki 的價值。去掉 Wiki 存取後,平均分從 63.7% 降至 48.7%,回落約 15 個百分點。Wiki Maintainer 累積的跨迭代知識是 Skill Proposer 能解決複雜失敗模式的前提。
寫在最後:Agent 持續變強,靠的不只是更大的模型
WikiSkill 的貢獻不是一個新演算法,是一個架構設計:把經驗、知識、技能分成三層,讓知識在中間持續累積,技能從知識裡生長出來。
對做 Agent 的人來說,這意味著別再只盯著模型規模和 prompt 調校。搭一套三層知識架構,讓經驗沉澱為知識,讓知識指導進化,才是 Agent 能持續變強的底層邏輯。
一起「點讚」三連↓