Google 重磅發布 WikiSkill,技能可以自己進化了!

Datawhale 乾貨

作者:Google Research 團隊

一個 Agent 到底憑什麼越來越強?有人靠更大的模型,有人靠更多數據。就在前天,Google Research 最新發布的 WikiSkill 給出了另一條答案:給 Agent 搭一套三層知識架構,讓技能自己進化。

圖片

論文連結:https://arxiv.org/abs/2608.27454

這套架構的核心是把「經驗」和「知識」分開。以前的技能進化方法(EvoSkill、Trace2Skill、SkillOpt)分析完執行軌跡就直接改 Skill,經驗用一次就丟。WikiSkill 在中間加了一層持久知識庫,讓經驗先沉澱、再重用。

圖片

一、三層架構:把經驗、知識和技能分開

第一層 Raw Layer:保留原始軌跡,給進化留下事實依據

Raw Layer 儲存每次迭代的執行軌跡,包括 Agent 的完整推理過程、工具調用、輸出結果。這一層不可變,目的是保留「到底發生了什麼」的原始記錄。

為什麼單獨存一層?因為後續兩層都需要回溯原始軌跡來分析問題。Wiki Maintainer 要從中提取成功和失敗模式,Skill Proposer 要按需查閱具體任務是怎麼執行的。如果原始數據被覆蓋或丟失,整個進化過程就失去了事實基礎。

第二層 Wiki Layer:讓一次性經驗變成可重用知識

Wiki Layer 是整個架構的核心。它把原始軌跡編譯成結構化知識,跨迭代持續累積。包含三個部分:

• patterns/:每個模式一個 markdown 檔案,記錄具體的失敗原因或成功策略,帶可操作的修復方案

• logs.md:進化日誌,按迭代記錄發現了什麼、改了什麼

• skill-impact.md:哪些 Skill 改動被接受、哪些被拒絕,帶完整 diff

這一層有兩個關鍵設計。

第一,Wiki 永不回滾。Skill 被拒絕時,Skills Layer 回到上一版本,但 Wiki 保留所有累積的知識。下一輪 Proposer 能看到「上次這個改法為什麼被拒」,避免重複踩坑。

第二,Knowledge 和 Skill 分離。知識回答「我們知道什麼」,技能回答「我們該怎麼做」。以前的方法把兩者混在一起,改技能時丟失了背後的推理脈絡。WikiSkill 讓知識持續累積,技能從知識裡生長。

第三層 Skills Layer:可執行技能,帶溯源

Skills Layer 是當前生效的技能集合。每個技能目錄有兩個檔案:

• SKILL.md:技能內容,Agent 執行任務時直接讀取

• PURPOSE.md:記錄這個技能是為了解決 Wiki 裡的哪個 Pattern 而建立的

PURPOSE.md 解決的是「這個技能為什麼存在」的問題。當技能需要修改時,Proposer 可以透過 PURPOSE.md 回溯到對應的知識模式,理解當初的設計意圖,而不是盲目地打補丁。

二、進化循環:從執行軌跡到 Skill 更新

每輪迭代跑四步:

1. Inference Agent:用當前 Skill 在訓練集上跑 rollout,產出軌跡到 Raw Layer。訓練時不能存取 Wiki,否則 Agent 會直接查答案,導致軌跡失去參考價值。

2. Wiki Maintainer:分析採樣後的成功和失敗軌跡,做根因分析,更新 Wiki 的 Pattern 目錄和日誌。

3. Skill Proposer:以 ReAct 方式讀 Wiki 索引、查 skill-impact 歷史、按需讀具體 Pattern 頁面和軌跡,然後提出一次 Skill 建立或補丁。

4. Gating:在驗證集上評估候選 Skill,分數提升就接受,否則回滾。Wiki 不受影響。

這個循環的關鍵是第二步和第三步的配合。Wiki Maintainer 把零散軌跡編譯成結構化知識,Skill Proposer 從結構化知識裡生成技能更新。沒有 Wiki 層,Proposer 每次都在從零開始分析原始軌跡。

三、實驗結果:9B 加 Skill,超過 27B 裸模型

圖片

在五個基準、五個模型上的實驗結果:

技能進化與模型規模互補。Qwen 家族內,WikiSkill 帶來的提升隨模型規模遞增:4B +12.3 分,9B +17.5 分,27B +23.9 分。越強的模型從技能進化中獲益越多。

技能可以彌補規模差距。Qwen-3.5-9B + WikiSkill 平均 47.4%,超過 Qwen-3.6-27B 無技能時的 39.4%。9B 加 Skill 超越 27B 裸模型。

技能跨模型家族遷移。Qwen-3.5-9B 用 Qwen-3.6-27B 進化的技能達到 70.2%,用它自己的技能只有 63.4%。這說明「發現策略」和「執行策略」是兩種能力,可以跨模型分工。

消融實驗確認 Wiki 的價值。去掉 Wiki 存取後,平均分從 63.7% 降至 48.7%,回落約 15 個百分點。Wiki Maintainer 累積的跨迭代知識是 Skill Proposer 能解決複雜失敗模式的前提。

圖片

寫在最後:Agent 持續變強,靠的不只是更大的模型

WikiSkill 的貢獻不是一個新演算法,是一個架構設計:把經驗、知識、技能分成三層,讓知識在中間持續累積,技能從知識裡生長出來。

對做 Agent 的人來說,這意味著別再只盯著模型規模和 prompt 調校。搭一套三層知識架構,讓經驗沉澱為知識,讓知識指導進化,才是 Agent 能持續變強的底層邏輯。

圖片

一起「點讚」三連↓

相關文章推薦

分享網址
AINews·AI 新聞聚合平台
© 2026 AINews. All rights reserved.