GoogleがWikiSkillを重磅発表、スキルが自ら進化する時代へ!

Datawhaleの干货

著者:Google Researchチーム

エージェントは一体何によって強くなっていくのか?より大きなモデルに頼る者もいれば、より多くのデータに頼る者もいる。一昨日、Google Researchが発表したWikiSkillは、別の答えを示した。エージェントに三層の知識アーキテクチャを構築し、スキルを自ら進化させるのだ。

画像

論文リンク:https://arxiv.org/abs/2608.27454

このアーキテクチャの核心は、「経験」と「知識」を分離することにある。従来のスキル進化手法(EvoSkill、Trace2Skill、SkillOpt)は、実行軌跡を分析した後、直接スキルを修正しており、経験は一度使われたら捨てられていた。WikiSkillは中間に永続的な知識ベース層を追加し、経験をまず蓄積させ、その後に再利用する。

Image

一、三層アーキテクチャ:経験・知識・スキルを分離する

第一層 Raw Layer:生の軌跡を保持し、進化に事実の根拠を残す

Raw Layerは各イテレーションの実行軌跡を保存する。エージェントの完全な推論プロセス、ツール呼び出し、出力結果を含む。この層は不変であり、「実際に何が起こったのか」という生の記録を保持することを目的としている。

なぜ別の層として保存するのか?後続の二層はいずれも生の軌跡を遡って問題を分析する必要があるからだ。Wiki Maintainerはここから成功パターンと失敗パターンを抽出し、Skill Proposerは必要に応じて具体的なタスクがどのように実行されたかを参照する。もし生データが上書きされたり失われたりすれば、進化プロセス全体が事実の基盤を失ってしまう。

第二層 Wiki Layer:使い捨ての経験を再利用可能な知識に変える

Wiki Layerはアーキテクチャ全体の核心である。生の軌跡を構造化された知識にコンパイルし、イテレーションを跨いで継続的に蓄積する。以下の三つの部分で構成される:

  • patterns/:各パターンは一つのMarkdownファイルで、具体的な失敗原因や成功戦略を記録し、実行可能な修正案を付す

  • logs.md:進化ログ。イテレーションごとに何を発見し、何を変更したかを記録する

  • skill-impact.md:どのスキル変更が受け入れられ、どれが拒否されたかを、完全なdiff付きで記録する

この層には二つの重要な設計がある。

第一に、Wikiは決してロールバックしない。スキルが拒否された場合、Skills Layerは前のバージョンに戻るが、Wikiは蓄積された知識をすべて保持する。次のラウンドのProposerは「前回のこの変更がなぜ拒否されたのか」を確認でき、同じ失敗を繰り返すことを避けられる。

第二に、ナレッジとスキルの分離。知識は「私たちは何を知っているか」に答え、スキルは「私たちはどうすべきか」に答える。従来の手法は両者を混在させていたため、スキルを変更する際に背後の推論コンテキストが失われていた。WikiSkillは知識を継続的に蓄積させ、スキルは知識から成長する。

第三層 Skills Layer:実行可能なスキル、トレーサビリティ付き

Skills Layerは現在有効なスキルの集合である。各スキルディレクトリには二つのファイルがある:

  • SKILL.md:スキル内容。エージェントがタスク実行時に直接読み取る

  • PURPOSE.md:このスキルがWiki内のどのパターンを解決するために作成されたかを記録する

PURPOSE.mdは「このスキルがなぜ存在するのか」という問題を解決する。スキルの修正が必要になったとき、ProposerはPURPOSE.mdを通じて対応する知識パターンまで遡り、当初の設計意図を理解することができる。闇雲にパッチを当てるのではない。

二、進化ループ:実行軌跡からスキル更新へ

各イテレーションは以下の四つのステップで実行される:

1. Inference Agent:現在のスキルを用いて訓練セット上でロールアウトを実行し、軌跡をRaw Layerに出力する。訓練時にはWikiにアクセスできない。そうしないと、エージェントが直接答えを参照してしまい、軌跡が参考価値を失ってしまうからだ。

2. Wiki Maintainer:サンプリングされた成功軌跡と失敗軌跡を分析し、根本原因分析を行い、Wikiのパターンディレクトリとログを更新する。

3. Skill Proposer:ReAct方式でWikiのインデックスを読み、skill-impactの履歴を確認し、必要に応じて具体的なパターンページや軌跡を参照した上で、一回のスキル作成またはパッチを提案する。

4. Gating:検証セット上で候補スキルを評価し、スコアが向上すれば受け入れ、そうでなければロールバックする。Wikiは影響を受けない。

このループの鍵は、第二ステップと第三ステップの連携にある。Wiki Maintainerが散在する軌跡を構造化された知識にコンパイルし、Skill Proposerが構造化された知識からスキル更新を生成する。Wiki層がなければ、Proposerは毎回ゼロから生の軌跡を分析しなければならない。

三、実験結果:9Bがスキルを加えて27Bの素のモデルを超える

Image

五つのベンチマーク、五つのモデルでの実験結果:

スキル進化とモデル規模は相補的である。Qwenファミリー内では、WikiSkillによる向上はモデル規模とともに増加する:4Bで+12.3ポイント、9Bで+17.5ポイント、27Bで+23.9ポイント。より強いモデルほどスキル進化からより多くの恩恵を受ける。

スキルは規模の差を補える。Qwen-3.5-9B + WikiSkillは平均47.4%で、Qwen-3.6-27Bのスキルなし時の39.4%を上回る。9Bがスキルを加えて27Bの素のモデルを超えた。

スキルはモデルファミリーを跨いで移転できる。Qwen-3.5-9Bは、Qwen-3.6-27Bが進化させたスキルを用いて70.2%に達したが、自身のスキルでは63.4%に留まった。これは「戦略の発見」と「戦略の実行」が二つの異なる能力であり、モデルを跨いで分担できることを示している。

アブレーション実験がWikiの価値を確認。Wikiアクセスを除去した後、平均スコアは63.7%から48.7%へと約15ポイント低下した。Wiki Maintainerが蓄積したイテレーションを跨ぐ知識こそが、Skill Proposerが複雑な失敗パターンを解決できる前提である。

Image

最後に:エージェントが持続的に強くなるのは、より大きなモデルだけではない

WikiSkillの貢献は新しいアルゴリズムではなく、アーキテクチャ設計にある:経験・知識・スキルを三層に分け、知識を中間で継続的に蓄積し、スキルを知識から成長させることだ。

エージェント開発者にとって、これはモデル規模とプロンプトチューニングだけに注目するのをやめるべきだということを意味する。三層の知識アーキテクチャを構築し、経験を知識へと沈殿させ、知識に進化を導かせることこそ、エージェントが持続的に強くなるための基層ロジックなのである。

画像
関連記事

分享網址
AINews·AI 新聞聚合平台
© 2026 AINews. All rights reserved.