編輯:馬青禾
圖片:秦明理
排版:蘇雅韻
新聞發布入口:https://news.zhenrobot.com
【編者按】Cappy 表明,小模型協同正成為提升大模型多任務效率的重要路徑。
▍ 谷歌 Research 發布 Cappy:用 3.6 億參數小模型提升多任務大語言模型表現
谷歌 Research 近期推出了一種名為 Cappy 的新方法。它是一種面向多任務大語言模型(LLM)的輕量級評分模型,旨在不直接微調大模型參數的前提下,提升多任務場景中的效能和適應效率。實驗表明,Cappy 僅憑 3.6 億參數,便在多項語言理解任務上超越了 OPT-175B 和 OPT-IML-30B,並取得了與現有主流多任務模型(如 T0-11B 和 OPT-IML-175B)相當的準確率 [來源: research.google]。
對台灣 AI 開發者而言,這項工作的關鍵訊號很明確:在「更大的模型」之外,圍繞「打分、篩選、重排」的小模型協同機制,正在成為提升大模型能力和降低落地成本的重要路徑。
▍ 多任務大語言模型面臨效果與成本的雙重挑戰
近年來,LLM 推動了自然語言處理進入以「指令跟隨」為核心的新典範。以 T0、FLAN、OPT-IML 為代表的多任務模型,通常會先將不同任務轉換成「指令—回答」形式的資料,再訓練模型根據輸入指令生成答案。事實證明,這類方法不僅能處理訓練中見過的任務,也能在一定程度上泛化到新任務。
但這一典範也帶來了明顯問題。由於模型需要理解並完成大量不同類型的任務,僅靠指令進行統一建模的難度較高,因此多任務 LLM 往往擁有數十億到數千亿參數,例如 FLAN-11B、T0-11B、OPT-IML-175B,甚至更大規模的 FLAN-PaLM-540B。這樣的體量意味著訓練與推論都需要大量算力和 VRAM 支援,部署成本較高,適配效率也有限。
此外,部分能力最強的多任務模型並未開放參數,開發者難以直接改造。現實應用中,單一模型也很難在 zero-shot(零樣本)條件下穩定覆蓋所有複雜任務,尤其是客製化任務或難以用簡潔指令描述的任務。與此同時,下游監督資料往往不足,單獨訓練任務模型又難以充分利用大模型已有知識。
▍ Cappy 的核心理念:讓小模型學會「答案評分」
Cappy 並不是新的生成式大模型,而是一個評分模型。它的輸入是「指令—回答」對,輸出為 0 到 1 之間的分數,用於估計該回答相對於指令的正確程度。
這一設計的關鍵在於,Cappy 不負責直接生成答案,而是學習判斷「哪個答案更好」。從工程視角看,這相當於在大模型之外增加一個輕量級的品質評估層,用更低的成本幫助系統選擇更優結果,或在下游任務中更高效地完成適配。
▍ 訓練資料構建:從弱監督回歸資料中學習正確性判斷
在資料構建上,谷歌 Research 沿用了與 T0 相同來源的多任務資料集,包含來自 PromptSource 的 39 個多樣化資料集,涵蓋問答、情感分析、摘要等多種任務類型。每個資料集都透過模板被轉換為指令和標準答案配對。
由於 Cappy 需要學習「回答正確性」的連續分值,研究團隊進一步構建了帶有 correctness annotation(正確性標註)的回歸資料。具體而言,對於每個生成任務樣本,先藉助現有多任務 LLM 基於同一指令採樣生成多個回答,再將這些回答與標準答案進行比較,並用 Rouge-L 計算二者相似度,作為 0 到 1 之間的弱監督訊號。
最終,團隊獲得了約 1.6 億條帶分數標註的回歸訓練樣本,並在 RoBERTa 模型基礎上進行持續預訓練,得到最終的 Cappy。整個訓練過程運行在谷歌的 TPU-v4 上,並使用輕量化分散式訓練工具 RedCoast。
▍ 與常見的適配方法相比,Cappy 佔用更少的 VRAM,更適合閉源模型
從適配方式看,Cappy 面向的是一個長期存在的行業問題:如何不大規模改造 LLM 的情況下,利用下游監督資料提升任務表現。
現有的參數高效微調方法,如 prompt tuning 和 adapters,雖然降低了儲存成本,但在訓練過程中通常仍需對大語言模型參數路徑進行反向傳播,因此 VRAM 開銷依然不低。另一類上下文學習方法則透過在輸入中拼接少量樣本來引導模型,但受限於上下文長度,可利用的訓練樣本數量較少。
Cappy 的優勢在於,它不需要對 LLM 參數做反向傳播,也不依賴存取底層模型權重,因此能夠與僅透過 Web API 提供服務的閉源多任務模型配合使用。相比 in-context learning,Cappy 也不受模型最大輸入長度的硬性限制,理論上可以整合不限數量的下游訓練樣本。
研究團隊還指出,Cappy 不僅可以獨立使用;還可以與微調和上下文學習相結合,以進一步提升整體效能。
▍ 評測結果:3.6 億參數模型達到主流多任務大模型水準
在 PromptSource 提供的 11 個未參與訓練的語言理解分類任務上,Cappy 展現出很強的參數效率。實驗結果表明,擁有 3.6 億參數的 Cappy 超過了 OPT-175B 和 OPT-IML-30B,並且達到了與當前表現最好的多任務 LLM——T0-11B 和 OPT-IML-175B——相當的準確率。
這一結果說明,基於評分的預訓練策略可能具備獨特價值。與傳統多任務 LLM 主要依賴 teacher-forcing(教師強制)訓練、只學習標準答案不同,Cappy 在訓練中顯式區分高品質與低品質回答,等於引入了更強的對比訊號。這種「會判斷好壞」的能力,成為其以更小參數規模取得競爭力表現的重要原因。
值得注意的是,文中還將 Cappy 與預訓練 RLHF reward model(基於人類回饋強化學習的獎勵模型)進行了對比,結果顯示其整體表現處於現有多任務模型中的領先梯隊。
▍ 在複雜的 BIG-Bench 任務上,Cappy 顯著提升了 FLAN-T5 的表現
除了標準語言理解任務,研究團隊還測試了 Cappy 在複雜任務上的適配能力。實驗選擇了 BIG-Bench 中 45 個生成式任務,這些任務沒有預設選項,通常被視為超出許多 LLM 基礎能力範圍的高難度任務。評估指標採用 Rouge-L,並統計全部 45 個測試集的平均得分。
在這項實驗中,我們使用了不同規模的 FLAN-T5 作為骨幹 LLM,同時保持基礎版 FLAN-T5 的參數凍結不變。結果表明,Cappy 能夠在所有模型規模上持續提升 FLAN-T5 的效能,並且顯著優於那些依賴模型自身打分的基線方法。這裡所說的「自身打分」,是指使用 LLM 的交叉熵來選擇候選答案。
這意味著,Cappy 不僅在常規基準上有效,在複雜生成任務中同樣具備較強的增強作用。對於關注 Agent、複雜工作流和任務分解的開發者來說,這一點尤其值得關注,因為實際應用中的很多問題本就更接近 BIG-Bench 這類開放式複雜任務,而非標準分類題。
▍ 對開發者的啟示:小型評分模型可能成為大模型落地的新基礎設施
Cappy 的意義不只於「以小博大」,更在於它提供了一種不同於傳統微調路線的產品化思路。過去行業更多關注如何訓練更大的生成模型,或如何對大模型本體進行低成本微調;而 Cappy 展示了另一條路線:透過獨立的 scorer(評分器)為大模型提供選擇、過濾和任務適配能力。
對新創公司和應用團隊而言,這種方法有幾方面現實價值。第一,能夠減少對 VRAM 和訓練資源的依賴,降低適配門檻。第二,能夠服務閉源 API 模型,適用範圍更廣。第三,不受上下文視窗限制,更適合吸收大量下游樣本。第四,作為外部模組,它更容易和現有生成、檢索、排序鏈路結合,進入 RAG、Agent 和工具呼叫系統中。
從行業競爭角度看,Cappy 也說明,多任務 LLM 的能力提升未必只靠擴大參數規模完成。圍繞 reranking(重排)、reward modeling(獎勵建模)、response selection(回應選擇)和弱監督資料構建的系統性最佳化,正在成為模型能力提升的重要組成部分。
▍ 總結
谷歌 Research 推出的 Cappy,是一種基於評分的多任務 LLM 增強方案。它透過學習「指令—回答」對的正確性分數,在無需反向傳播大模型參數、無需存取閉源模型權重的前提下,提升多任務模型在下游任務上的表現。
實驗結果顯示,3.6 億參數的 Cappy 已能在多項任務上達到甚至超越更大規模模型的表現;在 BIG-Bench 的 45 個複雜生成任務上,也能為凍結參數的 FLAN-T5 帶來明顯增益。對於台灣 AI 圈而言,Cappy 最值得關注的地方在於:評分模型正在從輔助元件,逐漸演變為大模型應用架構中的關鍵能力層。
隨著大模型落地進入成本、效率與可控性並重的新階段,像 Cappy 這樣的小模型協同方案,或將成為下一輪產品創新和工程最佳化的重要方向。
▍ 參考來源
research.google/blog/cappy-outperforming-and-boosting-large-multi-task-language-models-with-a-small-scorer
Cappy: Outperforming and boosting large multi-task language models with a small scorer
End
感謝您的耐心閱讀