大模型最難處理的風險之一,是它在沒把握時依然給出很確定的表達。這種高置信度幻覺會讓使用者誤判答案可靠性:模型不僅可能識別不了自己的知識邊界,還可能把內部不確定性表達得過於確定。來自耶魯大學和Google研究院的這篇論文先拆開了一個關鍵概念:大多數校準方法關注事實校準,也就是讓模型輸出的機率匹配外部正確率;但這不等於忠實校準,後者要求模型說出口的不確定性,盡量貼近它自身的內在置信度。
針對這個缺口,研究提出 RLMF(Reinforcement Learning with Metacognitive Feedback,帶元認知回饋的強化學習)。它除了獎勵模型答得好不好,還把「模型能不能準確評估自己這次表現」納入訓練訊號。實驗裡,RLMF在忠實校準任務上相比標準強化學習最高提升63%,自然語言不確定性表達人類評估平均勝率達到96%。這兩個數字有明確邊界:它們限定在不確定性表達和忠實校準任務上,不能理解成整體能力提升。
[圖1:RLMF 概述,配合元認知資料選擇與定向重寫,來忠實地校準LLM在數值和語言上的不確定性表達]
兩階段框架先用RLMF和元認知資料選擇校準數值置信度,再透過定向重寫將其轉換為自然語言中的不確定性表達。
從「事實校準」到「忠實校準」:被忽略的信任缺口
要理解RLMF的價值,必須先釐清兩個極易混淆的概念。事實校準追求的是模型聲稱的置信度與它最終答對的機率一致。如果模型說「我有80%的把握」,在該類預測中它的準確率確實約為80%,就算校準良好。這是學術界慣用的標尺,但它並不關心模型表達出來的不確定性是否貼近內部置信度。
忠實校準要求模型表達出的不確定性與其內部不確定性對齊。一個模型可能在事實校準上表現尚可,卻依然在低置信度時用斬釘截鐵的語氣作答,或者在高置信度時毫無必要地退縮。論文關注的正是這種表達和內部訊號不一致的問題:模型會高置信度生成錯誤答案、無法識別知識邊界,也會誤表達自身不確定性。這比單純答錯更麻煩,因為使用者很難據此判斷該不該相信它。
論文設計了涵蓋6個以上內容領域的10個基準資料集來測試此一能力,從開放域問答到數學推理,從自然語言理解到幻覺偵測,覆蓋了不同格式與難度級別。
RLMF的機制:讓模型學會「自己判卷」
RLMF建立在GRPO(Group Relative Policy Optimization,群體相對策略最佳化)之上。在標準強化學習中,模型為同一個問題生成一批候選回答,然後根據每個回答在準確率、事實校準、格式等方面的表現來計算獎勵,以此決定哪些回答應該被「強化」。
關鍵變化在於引入了一個額外判斷維度:元認知優勢縮放。可以把它理解成「先看答案品質,再看自評品質」:一個候選回答如果任務表現已經高於組內平均值,同時模型對這次表現的自我評估也更準確,就會獲得更強的訓練訊號。具體而言,在GRPO給每個候選回答計算完原始優勢值之後,RLMF會再引入一個係數 Zg 來進行縮放。
Zg衡量的是模型自我評估的準確度:它比較模型「預測」自己這項任務的忠實校準水平,與實際展現出的忠實校準水平之間的差距。差距越小,Zg越接近1,元認知表現越好。這個縮放只作用在任務表現已經高於組內平均值的候選回答上,避免把低品質回答因為「自評看起來不錯」而錯誤強化。
[圖2:論文提出的 RLMF 方法概覽]
在GRPO策略更新過程中,RLMF引入元認知回饋機制:用模型自我判定的準確度來縮放優勢值,從而在最佳化目標任務的同時,也強化模型對自身表現的評估能力。
Figure 2
元認知資料選擇:為什麼要同時看「高分」和「低分」樣本
除了在訓練過程中注入元認知訊號,研究還提出了元認知資料選擇作為配套策略,用來篩選訓練樣本。與常規的「主動學習」思路(只挑模型當前表現最差的樣本)不同,這裡的方案是先讓模型對每個樣本進行自我評估:在不借助外部標準答案的情況下,給自己的回答打一個「我認為我說得有多好」的分數。
隨後,它同時選取兩部分樣本:自我評估得分最高的那一半,和最低的那一半,組成最終的訓練集。論文給出的實驗證據表明,這種「兩極選擇」策略優於只挑最低分樣本的樸素主動學習。背後的邏輯在於,最高分與最低分樣本提供了互補的學習訊號:模型從高分樣本中學習「什麼是自評準確的良好狀態」,從低分樣本中學習「識別並糾正自我認知的偏差」。實驗結果顯示,這種基於元認知訊號的資料篩選方法,在忠實校準指標 cMFG* 上優於隨機取樣和主動學習基線,同時保持了準確率與事實校準水平。
從數字到語言:解耦設計讓AI說出「我不確定」
大語言模型的不確定性表達最終要落到自然語言上,而不僅僅是0到1之間的一個數值。論文的兩階段方案將這個過程做了清晰的解耦。
第一階段,透過RLMF和元認知資料選擇,訓練模型輸出更貼近內部置信度的句子級數值置信度。這意味著模型在回答中的每一句話,都附帶一個對應的不確定性數字標籤。
第二階段,將這些忠實校準後的數值映射為自然通順的、符合語境的模糊限制語。論文建構了一個從置信度到模糊限制語的映射表——比如「我相當確定」「我的初步判斷是」「這一點我的把握很低」——基於人類對大量模糊限制語的感知置信度標註。然後,一個成本相對較低的LLM(實驗中使用了Gemini-2.5-Flash-Lite或GPT-5-Mini)根據這個映射表,將原始回答重寫為帶有恰當模糊限制語的版本。
這種解耦設計帶來一個很實際的好處:第一階段依賴昂貴的強化學習訓練,但只需執行一次;第二階段的語言風格、語氣和受眾適配,可以靈活調整而無需重新訓練模型。例如,面對研究人員時可以保留更精確的分級措辭,面向非專業使用者時則可以改成更容易理解的不確定性表達。
效果與邊界:63%提升和96%勝率告訴我們什麼
論文在Qwen3(1.7B、4B、8B)和Llama3.1-Instruct(8B)等多個模型上進行了系統評估。核心成果有這樣幾組數字值得關注:
在忠實校準任務上,RLMF相比標準強化學習最高提升63%。這個提升是在PopQA上訓練後,再跨多個任務評估得到的;它不等於整體能力提升,也不等於準確率提升。更重要的是,這種提升沒有以犧牲任務準確率或事實校準水平為代價。論文還比較了若干閉源前沿模型配合專門提示詞後的結果,顯示RLMF訓練後的小模型在忠實校準指標上也具備競爭力。
[表1:忠實校準(FC)結果對比基線,透過 cMFG 評估]
藍色列顯示數值校準與語言校準結果,黃色列展示去掉元認知優勢縮放的純RL消融實驗。RLMF在所有資料集上均實現了大於等於0.80的 cMFG 分數,且未損害準確率。資料集縮寫對應:PQA(PopQA)、SA(SelfAware)、SQA(SimpleQA)、HE(HaluEval)、MMLU、SQ(SciQ)、MT(MATH)、UM(UMWP)、AC(ARC-Challenge)、SG(SuperGLUE)。
在自然語言表達的品質上,論文進行了系統的人類評估。評估者對比RLMF框架生成的回答與最強基線方法(FUT)生成的回答,從多樣性、自然度、幫助性和語境適配性四個維度進行打分。結果顯示,RLMF框架在這些維度上取得平均96%的勝率,且評估者間一致性達到0.93。相比之下,基線方法表現出明顯的模式僵化,尤其是在長文本中,模糊限制語的句式單調、重複,而映射與重寫方案緩解了這個問題。這也解釋了為什麼作者要把「數值忠實校準」和「語言重寫」拆成兩個階段。
[圖3:表達置信度 vs. 內在置信度的可靠性圖表,在PopQA上評估]
每格寬度為0.1的內在置信度分箱。FUT和原始模型在低內在置信度下普遍失效,而RLMF在全置信度區間均表現出一致的高忠實度。
幾個值得關注的穩健性證據:RLMF雖僅在PopQA這一個任務上訓練,卻在數學、科學、自然語言理解等差異很大的任務上展現了泛化能力;訓練任務的選取(包括數學推理或幻覺偵測任務)對不同評測任務上的忠實校準結果影響相對穩定;並且,隨著RLMF訓練推進,模型自我評估的準確度(以Zg衡量)也在持續提升。這裡仍要強調,這不等於模型獲得了自我意識,只說明它在「評估自身表現」這個操作性任務上變得更好。
當然,這套方法也有其明確的應用邊界和計算代價。內在置信度的估計依賴於對同一問題取樣20次回答並計算一致性,這大幅增加了計算開銷。論文也承認,目前訓練僅在單一資料集上完成,雖然泛化效果不錯,但在更多樣化場景下的穩健性仍有待驗證。此外,RLMF在最佳化語言表達多樣性的問題上依賴第二階段的重寫作為補充,這是對強化學習本身侷限性的一種務實承認。
cMFG指標本身也值得關注。它修正了此前忠實校準評測中的一個問題:當模型的內在置信度分布集中在某個窄區間時,傳統cMFG指標會系統性地低估忠實度。cMFG透過等樣本量分箱和寬度加權積分,讓不同模型間的比較更公平。整體看,這篇工作的重點在於校準表達:模型有把握和沒把握時,說出來的置信度要更接近自身狀態。
📄 原文標題
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
🔗 原文連結