編輯|山輝
十多年前,Ilya Sutskever 曾說過這麼一句話。
「模型就是想學習。」
Dario Amodei 在專訪中轉述 Ilya Sutskever 的說法。圖源:Dwarkesh Podcast。
只要解決好資料與算力的問題,模型會自己找到學習的方法。
後來發生的事情我們都知道。模型越做越大,訓練資料越用越多,算力投入一路攀升,模型能力被一層層解鎖。
但當研究者將目光聚焦在循環網路和隱空間上時,一切都變了。
循環模型能夠在隱空間中反覆運算。按照設想,同一組網路層多運行幾輪,模型就能獲得更多運算時間,遇到難題也可以多「想」一會兒。
但現實並非如此美好。
不少模型只擅長使用訓練時見過的循環深度,若再讓它多算幾輪,它就可能開始在錯誤的道路上狂奔。
因而有人戲稱:有些模型,就是不想學。
靠「多說」來「多想」
點開一個大型語言模型的「深度思考」,你會看到長長的文字。
這其中看似有很多「廢話」,模型總在一邊嘗試一邊推翻,有時還會說出「我需要重新思考這個問題」。
這展現了模型的推理過程。雖然不能直接將其當作模型內部的完整計算過程來看,但也說明了,當前 Transformer 解決難題最成熟的方法,就是讓模型一邊說一邊想。
因為標準 Transformer 有點像一棟樓層固定的大樓。
資訊從一樓進入,依次經過每一層,最後從頂樓出來。無論面對的是「1+1 等於幾」,還是一道複雜的數學證明,每次生成下一個 Token 時,它走過的網路深度基本相同。
一趟不夠怎麼辦?那就多走幾趟。
模型先生成一個 Token,再帶著先前的上下文進入下一輪計算。輸出越長,同一套網路被呼叫的次數越多,模型也就多了幾次拆解問題、檢查答案和修改答案的機會。
這套方法相當管用。它讓原本網路深度固定的 Transformer,也能根據題目難度靈活分配運算量:簡單問題少說,複雜問題多說,實在不行就讓自己的幾個答案來回打架。
不過,這種思考方式也有些不便之處。
模型內部儲存的是高維連續的隱藏狀態,因為中途必須「說出來」,所以許多中間計算也必須被組織成一條可以輸出的序列。哪怕某些步驟根本沒有說出來的必要,模型也得先生成點什麼,才能繼續往下走。
於是,另一條路出現了。
直接在網路層循環
循環模型的想法很直接。
既然走一遍網路不夠,那就回到某些網路層再走一遍。每循環一次,模型都會更新一輪隱藏狀態,複用的還是原來那組參數。
思維鏈透過生成 Token 串聯多次計算;隱空間循環則讓隱藏狀態在同一組網路層中反覆更新。圖源:Tilde Research。
Universal Transformer、Deep Equilibrium Model 以及近年的循環 Transformer,都在琢磨同一個問題:能不能讓模型根據題目難度,自行決定要在腦內轉幾圈?
好像還真行。
2025 年的一項潛在推理研究將循環深度模型擴展到 35 億參數,並用 8000 億 Token 進行訓練。測試時,研究者讓同一個計算模組多運行幾輪,模型在部分推理任務上的表現確實持續提升,最多能夠利用相當於 500 億參數模型完成一次前向傳播的計算量。
隨著測試時循環次數增加,模型在 GSM8K、HumanEval 等任務上的表現持續提升;不同任務在不同深度趨於飽和。
但這個計算輪數並非越大越好。
2025 年發布的循環語言模型 Ouro,早期曾嘗試使用 8 輪循環訓練,但很快出現損失尖峰 和梯度震盪。研究者隨後將主要訓練階段的循環深度降至 4 輪。
在測試階段,又把循環次數繼續增加到 8 輪,但額外計算卻沒有換來更好的答案。
以 1.4B 參數的 Ouro-Thinking 為例,它在 AIME 2024 上的成績從第一輪的 0 分逐步上升,在第四輪達到 65 分;繼續轉到第八輪,成績又掉到了 38.67 分。
也就是說,多出來的輪數都在幫倒忙。
還差什麼
目前,循環模型要跨越的難關,大致有三道。
第一,理論上能不能算:共享同一組參數、循環更新隱藏狀態,是否足以表達複雜的計算過程?
第二,模型能不能真正學會這一計算方式;
第三,訓練結束後,模型在推理階段能不能繼續穩定地「算下去」。
第一點已經有不少樂觀的結果,麻煩更多集中在後兩道。
反覆呼叫會導致誤差累積,循環次數增加後,隱藏狀態可能看起來很穩定,但實際上無法支撐結果。
2026 年的 Parcae 研究便發現,循環語言模型容易出現殘差爆炸和損失突然上升。
重新設計循環過程中的穩定機制後,模型的驗證集困惑度最多降低了 6.3%;擴展到 13 億參數時,也在固定參數量和資料量下超越了傳統 Transformer 基線。
普通循環基線的循環狀態範數迅速爆炸,訓練損失隨後停止下降;加入穩定機制的 Parcae 和殘差歸一化模型則保持穩定。
這個結果讓「模型不想學」的故事有了一點轉機。
今天的標準 Transformer 已經擁有一整套磨合多年的訓練裝備:殘差連接、歸一化、初始化方法、學習率策略和最佳化器,實作起來都很熟練。
相比已經磨合多年的標準 Transformer,大規模循環語言模型的訓練配方仍遠未成熟。
架構、最佳化器、損失函數和中間監督應該如何搭配,可能還需要摸索出更順手的組合。
參考連結:
https://blog.tilderesearch.com/blog/one-layer-deeper
© THE END