2017 年夏天,Google 的 AI 研究人員發表了一篇題為《注意力就是一切》(Attention Is All You Need)的論文。文章描述了一種名為「變換器」或「轉換器」(Transformer)的新型神經網路。
後來事實證明,Transformer 網路在處理長序列資料,尤其是文字方面,表現十分出色。
在 2026 年的今天,Transformer 可謂市場上所有主流大型語言模型(LLM)的核心引擎。AI 新創企業 Subquadratic 的共同創辦人兼執行長賈斯汀・丹格爾(Justin Dangel)表示:「整個 AI 產業都建立在 Transformer 之上。它們是電腦科學史上最重要的創新之一,已經改變整個世界。」
但與此同時,Transformer 技術也顯露出疲態。近期大型語言模型取得的諸多進展,例如圍繞推理模型的開發,以及模型一次性處理海量輸入的能力,都不是對核心技術的順勢延展,更像是在其某些根本性缺陷上打補丁的權宜之計。
越來越多的科學家和工程師開始思考:技術如何演變?新一代 AI 是何種形態?我們相信,LLM 本身不會消失,但未來它們將以何種方式構建而成呢?一切尚無定論。
一批新創企業爭相入局,力求在現有技術前沿上開疆拓土。註定有一部分競爭者會失敗,但這些後起之秀的潛力巨大,相比當下產業頭部企業,反而更具競爭優勢。
遲暮的網路
首先,我們要釐清現存的技術難題。Transformer 的核心優勢來自所謂「密集注意力」(dense attention)機制,該機制透過一系列數字來編碼一段文字的語意。處理過程中,文字裡的每一個詞(word),或是詞的一部分,也就是詞元(token),都會透過乘法運算與其餘所有詞或詞元做比較。
密集注意力機制能以極高精度捕捉文字含義。但隨著文字長度增加,處理所需的運算量會急劇攀升。一份長達一萬個英文單詞的文件,可能要求 Transformer 完成 5,000 萬次乘法運算。這正是大型語言模型能耗巨大的主要原因。
運算成本十分高昂。據 OpenAI 總裁格雷格・布羅克曼(Greg Brockman)透露,OpenAI 今年的運算支出將達到 500 億美元。國際能源署預測,到 2030 年,資料中心的總耗電量將翻倍。
更糟糕的是,面對諸多新模型所須完成的任務,Transformer 網路往往力不從心。受逐詞處理文字的工作方式限制,Transformer 不擅長同時維護大量資訊;換言之,它的上下文視窗無法擴展得太大。
然而,LLM 若要開展難度更高的任務,就必須接收更大規模的資料,例如一整套文件庫、一整個程式碼庫,或是來自其他大型語言模型的輸出結果。
推理模型的工作方式是先借助思維鏈這本草稿本給自己寫筆記,再讀取筆記繼續推理。這種方式也會增加模型需要維護的資料量。
隨著 LLM 不斷變大變強,Transformer 的瓶頸越發凸顯。它們曾經的核心優勢,如今卻成了侷限性。
下文介紹四種旨在解決 Transformer 網路侷限性的新思路。這些創新有望徹底重塑大型語言模型,使其速度更快、效率大幅提升,或許還會越來越聰明。
路線 01
重新設計注意力機制
要讓大型語言模型跑得更快、成本更低,不妨直擊痛點,改變注意力機制,用稀疏注意力(sparse attention)替代密集注意力。
稀疏注意力機制僅對文字區塊中的部分詞對進行運算,而非全部。這可以大幅減少 LLM 所需的運算量。
多年來,研究人員提出過大量稀疏注意力機制,但它们在捕捉語意方面始終比不上密集注意力機制。當然,今時或已不同往日。
前文提到的初創企業 Subquadratic 宣稱,他們開發的一款稀疏注意力機制,首次在搜尋、程式碼生成等多項任務上展現了對標主流頂尖 LLM 的效能。此論斷可謂重磅,不過業內部分人士仍持懷疑態度。
Subquadratic 方面表示,自家模型 SubQ 會針對輸入文字的每一段,即時判斷哪些詞重要或不重要。據稱,有數以萬計的使用者報名加入等候名單,以求試用 SubQ;而該模型向全體公眾開放的日子也會很快到來。
另一家初創企業 Manifest AI 則另闢蹊徑,選擇不改造注意力機制的工作方式,直接用全新方案取而代之。
這家公司開發出一套名為「幂保留」(power retention)的機制。幂保留機制僅保存與當前任務最為相關的資訊,從而確保大模型需要維護的資料量不會爆炸性成長。
傳統注意力機制要求 LLM 記住上下文視窗內的全部內容。以 SubQ 為代表的稀疏注意力模型雖捨棄了大量單一詞,卻仍保留其所見內容的概貌。相比之下,幂保留機制會為模型提供一份關於上下文視窗內容——也就是模型當前能看到的所有文字內容——的滾動摘要;若有新增資訊進入,相關性較低的舊資訊即被丟棄。
幂保留的基本原理已存在約十年之久。Manifest AI 方面聲稱:他們完成了技術迭代,首次構建出可比肩基於 Transformer 的大模型的產品。另外,僅需少量再訓練,即可將 Transformer 模型改造為幂保留模型。
為證明上述改造能力,技術團隊將現有開源程式碼大模型 StarCoder 調整為搭載幂保留機制的 PowerCoder,還發布了 Brumby 模型,稱其效能可匹敵阿里巴巴通義千問(Qwen)的某些版本。
Manifest AI 的願景是:當大型語言模型需要處理海量資料任務時,幂保留技術能成為首選方案。公司共同創辦人兼技術長卡萊斯・赫拉達(Carles Gelada)曾表示,他們的技術方案擁有廣闊應用場景,小到分析數小時時長的影片,大到打造能連續數週執行任務的 AI 代理。
路線 02
打造體積更小巧、更靈活的模型
由麻省理工學院孵化的初創企業 Liquid AI 並未徹底修改或是捨棄 Transformer,而是將其自研的液態神經網路(liquid neural networks)與 Transformer 結合,構建出所謂的「液態基礎模型」(liquid foundation models),簡稱 LFM。
Liquid AI 的模型體積遠小於絕大多數 LLM,能耗也更低。公司已為賓士等車廠開發適配車載小型晶片的模型;其最新版本甚至可在售價 50 美元、低功耗的樹莓派開發板上運行。
據稱,年營收低於 1,000 萬美元的企業可免費使用 Liquid AI 的產品,而模型下載量已達數千萬次,且廣受好評。
液態神經網路是卷積神經網路的延伸,其靈感源自蠕蟲大腦;卷積神經網路則是 Transformer 誕生之前就已存在的另一類神經網路。液態神經網路之所以脫穎而出,關鍵在於有一套自適應機制,使模型能根據新資訊動態調整自身行為,實現邊運行邊學習。基於 Transformer 的模型則無此能力,一旦訓練完成,其行為模式就固定不變。
Liquid AI 的早期模型雖相對基礎,但已能操控無人機、駕駛車輛。如今借助液態基礎模型,公司正嘗試將技術規模化,以對標主流大型語言模型。新模型的效能可匹敵在規模上 4 倍於自己的競品,包括阿里巴巴通義千問和 Google 開源大模型 Gemma 的某些版本。
典型的 LLM 由多個 Transformer 堆疊搭建而成。Liquid AI 最新的 LFM 屬於混合架構,包含 20% 的 Transformer 與 80% 的液態神經網路。
計算出上述配比的並非人類,而是該公司自研的另一套 AI 系統——專用於輔助模型設計。據稱,這套能設計 AI 的 AI 會把各種不同神經網路,例如液態網路、卷積網路、Transformer 等進行大量組合,並篩選組合方案,找到效能與效率的最佳平衡點。
Liquid AI 的共同創辦人兼執行長拉明・哈薩尼(Ramin Hasani)認為神經網路的未來充滿無限可能,Transformer 只是開端而已。
「人類大腦就是一個通用人工智慧系統,其功耗卻只有 20 瓦。這是怎麼實現的?我們完全能做出更多創新。」——拉明・哈薩尼
路線 03
一次性生成全部文字
幾乎所有大型語言模型都逐詞輸出內容。這符合人類說話寫作的習慣,但對電腦而言效率極低。若 LLM 能一次性生成文字——一口氣吐出整句乃至整段——速度和成本都將得到最佳化。
上述思路的踐行者之一 Inception 公司,正利用擴散技術來構建大模型。
擴散技術更為人熟知的角色,是絕大多數圖像、影片生成模型的驅動核心。擴散大模型的訓練方式則是:先接收一個隨機的像素網格(類似老式電視機的雪花雜訊),再同時處理全部像素,判斷哪些像素需要修改,把雪花雜訊變成高畫質影像。
事實證明,上述流程同樣適用於文字。Inception 團隊透過特定訓練,使擴散大模型能接收一串隨機的詞語序列並轉化為語意通順的句子。這種擴散 LLM 仍使用 Transformer 來編碼語意,但會一次性輸出整塊文字,以更少代價完成更多任務。
公司共同創辦人兼執行長斯特凡諾・埃爾蒙(Stefano Ermon)表示,自家的創新依舊屬於大型 Transformer 模型,但它能同時預測多個詞元。這就是為什麼,對比市場上絕大多數方案,這套模型的文字生成速度快很多,成本效益更高。
其中的難點在於,怎樣把原本為圖像生成所設計的技術遷移至文字領域。
「處理圖像時,把一個藍色像素改成紅色像素,可經過中間過渡顏色逐步調整。但文字不行,『貓』與『狗』之間沒有中間詞彙。」——斯特凡諾・埃爾蒙
埃爾蒙的另一重身分是史丹佛大學研究員。2024 年,他與兩名史丹佛同事找到了彌合文字鴻溝的數學方法,並以此為基礎訓練出一款適配文字的擴散模型,其效能媲美 2019 年 OpenAI 發布的 GPT-2,生成速度則快 10 倍。
基於該項成果,埃爾蒙創辦 Inception。眼下,他的雄心指向產業頭部。Inception 稱其最新模型 Mercury 2 效能對標 2023 年 OpenAI 發布的部分 GPT-4 版本,速度同樣快 10 倍。
「我們非常看好這條路線,它具備規模化擴展的潛力。歸根究柢,速度與成本是衡量大模型價值的核心標準——你向它投入一塊錢後能獲得多少智慧?」——斯特凡諾・埃爾蒙
押注擴散技術的企業不只 Inception 一家。Google 方面也正積極嘗試,並已打造名為 Diffusion Gemma 的原型 LLM。
路線 04
乾脆跳出文字世界
在圍繞 Transformer 侷限性探索創新方案的初創企業裡,Pathway 公司的理念最具顛覆性。他們想讓大型語言模型擺脫語言的束縛,並以此為目標開發了 Dragon Hatchling 大模型。
迄今為止,它最亮眼的成績來自一項與超過 25 萬道超高難度數獨題對戰的基準測試。多家頂尖實驗室的主流大模型難以破解哪怕一道謎題,Dragon Hatchling 卻攻克了 97% 以上的難關。
Pathway 想傳遞的觀點是:主流 LLM 雖在大量任務上表現出眾,但仍對諸多關鍵類型的問題無能為力,數獨只是其中一例。
公司共同創辦人兼執行長祖贊娜・斯塔米羅夫斯卡(Zuzanna Stamirowska)表示,若要大模型針對現實問題產出真正原創的解決方案,就必須跳出 Transformer 框架。因為 Transformer 迫使大模型全部依靠文字完成推理,但語言並非某些推理形式的最佳載體。
Pathway 的解決方案是修改 Transformer 的底層數學邏輯,用「狀態空間」(state space)這一數學結構替代注意力機制。
狀態空間不再逐詞編碼資訊,而是將資訊壓縮為更抽象的表達。以此為基礎,Dragon Hatchling 依舊能讀寫文字,同時也可模擬不依賴詞語序列的推理模式。這不僅提升模型效率,理論上還可勝任其他 LLM 力不能及的任務。
「西洋棋和數學問題,並非以長句形式存在於人類腦中。大腦靈光一閃的頓悟,未必以語言形式出現。我們認為,若推理必須依托語言完成,這本身就是一種侷限。主流 LLM 有能力閱讀數獨解題教學,再撰寫求解程式碼,但這並非我們所求,我們理想中的模型不侷限於書本知識。AI 的星辰大海不是解數獨題,而是攻克癌症——可這世上還沒有現成的癌症解法手冊。」——祖贊娜・斯塔米羅夫斯卡
資料來源:
These startups are chasing the next big thing in LLMs
END