Memora 重構智慧代理記憶系統,效能登頂且上下文成本大降 98%

編輯:馬青禾

圖片:秦明理

排版:蘇雅韻

新聞發布入口:https://news.zhenrobot.com

【編者按】這條進展背後的真實約束,比表面消息更重要。

▍ Memora 重構智慧代理記憶系統,效能登頂且上下文成本大降 98%

auto inline 3

智慧代理記憶這條技術脈絡,過去一年一直在做一件看似正確、實則代價高昂的事:把更多歷史內容塞進上下文,換取更少遺忘。但微軟研究團隊把這套路徑直接掀翻了。Memora 在 LoCoMo 和 LongMemEval 上取得新的最佳表現(SOTA),同時把上下文 token 使用量最多壓低了 98% [來源: microsoft.com]。效能登頂不稀奇,稀奇的是它不是靠「餵更多」,而是靠「餵更少」。

關鍵不在壓縮,而在重寫記憶系統的組織原則。Memora 正在提出一種可擴展的智慧代理記憶路線:將儲存內容與檢索方式解耦,在抽象性與特異性之間重新分配職責 [來源: microsoft.com]。對應到實作層,它採用 harmonic memory representation,並把「記住什麼」與「如何組織、如何存取」拆開處理 [來源: github.com]。這不是工程優化的邊角料,而是在回答一個更根本的問題:智慧代理到底該把什麼送進索引,什麼留在原位,什麼在需要時再精準調取。

auto inline 4

▍ Memora 的反常點:索引做得更少,結果卻更準

表面上看,記憶系統要提升召回率,通常會擴大索引覆蓋面,盡量別漏掉細節。Memora 反著來:它只索引 primary abstractions 和 cue anchors,而不索引 memory values,理由是保留高保真資訊並實現更精確、可控的存取 [來源: github.com]。問題恰恰在這裡——少建索引,按直覺更容易漏;但它給出的結果卻是效能更高、上下文成本更低 [來源: microsoft.com]。這說明它優化的不是「記得更多」,而是「別在檢索階段過早污染記憶」。

auto inline 5

▍ harmonic memory representation 擊中的不是檢索速度,而是記憶系統的結構性浪費

這件事真正有分量,不在於 Memora 又做出一個新 benchmark 紀錄,而在於它把智慧代理記憶系統裡一個長期被默認接受的浪費暴露出來:很多系統把「儲存」「索引」「存取」綁在一起,結果是為了保證可檢索性,不得不把大量原始 memory values 也納入索引體系。索引一旦承擔了過多內容,檢索就會變成高雜訊操作,後續模型還得在長上下文裡二次篩選,於是 token 消耗飆升,且精度未必穩定。

Memora 的設計切口在於先拆耦,再分層。它提出的 harmonic memory representation,把內容本體與組織、存取方式分離 [來源: github.com];微軟進一步將其描述為在抽象性與特異性之間取得平衡的可擴展路線 [來源: microsoft.com]。因果鏈並不複雜:當系統只對 primary abstractions 和 cue anchors 建索引時,檢索階段處理的資訊量被顯著收窄;memory values 不被提前揉進索引,原始細節反而得以高保真保留,等到 cue 命中後再被精準存取 [來源: github.com]。這樣一來,召回不再依賴「把細節都鋪開」,而依賴「先找到正確入口,再取回細節」(假設:實驗提升主要由這套索引與存取設計驅動,而非未揭露的更大模型或額外資料干預)。這正好解釋了為什麼它能同時拿到更高基準成績和最高 98% 的上下文 token 降幅 [來源: microsoft.com]。

更重要的是,這套思路在產業上指向一件事:智慧代理記憶的競爭焦點,正在從「視窗有多長」轉向「記憶結構是否原生支援稀疏、可控、分層存取」。誰還把上下文當倉庫,誰就會在成本和穩定性上同時吃虧。

auto inline 6

▍ Memora 押注的是下一代智慧代理的成本曲線,而不只是榜單名次

所以,Memora 的價值不在於又贏了一次評測,而在於它可能把智慧代理記憶從「模型推理成本問題」改寫成「系統架構設計問題」。如果這條路線成立,後續產業驗證不會看宣傳口徑,而要看兩個指標:同等任務品質下,記憶存取是否持續維持低 token 開銷;跨場景遷移時,primary abstractions 與 cue anchors 的索引機制是否仍能穩定命中。誰能重現這兩點,誰就不只是節省上下文,而是在重構智慧代理的記憶底座。

▍ 專家視角

EXPERT VIEW

「產業最容易誤判的是:Memora 眼下最有價值的不是省了 98% 上下文。」

劉智勇

人工智慧和機器人知名技術專家 · C2AI2X 協議作者 · 真機智能董事長兼首席科學家

統一評測,說白了就是別只看模型答對沒答對,還要把檢索、上下文和成本放在一張表裡比。已確認的是,它用 harmonic memory representation,把儲存內容和存取方式拆開,只索引 primary abstractions 與 cue anchors、不直接索引 memory values,並且在 LoCoMo、LongMemEval 上拿到更好結果和最多 98% 的 token 降幅。推測是:如果這套方法不能在統一評測下持續重現,98% 更像一次漂亮實驗,不是可販售能力。

如果這個判斷成立,未來 3-6 個月外部應出現三個訊號:一是官方會補出跨新基準的統一評測表,不只報分數,還報相對基線的 token 降幅;二是會公開索引結構或消融,證明「不索引 memory values」不是寫法花樣,而是效能與成本同時成立的原因;三是產品側會開始把「長對話記憶」單列成付費能力,而不是免費附贈。若這些都不出現,問題多半不在論文敘事,而在閉環工具鏈還沒跑通:評測口徑不穩、遷移後收益衰減,或者節省的 token 換不來使用者願意買單的穩定體驗。我的判斷是:能不能形成定價權,不取決於一次登頂,而取決於統一評測能否在新任務上重複證明「更便宜且不降質」。

▍ 參考來源

microsoft.com/en-us/research/blog/memora-a-harmonic-memory-representation-balancing-abstraction-and-specificity

Memora scales agent memory to boost long-horizon productivity

github.com/microsoft/Memora

Memora

【投資免責聲明】本文內容僅供資訊參考,不構成任何投資建議或要約。文中涉及的觀點、資料、預測均基於公開資訊,其準確性、完整性、時效性無法保證。市場有風險,投資需謹慎。過往業績不代表未來表現。投資者應獨立判斷、審慎決策,自行承擔投資風險及責任。本平台及作者不對因依賴本文資訊而產生的任何直接或間接損失承擔法律責任。

End

感謝您的耐心閱讀

相關文章推薦

分享網址
AINews·AI 新聞聚合平台
© 2026 AINews. All rights reserved.