分類: 大型語言模型
- 賦予大模型「終身學習」能力,北航 CASE 框架:編輯千次不失憶,額外參數不到 1MB丨WWW'26
- 林俊旸離職後首次發聲!覆盤千問的彎路,指出AI的新路
- VideoSeek 長影片理解 Agent:讓 GPT-5 在長影片理解上再提 10 個百分點的祕密
- TurboQuant:以極致壓縮技術重新定義 AI 效率
- 長影片推理為何總是翻車?Symphony 給出的答案是認知分工
- 蘇黎世聯邦理工實測:一句Prompt就能摧毀16個Agent組成的「共識網路」|多Agent避坑指南
- NVIDIA Nemotron-Cascade 2 技術報告:3B 激活參數奪下 IMO 金牌,重新定義小模型極限
- 僅用2億真實Token訓練的模型,為何能媲美3.6億數據量的效果?
- ICLR 2026 | 大型語言模型的非監督式強化學習能走多遠?清華大學研究團隊提出系統性解答
- 最新!Karpathy萬字深度專訪:我焦慮到AI成癮,所有可驗證的領域,終將屬於機器
- OpenAI 傾盡全力打造全自動 AI 研究員
- 別再迷信結果獎勵了!港中文發現並解決 RL 中的「資訊自鎖」難題!
- MiniMax M2.7:開啟模型的自我進化
- 4B 模型幻覺抑制能力超越 GPT-5,CMU 等提出行為校準強化學習新方法
- MMLU已死?「人類最後考試」登上Nature:全球AI模型集體不及格!
- Google 新研究找到了大型模型反覆推敲的重要 Token!
- Anthropic CEO:大型語言模型的資料瓶頸已不復存在,模型正在自我訓練
- Anthropic最新論文:網際網路匿名,在AI時代終結|Hao好聊論文
- 並非所有 token 都平等!Google 提出真・深度思考:思維鏈長≠深度推理
- LLM RL 訓練軌跡竟然是線性的?Miaow Lab 最新工作:無需繼續訓練,直接「預測」未來模型!
- Google Gemini 3.1 Pro 屠榜稱霸,清華姚順宇出手!Claude 和 GPT 被逼入死角
- 1兆美元蒸發背後:垂直軟體的護城河,正被大型模型改寫
- Qwen3.5:邁向原生多模態智慧代理人
- 苦澀的教訓!ROLL團隊分享:Agentic RL 訓練中的實務經驗
- 小米推出 JudgeRLVR:先判斷後生成——打破推理模型「長思維鏈」的效率悖論