分類: 大型語言模型
- 王夢迪團隊「自我進化代理」綜述:從靜態大型語言模型到超智慧人工智慧
- 大型語言模型的黑化開關!Anthropic團隊新作:大型語言模型的人格變數,人類終於找到了!提出人格漂移工具鏈,破解讓模型失控的黑箱
- 注意力總是發散?人大與清華大學聯合提出LeaF:移除干擾型Token,引導模型學會自主聚焦
- 模型真的能「反思程式碼」嗎?北航發布倉庫級理解生成基準,刷新大型語言模型理解評估範式
- ReaGAN:讓圖中每個節點都成為智能推理專家
- Google 約戰,DeepSeek、Kimi 都要上,首屆大型模型對抗賽明天開戰
- RAG 革新!Graph-R1:首個由強化學習驅動的圖推理代理
- 阿里雲剛開源Qwen-Image,免費版GPT-4o吉卜力,中文最佳模型
- 復刻 AlphaGo 時刻?Google 推出 LLM 評估新範式 Game Arena:八大模型參賽,棋王擔任裁判
- RAG也能推理思考!徹底解決多源異構知識難題
- 盤點一下!大型模型訓練的時間都花在哪了?
- DeepSeek R2 秘密武器曝光!梁文鋒剛拿下頂級大獎的技術,讓 AI 讀長文速度狂飆 11 倍
- 人工智慧安全與沉思:心靈與通用人工智慧對齊的計算模型
- 凌晨時分,Qwen再次更新,RTX 3090 即可運行,30億參數激活可媲美 GPT-4o
- 多模態大型語言模型真的「理解」世界嗎?——揭露多模態大型語言模型的核心知識缺陷
- 分層推論模型 Hierarchical Reasoning Model
- 對喔!為什麼語言模型不能直接輸出答案與其置信度呢?
- DeepSeek-GRPO重要性權重設計錯誤?詳解Qwen3新強化學習演算法GSPO
- 必讀好文:主流大型語言模型架構深度對比,涵蓋 Llama、Qwen、DeepSeek 等六大模型
- 碾壓DeepSeek V3!阿里巴巴開源新版Qwen-3,榜首級別的斷層領先
- 大模型再爆弱點!舊記憶忘不掉,新記憶分不清,準確度暴跌 | ICML'25
- Transformer終結者!Google DeepMind全新MoR架構問世,新一代魔王來了
- Meta團隊突破:大型模型「幻覺」暴跌至5%!一句話提問竟成關鍵?
- AI進化時間表已現!LLM每7個月能力翻倍,2030年職場不復存在?
- 數學訓練如何「解鎖」大型模型的通用推理能力?最新研究揭示關鍵機制