分類: 大型語言模型
- 技能驅動推理新範式,清華&北大:Token立省59%,準確率不降反升
- 思考不需言語:使用抽象思維鏈實現高效潛在推理
- LLM 只靠自己就能強化推理?SePT 提出簡潔的線上自訓練範式
- 首個時空時序推理框架:讓大型語言模型真正讀懂時空數據 | ACL'26
- QuantCode-Bench:大型語言模型量化交易代碼生成品質評估基準
- 正式介紹:混元 Hy3 preview
- 普通網線也能跑萬億大模型!月之暗面拋出王炸架構,親證:不用全買 H100!1T 模型實測:延遲暴降 64%!大模型推理「圍城」攻破了!
- MASK 基準測試:拆解 AI 系統中的誠實與準確度
- Autogenesis:一種自我演化的智慧代理人協定
- 深度解析兩篇最新 Harness 論文:微軟與谷歌如何重塑 AI Agent 的邊界
- FrontierSWE:在人類能力極限下評測程式設計代理
- Claude Opus 4.7慘遭全網負評!剛升級就翻車,用戶怒吼:還我4.6
- 自動化對齊研究員:運用大型語言模型擴展可擴展監督
- Star 數狂飆!MSA 重磅開源!
- Tokens 燒錢太快?試試這個四層模型組合策略
- 大型語言模型也能「原地」調參了!字節 Seed 與北大聯合發表新論文:推論時無需新增層或重新訓練
- 無需強化學習!蘋果團隊提出「簡單自蒸餾」,實現編碼模型自我進化
- 讓思考更精準更長!強化學習新演算法 FIPO 登場
- GLM-5.1:邁向長時間跨度的任務處理
- MSA 程式碼準時開源!突破 1 億 Token 記憶極限,效能超越 58 倍大模型 RAG
- 疑似 GPT-6 現身!OpenAI 聯合創辦人親曝「Spud」新一代 AI 模型,竟擁有「大模型氣味」!網友熱議:這是首款真正會「思考」的型號!
- Meta-Harness:史丹佛最新Harness論文,林俊旸按讚
- 500 筆種子數據、四個 Agent 自我進化,推理能力提升 10.7%
- 推理不再為 logits「搬磚」:FlashSampling 讓解碼提速 19%
- 大型語言模型能成為電腦嗎?