DeepSeek V4.1 Flash 評測

短的結論:最是一年春好處

基本情況:

DeepSeek 與眾不同的是,他們熱衷且擅長透過底層創新來提升效率。在這樣持續不懈的努力之下,即便會繞一些遠路,但最終都會做出突破性的成果。這次的 V4.1 看起來是小版本,但從模型結構到參數,都發生了很大的變化。

其中,邏輯能力相比自家 Pro 有顯著躍升,進入中國自研模型第一梯隊前段;底層架構創新帶來的極致速度,也抵銷了部分思考長度劣勢,平均耗時在同梯隊中最低。而且如果使用 high 檔,思考長度會顯著減少,回應耗時大幅降低,進入極高的可用區間。即便放眼全球,也具有競爭力。

Agent Coding 能力則提升幅度有限,略優於前一代 Pro。但 V4.1 的 Agent 行為相比之前發生較大變化,在不同任務上有較大差異,下文詳述。

邏輯成績:

表格的排序改為依中位分數降序排列。

圖片

*1 表格為了凸顯對比關係,僅展示部分可對照模型,不是完整排序。

*2 題目及測試方式,參見:大語言模型-邏輯能力橫評 26-08 月榜,新增 #76、#77、#78。

*3 完整榜單更新在 https://llm2014.github.io/llm_benchmark/

Agent 成績:

圖片

• 程式開發任務:V4.1 Flash 整體較 V4 Pro、V4 Flash Vision 等版本更優。單看測試分數不能完全體現。具體而言,V4.1 Flash 的綜合美感能力比 V4 各版本顯著更高,但離第一梯隊還有差距;V4.1 Flash 可以利用視覺能力檢查並修正諸多 UI 呈現、部分版面配置和樣式問題,但對美感要求更高的間距、配色,以及更複雜的高階建模、動態效果、轉場等任務,V4.1 Flash 則表現還不及預期。V4.1 Flash 的修復能力很強,對大部分的美學問題,如果人為干預,乃至提供範本,則模型可以完成得更好。

• V4.1 Flash 完成任務的步驟顯著多於前一代 Pro 和 Flash。觀測到增幅至少在 +20% 以上,極端情況是專案 J,增幅 +700%。這其中絕大部分增幅來源於自測環節;前一代 Pro 比前一代 Flash 自測更多,但總體還在合理區間,甚至在不太熟悉的技術堆疊上基本不自測,只做簡單靜態編譯檢查就結束。而 V4.1 Flash 則會更加細緻地展開全面廣泛自測,對每個功能點編寫測試案例,並截圖目視驗證。max 這種表現通常來自強化學習環境中,模型為了追求極少量 reward 增益而進行不計代價的嘗試。如果使用 high 或者 low 檔位,在中等難度任務上表現與 max 檔位近似,而步驟則會少很多,實用性更高。

• V4.1 Flash 的 Bug 定位能力和前一代 Pro 相當,遠好於前一代 Flash。表現為對於任意 Bug,都可以在無人工提醒情況下找到根因並正確修復。與 Pro 的差別只在於個別 Bug 存在多種改法,V4.1 第一遍改錯了方向。但這也具有隨機性。而且這僅限於測試任務,對於更廣泛的真實任務則還需讀者自行觀察。

• 推理消耗:V4.1 Flash max 檔位表現出前所未有的推理努力程度,在多個中等難度任務上甚至會消耗達到 260~340K,遠高於前一代,以及其他所有模型。在簡單指令遵循任務中也會消耗到 60K 級別。更關鍵是,V4.1 Flash 在消耗過量 Token 後,解題正確率並沒有提升,反而前一代 Pro 的平均正確率更高。而 V4.1 Flash 真正得分更高的任務,消耗基本持平前一代。這也再次印證了 max 檔位並不適合日常使用。

• 幻覺表現:V4.1 Flash 的幻覺表現要比前一代更低。不過前一代的幻覺控制並不優秀,有些場景是低於同梯隊模型的。V4.1 Flash 算是補上了短板,但相比國際領先模型,則差距依然明顯。最大問題在於一旦文字本身迷惑性加大,則 V4.1 Flash 還是吃不消,表現很不穩定,最壞情況也沒有高於前一代。這在 Agent 任務上的表現就是面對複雜任務清單,可能會隨機地丟棄部分資訊。

賽博史官曰:

大模型的發展具有螺旋性,前一代的成功並不代表後繼模型就會全面超越,而前代不足也不能說明團隊江郎才盡,油盡燈枯。關鍵是看團隊堅持什麼方向,他們的動作在不在主路徑上。而對於追求 AI 普及的 DeepSeek 而言,極致的降低成本正是其持之以恆的標竿。而 DeepSeek 的每次創新,都會給整個模型界帶來新的可能性,最終回饋到整體產業的進步,對此而言,如沐春風。

相關文章推薦

分享網址
AINews·AI 新聞聚合平台
© 2026 AINews. All rights reserved.