DeepSeek 打破大模型「不可能三角」:更强、更快、還更便宜
2026-09-10 15:05:20
幣界網消息,DeepSeek 宣布其 v4.1 flash 版本打破了大模型的「不可能三角」,實現了更強、更快和更便宜的目標。該模型主干參數達到5520億,並外掛1960億參數的 engram 条件記憶。預訓使用了45萬多種模態 token,後訓則加入了真實 agent 任務和失敗案例。DeepSeek v1.1 的性能達到74.2%,超過了 Claude Opus 5和 GPT-5.6 SOL。新架構將40層模型拆分為前後兩半,讀取時每個 token 僅激活80億參數,生成時激活160億參數,且上下文長度從4k擴展至1m,計算量僅增加約四分之一。此外,DeepSeek 通過將主緩存改爲 fp4 和跨層複用,將每個 token 的全局 kv 降至890字节,約爲 v4 flash 的1/4。
利好 0
利空 0
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。