若你正評估 2026 年夏季 Agent API 選型,並需判斷 DeepSeek V4-Flash-0731 是否值得接入生產管線,本文按時間線、核心參數、橫向對比與爭議點四個維度展開——7 月 31 日 DeepSeek 將 V4-Flash 升級為官方版:參數規模不變、僅重跑後訓練,跑分反超更大的 V4-Pro 預覽版,價格約為 Claude Opus 4.8 的數十分之一;旗艦 V4-Pro 正式版與自研 Harness 框架仍未上線。
時間線:從 4 月預覽到 7 月「官方版」
- 2026 年 4 月 24 日:DeepSeek-V4 預覽版首次發布並開源,包含 V4-Pro(1.6T 總參數 / 49B 激活)與 V4-Flash(284B 總參數 / 13B 激活),均支援 100 萬 token 上下文,採 MIT 協議。
- 2026 年 7 月 24 日:舊介面模型名
deepseek-chat與deepseek-reasoner正式停用,全部流量切換至 V4 系列命名。 - 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,是當時體量最大的開源權重發布之一。
- 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架「Harness」,稱即將隨 V4 正式版發布。此次公測僅限 API,App 與網頁端暫未同步更新。
- 截至 2026 年 8 月 5 日:V4-Pro 正式版仍是「盡快發布」,沒有官方確認日期。部分媒體援引未署名消息源稱內部測試已在 7 月 28 日那週啟動,GA 窗口可能在 8 月 10 日至 20 日之間——這一時間點目前未經 DeepSeek 官方證實,僅供參考。
這不是一次新模型發布,而是同一個 284B 參數模型重新做了一遍後訓練。真正的旗艦 V4-Pro 正式版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍處於「即將發布」狀態,沒有確切日期。
核心數據一覽:定價、參數與協議
| 模型 | 狀態 | 總參數 / 激活 | 上下文 | 輸入價格(快取未命中/命中,每百萬 token) | 輸出價格 | 協議 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(2026-07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 預覽版(正式版未發布) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3(月之暗面) | 權重開源(2026-07-27) | 2.8T / 約 104B(社群估算) | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2(智譜/Z.ai) | 開源(2026 年 6 月) | ~744B / ~40B | 1M | 未在本文核實範圍內 | 未在本文核實範圍內 | MIT |
| Qwen3.8-Max(阿里) | API 可用(2026-08-02) | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 官方承諾開源,權重待放出 |
以上定價均為廠商自報公開數據。DeepSeek 已預告未來將對 API 啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),但截至發稿未公布具體生效日期。價格與參數可能隨時間變化,請以官方頁面為準。
深度拆解:效能是怎麼「做出來」的
架構沒有變,變的是後訓練。V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,DeepSeek 官方明確說明效能提升「完全來自重新進行的後訓練」,而非擴大模型規模。284B 總參數、13B 激活參數的 Flash 版本,在多項 Agent 基準上反而超過參數量是自己好幾倍的 V4-Pro 預覽版——2026 年下半年大模型競爭,後訓練數據品質與方法的重要性正在逼近甚至超過單純堆參數。
混合注意力機制:CSA+HCA、mHC、Muon 優化器。根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列在架構上做了三處關鍵改動:
- 混合注意力架構:結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),對外統一稱為「DSA 稀疏注意力」,核心目的是在長上下文場景下降低運算與顯存開銷;
- 流形約束超連接(mHC):對傳統殘差連接結構做了改進;
- Muon 優化器:替換傳統優化器,用於提升訓練收斂速度與穩定性。
三項改動疊加的效果是:在 100 萬 token 上下文場景下,V4-Pro 相比前代 V3.2,單 token 推理所需 FLOPs 僅為 27%,KV Cache 占用僅為 10%(DeepSeek 官方公布指標,尚未看到獨立第三方復現驗證)。
自研 Agent 框架 Harness 首次亮相。7 月 31 日 changelog 裡第一次正式出現「DeepSeek Harness」——用於讓模型讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,對標 Claude Code。官方公開的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness 的「極簡模式」(minimal mode)測出來的,DeepSeek 在 changelog 裡也主動提示:「跑分對 harness 的選擇非常敏感,不能簡單等同於模型本身能力的提升」。
橫向對比:中國開源大模型的六邊形混戰
| 模型 | 實驗室 | 發布/權重時間 | 總參數 | Artificial Analysis Intelligence Index | 單任務平均成本 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31(正式版) | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 2026-07-16 預覽 / 07-27 權重 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智譜/Z.ai | 2026 年 6 月 | ~744B | 比 V4-Flash 高約 1 分 | 未在本次調研範圍內核實 |
| Qwen3.8-Max | 阿里 | 2026-08-02 GA | 2.4T | 未在本次調研範圍內核實 | 未在本次調研範圍內核實 |
| GPT-5.6 Sol | OpenAI | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $1.86 |
| Claude Fable 5 | Anthropic | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $3.15 |
Intelligence Index 與單任務成本數據引自 Artificial Analysis(第三方獨立評測);DeepSeek 官方跑分為廠商自報,兩組數據評測方法與權重不完全一致,不能直接相加比較。V4-Flash 的單任務成本約為 Kimi K3 的 1/29、GPT-5.6 Sol 的 1/62、Claude Fable 5 的 1/105——DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」。更多競品定價背景可參考本站 GPT-5.6 降價與 API 定價對比,以及 Qwen3.8-Max 發布解讀。
可引用技術資訊與資料來源
- 後訓練驅動效能躍升:284B/13B 架構不變,V4-Flash-0731 在 Terminal Bench 2.0 拿到 82.7 分,反超 V4-Pro 預覽版的 67.9 分(DeepSeek 官方 changelog,Harness minimal mode 測得)。
- 長上下文效率:百萬 token 場景下 V4-Pro 單 token FLOPs 為 V3.2 的 27%,KV Cache 為 10%(DeepSeek 技術報告)。
- 獨立評測成本對比:Artificial Analysis 單任務平均成本 V4-Flash $0.03 vs Kimi K3 $0.86 vs Claude Fable 5 $3.15(第三方獨立評測,經財經媒體轉引)。
- OpenRouter 呼叫量:V4-Flash 預覽版曾連續七週穩坐呼叫量第一(社群觀察,反映大規模 Agent 場景對性價比的偏好)。
以下為可核驗官方與第三方來源,發布前請以最新公告為準:
Hugging Face DeepSeek 模型卡(DeepSeek-V4-Pro、DeepSeek-V4-Flash)
爭議點:跑分好看,不代表沒有水分
- 跑分方法依賴 Harness,官方自己都在提醒別只看數字。Agent 類跑分全部基於 DeepSeek 自研且尚未公開發布的 Harness 極簡模式測得(max 檔位、top_p=0.95、temperature=1.0),在獨立社群復現之前應視為「廠商自報+特定框架」結果。
- 海外開發者回報了具體的可用性問題。據 21 世紀經濟報導援引的海外開發者社群回饋,V4-Flash 正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題。
- V4-Pro 正式版和 Harness 的具體上線時間目前未經證實。「8 月 10–20 日 GA」等窗口為未署名消息源或社群傳聞,DeepSeek 官方 changelog 原話只是「將盡快發布」。
- 企業融資與 IPO 傳聞同樣需要謹慎對待。多家媒體報導 DeepSeek 近期完成約 74 億美元融資、估值約 487 億美元等資訊,目前主要來自財經媒體「據報導」「消息人士稱」,尚無官方或監管備案文件直接確認。
影響與背景:從「梁白開」到「梁聖」,價格戰進入下一輪
在 V4 正式版發布之前,因 Pro 版本遲遲沒有兌現「7 月中旬全量上線」的預期,中文 AI 社群一度把 DeepSeek 創辦人梁文鋒戲稱為「梁白開」。V4-Flash-0731 上線後,因實際表現超出預期,不少網友又把「梁聖」的稱號還了回去。
更值得關注的是中文開發者社群流傳的「斬殺線」說法:DeepSeek 憑藉「夠用的效能 + 極端低價」給同業設下門檻——友商模型若效能沒有明顯超過 DeepSeek,又拿不出更低價格,就會在市場上失去存在感。這也解釋了近期 GPT-5.6 Luna 低價版一次性降價 80% 等密集調價動作。7 月 31 日 V4-Flash 正式版上線當天,輝達、博通、AMD 等算力晶片股並未出現明顯波動——市場似乎已習慣「DeepSeek 式效率突破」敘事,不再簡單把「用更少算力做到同等效果」等同於「利空算力股」。
FAQ
DeepSeek V4 和之前的 V3.2 相比,最大的區別是什麼?
最直接的區別是原生支援 100 萬 token 上下文,且長上下文場景下的運算與顯存開銷大幅降低(官方數據:V4-Pro 在百萬 token 上下文下所需 FLOPs 僅為 V3.2 的 27%,KV Cache 僅為 10%)。此外 V4 系列在 Agent 能力上做了專項優化,適配了 Claude Code、OpenCode 等主流 Agent 工具。
日常使用應該選 V4 Flash 還是 V4 Pro?
如果只是普通對話、簡單任務或者需要大規模、低成本呼叫(比如批次處理、Agent 管線),目前的 V4-Flash-0731 正式版性價比更高,且 Agent 跑分已經反超 V4-Pro 預覽版。如果任務涉及更深的世界知識或複雜推理,且預算不敏感,可以先用 V4-Pro 預覽版,等正式版上線後再評估是否需要切換。
現在能用上 V4 Pro 正式版嗎?
截至本文發稿(2026 年 8 月 5 日),還不能。目前上線的正式版只有 V4-Flash-0731,且僅限 API 呼叫,App 和網頁端還是舊版本。V4-Pro 正式版和自研 Harness 框架官方口徑是「盡快發布」,沒有確切上線日期。
DeepSeek 公布的跑分能直接相信嗎?
建議區分對待。像 SWE-bench Verified 這類被廣泛採用、方法論透明的第三方基準,可信度相對較高;但 Terminal Bench 2.0 等 Agent 類跑分是用 DeepSeek 自研且未公開的 Harness 測出來的,官方自己也提示這類數字對框架選擇高度敏感,建議等社群用其他 Agent 工具獨立復現後再下結論。
這次更新對一般開發者有什麼實際影響?
如果你在用 OpenAI ChatCompletions 或 Anthropic 格式的 API 接入 DeepSeek,不需要改程式碼,deepseek-v4-flash 這個 model 名會自動指向新的正式版本。如果你此前用的是已經停用的 deepseek-chat/deepseek-reasoner,需要盡快切換到新命名,官方已在 7 月 24 日正式停用舊名稱。
DeepSeek V4-Flash-0731 把「夠用智能 + 極致低價」的 Agent API 路線推到了新高度,但 Harness 尚未公開、V4-Pro 正式版仍無確切日期——在第三方復現完成之前,若你需要在真實 Apple Silicon 硬體上驗證本地 Agent 工作流、對比不同 harness 下的實際表現,一台整機獨享、可隨時重置環境的實體主機往往比共享 GPU 叢集更可控。VMSPIN 按天起租的雲端 Mac mini 提供 MDM 自動交付與 SSH + VNC 雙通道接入,適合短期 benchmark 與多工具鏈對比;若你還在評估 API 成本與本地部署方案,可結合 Mac mini M4 租賃全解析 與 定價頁 一起測算。