中國AI新創DeepSeek正式推出DeepSeek-V4-Flash API,官方表示,新版本在維持原有模型架構與參數規模不變的情況下,僅透過重新進行後訓練 (Post-training),便大幅提升AI Agent能力。其中,在DeepSWE基準測試的表現較三個月前的V4-Pro Preview暴增超過6倍,同時API價格維持極低水準,最低僅每百萬Token 0.02元(人民幣,快取命中),引發開發者社群高度關注。

DeepSeek表示,V4-Flash正式版採用MoE(Mixture of Experts)架構,總參數量2,840億,實際啟用參數約130億,支援100萬Token上下文,並可切換思考模式與非思考模式。

官方公布九項Agent相關基準測試,其中提升幅度最明顯的是DeepSWE,評分由預覽版的7.3分大幅躍升至54.4分,增幅超過6倍。Terminal Bench 2.1測試中,V4-Flash正式版獲得82.7分,不僅高於V4-Pro Preview的72.1分,也超越GLM-5.2的81.0分,僅略低於Claude Opus 4.8的85分

在Artificial Analysis公布的智慧能力指數(Intelligence Index)測試中,V4-Flash-0731最高推理模式獲得50分,而同級模型中位數僅17分,顯示整體Agent能力已達領先水準。

DeepSeek此次最大的特色,在於模型骨架完全沒有改變。官方指出,V4-Flash-0731與預覽版維持相同模型架構、相同模型尺寸與參數規模,唯一變化就是重新進行後訓練流程。這也讓外界重新思考,大模型未來的競爭是否將由「擴大參數」逐漸轉向「提升後訓練效率」。

官方同時推出自研Agent測試框架DeepSeek Harness,協助開發者驗證模型在多步驟任務、自主規劃及工具調用等場景的實際能力。

價格方面,DeepSeek持續維持低價策略。官方表示,輸入Token快取命中價格為每百萬Token 0.02元,未命中為1元,輸出價格2元。若換算美元,輸出成本約0.28美元,約為Anthropic Claude Opus 4.8每百萬輸出Token約25美元的1/90。

不少開發者分享實測成果。有使用者表示,透過官方API搭配Claude Code,連續運作近4小時共消耗約1億Token,快取命中率達99%,總花費不到人民幣1元,且程式碼品質良好,返工次數大幅降低;也有開發者指出,模型一次即可完成程式撰寫並修正十多項Bug,整體成本僅約0.1美元。

從事Qt/C++與STM嵌入式開發的工程師則認為,V4-Flash-0731整體能力已相當接近V4-Pro Preview,但價格便宜許多,具有極高性價比。

不過,目前V4-Flash仍僅提供API公測,網頁版與App尚未更新,普通使用者暫時無法直接體驗。此外,也有部分開發者指出,新版本在指令遵循、Agent模式語言控制及嵌入式程式碼品質方面仍有改善空間,例如推理語言目前固定為英文,System Prompt亦無法完全生效,GitHub已有使用者建議開放更多語言控制參數。

工程能力方面,V4-Flash正式支援OpenAI Responses API,可直接整合Codex CLI、ChatGPT桌面版及VS Code Codex外掛,降低開發者接入成本。官方指出,目前Responses API僅支援V4-Flash,V4-Pro預計8月初加入支援。

在長上下文運算效率方面,DeepSeek表示,100萬Token場景下,V系列每Token推理計算量已降至V3.2的27%,KV Cache占用也降至約10%,可大幅降低長鏈任務的GPU算力與顯存需求。

值得注意的是,就在DeepSeek發布V4-Flash正式版同一天,OpenAI也宣布GPT-5.6 Luna API價格調降80%。市場認為,全球AI模型價格競爭正快速升溫,而DeepSeek此次透過後訓練,在未增加模型規模下實現Agent能力大幅提升,也反映大型語言模型競賽正逐漸由「拼參數」轉向「拼訓練效率」。

DeepSeek-V4-Flash與V4-Pro API規格比較

項目 DeepSeek-V4-Flash DeepSeek-V4-Pro

OpenAI格式Base URL https://api.deepseek.com https://api.deepseek.com

Anthropic格式Base URL https://api.deepseek.com/anthropic https://api.deepseek.com/anthropic

模型版本 DeepSeek-V4-Flash-0731 DeepSeek-V4-Pro

思考模式 支援思考/非思考模式切換 支援思考/非思考模式切換

上下文長度 100萬Token 100萬Token

最大輸出 384K Token 384K Token

JSON Output 支援 支援

Tool Calls 支援 支援

Responses API 支援 暫不支援(預計2026年8月初加入)

Anthropic API 支援 支援

對話前綴續寫(Beta) 支援 支援

FIM補全(Beta) 僅非思考模式支援 僅思考模式支援

百萬Token輸入(快取命中) 0.02元 0.025元

百萬Token輸入(快取未命中) 1元 3元

百萬Token輸出 2元 6元

最大並發限制 2,500 500

補充說明

項目 內容

Responses API 目前僅支援DeepSeek-V4-Flash,官方預計2026年8月初支援V4-Pro

API尖峰計價 將採尖峰費率,高峰價格為平時2倍

高峰時段 北京時間每日9:00-12:00、14:00-18:00

FACT BOX · 重點整理

  • 來源:PR Times
  • 分類:新品
  • 相關組織:Anthropic / OpenAI / Zhipu AI (GLM)
  • 原文日期2026年8月初旬
  • 產品、服務:DeepSeek-V4-Flash API / DeepSeek-V4-Pro API