中國AI新創DeepSeek深夜無預警出招。2024年8月12日深夜,官網API文件悄悄將模型切換至「DeepSeek-V4-Pro-0813」,顯示V4 Pro正式版很可能已透過API上線。更受矚目的是,社群流出的評測顯示,新版在多項AI智能體(Agent)測試中逼近Anthropic的Claude Fable 5,部分項目甚至超越;加上幾乎與Grok 4.6同步登場,前沿AI模型的效能與價格戰再度升溫。

從DeepSeek官網變化來看,這次V4 Pro正式版上線相當低調。目前官方API「模型與價格」頁面已將deepseek-v4-pro對應版本標示為DeepSeek-V4-Pro-0813,支援100萬Token上下文、最高38.4萬Token輸出,以及JSON Output、Tool Calls、Responses API、Anthropic API與FIM等功能。

官方「首次呼叫API」頁面也已將deepseek-v4-pro列為可呼叫模型,並提供思考模式的呼叫範例,顯示新版模型已進入實際服務階段。

不過,DeepSeek至今仍未同步發布V4-Pro-0813的正式更新日誌。官方更新頁面最新公告仍停留在7月31日的V4 Flash正式版,當時明確表示僅升級V4 Flash API,V4 Pro API及App、Web端模型並未改變,同時預告「DeepSeek-V4-Pro正式版將會盡快發布」。

因此嚴格來說,目前較精確的說法是V4 Pro正式版已透過API上線,而非DeepSeek已正式發布完整的V4 Pro產品公告。

真正引發AI社群關注的,是流傳中的新版評測對比表。多家科技媒體引述DeepSeek官方群組發布的資料指出,DeepSeek-V4-Pro-0813在多項測試中的表現已接近Fable 5,相較先前V4 Pro預覽版有明顯提升,其中又以智能體相關測試最受矚目。

不同於傳統大型語言模型主要比較知識問答、數學與邏輯推理,Agent測試更著重AI實際「幹活」的能力,包括工具呼叫、多步驟任務、程式碼編寫與修改,以及持續執行複雜工作,而這正是DeepSeek V4系列一路押注的方向。

DeepSeek今年4月推出V4預覽版時便強調,V4 Pro在Agentic Coding評測中達到當時開源模型領先水準,並針對Claude Code、OpenClaw、OpenCode、CodeBuddy等主流Agent產品進行適配與最佳化,同時支援100萬Token上下文與思考模式。

到了7月底,V4 Flash正式版進一步強化智能體能力,DeepSeek公布Terminal Bench 2.1、NL2Repo、DeepSWE與Toolathlon verified等多項測試成績,並稱正式版Agent能力已大幅超越V4-Pro-Preview。如今V4 Pro正式版進一步逼近Fable 5,意味DeepSeek在Agent領域累積的後訓練與工程最佳化,正逐步轉化為更強的實際任務執行能力。

不過,目前新版評測表主要來自官方群組及社群流傳,DeepSeek尚未在官方更新日誌公布V4-Pro-0813的完整基準測試成績,因此相關分數仍屬非正式披露,不能完全等同官方正式公布的基準成績。

除了性能,價格也是此次V4 Pro更新的另一大焦點。目前DeepSeek API價格頁面顯示,新版V4 Pro並未隨能力升級同步調漲價格,延續先前大幅降價後的低價策略。

但低價可能不會維持太久。DeepSeek已在官網價格頁面明確預告,計畫在不久的將來調高DeepSeek API服務整體價格,而且「預計漲幅較大」,實際價格則有待官方後續通知。

換言之,現階段V4 Pro正式版呈現「效能升級、價格暫時不變」的狀態,但未必能長期維持。這也讓此次更新更像是在漲價前先完成一波模型效能升級與產品切換,再視算力供給、呼叫量及商業化狀況調整價格。

更巧的是,DeepSeek V4 Pro-0813上線時間,幾乎與Grok 4.6正面撞車。

就在DeepSeek新版模型悄悄現身前幾個小時,Grok 4.6才剛發布。根據檔案資料,Grok 4.6在Artificial Analysis推出的GDPVal-AA v2智能體評估中拿下1753 Elo,排名第一;Artificial Analysis Intelligence Index則取得61分

價格同樣成為Grok的主要武器。Grok 4.6 API定價為每百萬輸入Token 2美元、輸出6美元,主打相較其他前沿模型更低的成本。如今DeepSeek V4 Pro-0813又在多項測試中逼近Fable 5,同時維持低價,兩款模型幾乎同時向市場釋出相同訊號:前沿模型之間的能力差距持續縮小,而價格正成為下一階段更重要的競爭武器。

過去AI模型競爭主要圍繞「誰是最強模型」展開,但當DeepSeek、Grok等模型不斷向第一梯隊逼近,市場的比較方式也開始改變。如果效能差距已縮小到一定程度,開發者是否還願意為更昂貴的模型支付數倍成本,正成為新的競爭焦點。

DeepSeek V4 Pro此次升級的意義,也不只是一次普通版本迭代。

今年4月推出V4時,DeepSeek已將重心由傳統聊天模型轉向Agent,把百萬Token上下文、程式碼工程與工具呼叫能力列為核心賣點;隨後V4 Flash正式版又進一步強化Code Agent、Search Agent等能力。

如今V4 Pro正式版持續向Fable 5等頂級閉源模型靠攏,顯示DeepSeek的競爭目標已不只是打造「更便宜的通用大模型」,而是試圖在AI從聊天走向實際工作的過程中,搶占Agent基礎模型的位置。

這也與Grok 4.6的升級方向不謀而合。Grok 4.6同樣將長時間運行的智能體、複雜程式設計與知識工作列為重點,並透過開發者工具提供服務。

DeepSeek V4 Pro-0813與Grok 4.6幾乎同日登場,某種程度也折射出AI產業競爭進入新階段:前沿模型戰場正從單純比拚參數、聊天與基準測試能力,轉向智能體執行能力、Token成本與開發者生態的全面較量。

FACT BOX · 重點整理

  • 來源:PR Times
  • 分類:新品
  • 相關組織:Anthropic / xAI / OpenAI
  • 原文日期2024年8月12日 / 2024年7月31日
  • 產品、服務:DeepSeek-V4-Pro / DeepSeek API