馬斯克旗下的SpaceXAI(原xAI)於週三(12日)正式推出新一代旗艦模型Grok 4.6,將主要升級方向鎖定長時間運行的AI代理(Agent)、複雜程式設計、知識工作及互動與視覺任務。SpaceXAI表示,Grok 4.6在多項前沿模型測試中已進入第一梯隊,同時以每100萬個輸入Token 2美元、輸出Token 6美元的價格切入市場,約為部分競爭對手的一半,企圖以「高性能+低成本」策略搶攻開發者市場。

SpaceXAI在官方公告中表示,Grok 4.6是在Grok 4.5基礎上進一步強化,特別針對長時間運行的Agent及更具挑戰性的互動、視覺工作。新模型可以處理需要多步驟執行的研究工作、程式碼庫分析及應用程式開發,並在更長的任務過程中進行自主測試與驗證,讓模型不只是回答問題,而是能持續完成一項完整工作。

SpaceXAI指出,Grok 4.6接受比Grok 4.5更長的補充訓練,訓練資料包括經過篩選的模型生成推理資料及高品質工程資料,同時改進最佳化器與訓練方法。公司並利用Grok 4.5生成不同推理強度、Agent框架以及STEM、軟體工程和知識工作等領域的SFT軌跡,再透過強化學習訓練Grok 4.6執行通用程式設計、知識工作、核心程式最佳化、網頁開發及電腦輔助設計等任務。

這次升級最受市場關注的之一,是Grok 4.6在Artificial Analysis Intelligence Index取得61分,與OpenAI的GPT-5.6 Sol並列。Artificial Analysis指出,該指數綜合多項測試,用來評估模型在數學、科學、程式設計與推理等不同能力的整體表現。Grok 4.6因此進一步縮小與頂級模型之間的性能差距。

在GDPVal-AA v2測試中,Grok 4.6則取得1,753 Elo,高於GPT-5.6 Sol的1,728分及Anthropic旗下Claude Fable 5的1,741分。這項測試著重於具有實際經濟價值的專業工作,包括不同職業與產業的知識工作任務,更接近企業實際導入AI代理後可能面對的工作場景。

不過,Grok 4.6並非在所有評測中都取得第一。SpaceXAI公布的其他測試顯示,新模型在CursorBench v3.2取得69.9%,高於Grok 4.5 High的66.7%;FrontierCode v1.1達61.3%,高於前代56.6%;APEX-Agents達57.5%,高於前代47.1%;APEX-SWE為56.4%,高於前代53.6%;AA-Briefcase則由前代1,313分提升至1,577分;Harvey LAB也由12.9%提高至15.8%

在部分測試中,競爭對手仍然領先,因此較準確的說法是Grok 4.6已在多項Agent、程式設計及知識工作測試進入頂級模型行列,而非全面擊敗所有競爭模型。Artificial Analysis的排名也會隨模型新增與測試更新而變動,因此SpaceXAI公布的排名主要反映發布時點的橫向比較。

除了模型性能,Grok 4.6的價格策略更可能成為AI產業下一階段競爭的焦點。SpaceXAI將標準API價格設定為每100萬個輸入Token 2美元、每100萬個輸出Token 6美元,並提供速度更快、價格約為兩倍的版本。公司宣稱,標準版本價格約為其他前沿模型的一半。

這項定價策略將Grok 4.6直接推向開發者及企業AI市場。相較之下,市場目前對前沿模型的競爭已逐漸從單純比拚基準測試,延伸到每次推理成本、Token效率、速度以及能否完成實際工作的能力。當模型性能逐漸接近時,相同工作究竟需要多少運算成本,很可能成為企業選擇模型的重要因素。

不過,API單價並不代表所有任務的最終成本都會同比下降。不同模型的Token消耗、推理強度、任務執行時間以及Agent需要呼叫多少次工具,都會影響實際使用成本。因此,Grok 4.6的「半價」主要是API標價上的比較,並不意味著所有應用場景的總成本都一定低50%

SpaceXAI也同步擴大Grok 4.6的開發者通路。新模型已提供給Cursor、Grok Build及API使用,並透過OpenRouter、Vercel及Cloudflare(NET-US)等平台與服務商提供。SpaceXAI表示,上線首周Cursor與Grok Build用戶可獲得2倍包含用量,讓開發者能以更低門檻測試新模型。

這也延續SpaceXAI近幾個月積極搶攻AI程式開發市場的策略。公司7月推出Grok Build開源版本,將旗下程式設計Agent的核心框架公開,包括上下文組裝、工具調用、程式碼讀取與修改、命令執行、技能、插件及子Agent等功能,並允許開發者在本地環境運行。

Grok Build原先已被SpaceXAI定位為面向專業軟體工程與複雜程式設計工作的Coding Agent,使用者可以先讓模型規劃工作,再審核與批准執行計畫,每次程式碼修改也會以差異檔案方式呈現。Grok 4.6此次進一步強化Agent能力,等於為這套開發工具提供更強大的模型引擎。

SpaceXAI此次還特別強調,Grok 4.6在「把想法變成產品」方面有明顯提升。面對一個模糊的產品概念,模型可以先研究陌生領域,設計應用架構,建立核心功能,再根據測試結果及使用者回饋進行多輪修改。在視覺及互動式專案中,新模型也能更快產出完整的第一版成果。

這種能力反映AI模型競爭正從「問答」走向「執行」。過去大模型主要以回答問題、生成文字或程式碼作為能力展示,現在OpenAI、Anthropic、Google及SpaceXAI等業者都逐步把Agent能力視為下一個競爭戰場,希望模型能自行使用工具、拆解任務、修改成果並完成長時間工作。

Grok 4.6在GDPVal-AA v2的表現尤其符合這項趨勢。SpaceXAI公布的1,753 Elo不只是一般知識問答成績,而是來自需要模型在Agent環境中完成實際專業工作的測試,因此公司試圖藉此證明新模型不只是「聊天能力」提升,而是已能處理更接近企業工作流程的任務。

馬斯克也迅速在社群平台X為新模型造勢。他轉發Grok 4.6取得1,753 Elo及在多項測試領先的相關內容,並對新模型作出高度評價。這也是馬斯克近期持續親自推廣Grok產品的最新例子。

從產業競爭角度來看,Grok 4.6的推出時間也值得注意。Grok 4.5才在7月16日發布,SpaceXAI不到一個月便推出下一代版本。Grok 4.5當時已將程式設計、Agent任務及知識工作列為主要能力,並強調與Cursor共同訓練,顯示SpaceXAI正在快速縮短模型迭代週期。

SpaceXAI近期也持續把Grok從聊天機器人擴展為完整AI工作平台。7月推出的Automations功能允許使用者設定一次工作,之後讓Grok按照排程或收到電子郵件等觸發條件自行執行,並回報結果;5月推出的Connectors則讓Grok直接連接企業及個人使用的應用程

FACT BOX · 重點整理

  • 來源:PR Times
  • 分類:新品
  • 相關組織:OpenAI / Anthropic / Google
  • 原文日期:7月16日 / 12日
  • 產品、服務:Grok 4.6 / Grok Build