過去這半年,Musk 的 AI 帝國簡直像坐過山車。xAI 內部聯合創始人全數出走、Grok 在社群上鬧出「MechaHitler」的風波,連歐洲監管單位都開查了。就在大家以為這趟車要脫軌時,SpaceX 直接甩出 Grok 4.5。這款模型不跟你談什麼頂尖智商,而是直接把底牌攤開:半價的 token 成本、兩倍的執行速度。在 agent 工作負載瘋長、開發者每天看著 API 帳單流淚的當下,這招「成本導向」的打法,其實是在告訴整個產業:聰明已經不是唯一門檻,能用得起才贏得到市場。
別再迷信排行榜,開發者要的是「算得下去」的模型
我觀察下來,現在大廠爭 benchmark 成績已經有點疲勞戰的味道。Grok 4.5 的邏輯很直接:它不打算在純智商上贏過 Claude Opus,而是把戰場拉到「每項任務的實際開銷」。 根據第三方評估,Grok 4.5 完成同一個任務的 token 消耗量大約只有對手的四分之一,單次任務成本壓到 0.49 美元,幾乎便宜了九成。這意味著什麼?當你的 AI agent 需要在背景裡連續跑幾個小時、讀取整個 codebase 時,省下的不是零錢,而是整間工程團隊的月度預算。
| 模型 | 輸入價格 (每百萬 token) |
輸出價格 (每百萬 token) |
任務成本預估 | 核心定位 |
|---|---|---|---|---|
| Grok 4.5 | $2 | $6 | ~$0.49 / 任務 | 成本效率優先,agent 導向 |
| Claude Opus 系列 | ~$15 | ~$75 | ~$2.80 / 任務 | 頂尖推理,複雜任務首選 |
| OpenAI GPT-4o | ~$2.50 | ~$10 | ~$1.90 / 任務 | 多模態通用,生態系龐大 |
表格裡這組數字擺在一起,企業採購的算盤一下就清楚了。不過話得說回來,便宜不等於夠用。編程這行有個特點:一次寫對的模型,長期來看可能比「便宜但要重跑三次」的模型更划算。所以 Musk 才強調,他們內部測試的標準是「Tesla 與 SpaceX 的硬核工程師覺得好用」,這其實是在避開 benchmark 的虛榮,直接對齊真實生產環境的體感。
$600 億買 Cursor,買的不只是軟體,是數據飛輪
很多人只看 Grok 4.5 的發表會,卻沒注意到這背後那筆驚人的交易。SpaceX 四月簽下 $600 億收購 Cursor 的權利,六月 IPO 後直接行權。這筆錢買到的不只是那個 AI 程式編輯器,更是頂級工程師在真實專案裡寫 code、改 bug、review 的高品質互動數據。Musk 早就放話,Cursor 的數據已經直接餵進 Grok 的訓練管道。
反過來,Cursor 拿到的是 SpaceX 孟菲斯的 Colossus 超算中心,大約二十萬張 Nvidia GPU,未來還要往百萬張衝。這就是一套完整的數據→訓練→分發閉環。我在想,這其實是一種很 Musk 的垂直整合手筆:你開發者用的工具、訓練模型的資料、跑模型的算力,甚至未來太空資料中心的電力,全在他自己手上。
「我們的內部評估是 Grok 4.5 大約跟 Opus 4.7 相當,但速度快很多。能力、更快的速度加上更低的成本,才是讓它具有競爭力的關鍵。我們正在閉合真實世界的實用性,而不是基準測試。」—— Elon Musk
但這裡藏了一個結構性風險。Cursor 本來是以「讓開發者自由選擇模型」起家,現在 Musk 剛發表 Grok 4.5 幾小時就喊話「去 Cursor 試試看!」。如果未來 Cursor 慢慢把 Grok 變成預設或推薦,那些原本提供數據的開發者會不會覺得被「吃乾抹淨」?再加上歐洲和英國的監管單位本來就盯著 Grok 的安全問題,數據、模型、分發管道三權合一,這塊蛋糕愈做愈大,監管的目光也會愈來愈銳利。
未來一到兩年:成本戰會打敗品質戰嗎?
展望接下來的一兩年,我認為這場仗不會只停留在「誰比較便宜」。AI 編程市場的整合速度已經很快了,Anthropic 今年穩坐 Disruptor 50 榜首,agent 性能排名依然領先。他們不可能坐視市占率被半價策略蠶食。我預測短期內會出現兩個趨勢:第一,混合定價模型會成為常態,大廠會推出「高品質高價」與「高效率平價」的雙軌制,讓企業依任務複雜度彈性切換;第二,「vibes」(開發者體感) 會從口語變成可量化的指標,第三方評估機構會開始追蹤模型在真實 repo 裡的錯誤率與重跑次數,而不只是跑 benchmark。
Musk 這一步,本質上是他老本行的延伸——他從來不是靠發明火箭或電動車發跡,而是靠把製造成本壓到極致。如果 Grok 4.5 的策略奏效,他會證明 AI 也能走「福特 Model T」的路;如果失敗,這 $600 億只是買了一個昂貴的教訓。對在場每個寫程式的人來說,不管結果如何,AI 從奢侈品變成工具的速度,已經比我們預期的快太多了。
延伸思考與常見問題
- Grok 4.5 的「任務成本」跟傳統的「每百萬
token價格」有什麼本質差異?為什麼agent場景特別吃這項指標? - SpaceX 同時掌控
Colossus算力、Grok 模型與 Cursor 分發渠道,這種垂直整合在監管層面可能觸發哪些反壟斷疑慮? - 文中提到的「vibes」(開發者體感)在實際的工程團隊裡,該如何被標準化或量化為採購決策的依據?