SpaceXAI 把 Grok 4.6 丟出來,Artificial Analysis 排第三,追平 GPT-5.6 Sol Max,也壓過 Kimi K3。我的第一反應不是「啊,第三」,而是:這代 Grok 終於把戰場從聊天室搬到工廠。它主打 long-running agents、coding、knowledge work,API 起價 $2 / $6,還直接進 Cursor 和 Grok Build。跑分只是門票,真正會決定它能不能賣出去的,是企業算完 token、turns、brand risk 之後,還敢不敢把它放進生產環境。
先看跑分。Grok 4.6 在 GDPVal-AA v2 拿到 1,753 Elo,比上代 Grok 4.5 的 1,526 高很多,也超過 GPT-5.6 Sol Max 的 1,728,接近 Fable 5 Max 的 1,741。coding 方面,CursorBench 從 66.7% 升到 69.9%,DeepSWE 從 54% 拉到 65.9%,確實像換了一代。但別急著喊它全面超越:Terminal-Bench 只有 26%,GPT-5.6 Sol Max 和 Fable 5 Max 都在 34% 上下。換句話說,Grok 4.6 很會跑「看起來像產品」的長任務,但一旦進入更硬的 terminal 操作,還是差一截。
更值得盯的是錢。Grok 4.6 標準 API 起價 $2 / $6,表面比 GPT-5.6 Sol 的 $5 / $30 便宜很多。可是 Artificial Analysis 的 cost-per-task 把它放在 $0.84,還不如上代 Grok 4.5 划算,也打不過 GPT-5.6 Luna、GLM-5.2、Muse Spark 1.2 這類選項。這裡有個盲點:模型便宜不等於 workflow 便宜。agent 的錢會花在 tool calls、retry、cache、prompt 長度,還有它自己要不要多繞兩圈。若它能在 AA-Briefcase 用 53 turns、約 0.5B input tokens 做完,而 Claude Opus 5 Max 要 103 turns、約 2B input tokens,那對某些團隊就是真省。但別把 benchmark 數字直接當生產發票。
我對 Grok 一直有個不舒服的地方:它的品牌太吵。MechaHitler、white genocide、吹捧 Musk、非自願性化影像,這些不是舊聞,是採購表上的紅字。SpaceX 今年二月收編 xAI,改名 SpaceXAI,但 consumer-facing brand 還是 Grok。對一般 developer,可能只在乎 price、latency、task completion;對銀行、政府、醫療或 consumer brand,vendor governance、content safety、auditability 會直接決定它能不能進 shortlist。跑分表量不到這塊,但 loss of trust 可以量到:一則新聞就能讓 CIO 多開三場會議。
| 位置 | 誰 | 我的判斷 |
|---|---|---|
| 贏家 | 成本敏感的 agent 開發者 | Grok 4.6 起價 $2 / $6,又直接進 Cursor,對想先跑 long-running agent 的人很有誘惑力 |
| 輸家 | 高價 frontier 訂閱 | GPT-5.6 Sol 與 Claude Fable 5 仍強,但價格差會讓部分團隊先拿 Grok 做 A/B |
| 雷區 | 品牌與合規敏感客戶 | 過去 Grok 的爭議不是小 bug,而是採購表上的紅字,金融、醫療、政府可能直接扣分 |
我真正擔心的是:
Grok 4.6可能不是「最強的第三」,而是「最便宜、最會跑、但也最容易上新聞的第三」。對企業來說,模型不是買最強,而是買「不會把品牌一起燒掉」。
我的看法很簡單:Grok 4.6 不是無敵的第三,它是一台很會跑、價格夠狠、但背著歷史包袱的 agent 引擎。如果 SpaceXAI 能把安全控制、合規文件、生產穩定性講清楚,它很可能吃掉一批原本在 Claude 和 GPT 之間糾結的團隊。若只是喊「更便宜、更能幹」,那它最可能變成開發者的實驗選項,而不是企業的主力模型。下一場比賽不在 leaderboard,在 invoice。
延伸思考與常見問題
點選問題可展開答案
Q1:Grok 4.6 的 API 價格為什麼不能只看 $2/$6?
因為 prompt 超過 200K tokens 後,input/output 價格會翻倍到 $4/$12,長上下文工作要按分層價格估算成本。
Q2:Artificial Analysis 的 cost-per-task 和 token 價格差在哪?
token 價格是每百萬輸入與輸出的報價,cost-per-task 則是模型實際完成一個任務所花的錢,會包含 turn 數、token 消耗與工具調用。
Q3:Grok 4.6 的品牌爭議為什麼會影響企業採購?
企業不只看模型能力,也會看供應商治理、內容安全與合規風險,過去 Grok 的爭議可能讓金融、醫療或政府客戶不敢直接上線。