Grok 4.6 不是跑分第三,是企業 AI 的成本刺客與品牌地雷 封面圖
科技

Grok 4.6 不是跑分第三,是企業 AI 的成本刺客與品牌地雷

SpaceXAI 推出 Grok 4.6,Artificial Analysis 排第三,追平 GPT-5.6 Sol Max 並壓過 Kimi K3。我的看法是,真正勝負手不在跑分,而在長任務 agent 成本、API 分層定價與品牌風險。

SpaceXAI 把 Grok 4.6 丟出來,Artificial Analysis 排第三,追平 GPT-5.6 Sol Max,也壓過 Kimi K3。我的第一反應不是「啊,第三」,而是:這代 Grok 終於把戰場從聊天室搬到工廠。它主打 long-running agents、coding、knowledge work,API 起價 $2 / $6,還直接進 CursorGrok Build。跑分只是門票,真正會決定它能不能賣出去的,是企業算完 token、turns、brand risk 之後,還敢不敢把它放進生產環境。

先看跑分。Grok 4.6GDPVal-AA v2 拿到 1,753 Elo,比上代 Grok 4.5 的 1,526 高很多,也超過 GPT-5.6 Sol Max 的 1,728,接近 Fable 5 Max 的 1,741。coding 方面,CursorBench 從 66.7% 升到 69.9%DeepSWE 從 54% 拉到 65.9%,確實像換了一代。但別急著喊它全面超越:Terminal-Bench 只有 26%GPT-5.6 Sol MaxFable 5 Max 都在 34% 上下。換句話說,Grok 4.6 很會跑「看起來像產品」的長任務,但一旦進入更硬的 terminal 操作,還是差一截。

更值得盯的是錢。Grok 4.6 標準 API 起價 $2 / $6,表面比 GPT-5.6 Sol$5 / $30 便宜很多。可是 Artificial Analysis 的 cost-per-task 把它放在 $0.84,還不如上代 Grok 4.5 划算,也打不過 GPT-5.6 LunaGLM-5.2Muse Spark 1.2 這類選項。這裡有個盲點:模型便宜不等於 workflow 便宜。agent 的錢會花在 tool calls、retry、cache、prompt 長度,還有它自己要不要多繞兩圈。若它能在 AA-Briefcase53 turns、約 0.5B input tokens 做完,而 Claude Opus 5 Max103 turns、約 2B input tokens,那對某些團隊就是真省。但別把 benchmark 數字直接當生產發票。

我對 Grok 一直有個不舒服的地方:它的品牌太吵。MechaHitler、white genocide、吹捧 Musk、非自願性化影像,這些不是舊聞,是採購表上的紅字。SpaceX 今年二月收編 xAI,改名 SpaceXAI,但 consumer-facing brand 還是 Grok。對一般 developer,可能只在乎 price、latency、task completion;對銀行、政府、醫療或 consumer brand,vendor governance、content safety、auditability 會直接決定它能不能進 shortlist。跑分表量不到這塊,但 loss of trust 可以量到:一則新聞就能讓 CIO 多開三場會議。

位置 我的判斷
贏家 成本敏感的 agent 開發者 Grok 4.6 起價 $2 / $6,又直接進 Cursor,對想先跑 long-running agent 的人很有誘惑力
輸家 高價 frontier 訂閱 GPT-5.6 SolClaude Fable 5 仍強,但價格差會讓部分團隊先拿 Grok 做 A/B
雷區 品牌與合規敏感客戶 過去 Grok 的爭議不是小 bug,而是採購表上的紅字,金融、醫療、政府可能直接扣分

我真正擔心的是:Grok 4.6 可能不是「最強的第三」,而是「最便宜、最會跑、但也最容易上新聞的第三」。對企業來說,模型不是買最強,而是買「不會把品牌一起燒掉」。

我的看法很簡單:Grok 4.6 不是無敵的第三,它是一台很會跑、價格夠狠、但背著歷史包袱的 agent 引擎。如果 SpaceXAI 能把安全控制、合規文件、生產穩定性講清楚,它很可能吃掉一批原本在 ClaudeGPT 之間糾結的團隊。若只是喊「更便宜、更能幹」,那它最可能變成開發者的實驗選項,而不是企業的主力模型。下一場比賽不在 leaderboard,在 invoice。

延伸思考與常見問題

點選問題可展開答案

  • Q1:Grok 4.6 的 API 價格為什麼不能只看 $2/$6?

    因為 prompt 超過 200K tokens 後,input/output 價格會翻倍到 $4/$12,長上下文工作要按分層價格估算成本。

  • Q2:Artificial Analysis 的 cost-per-task 和 token 價格差在哪?

    token 價格是每百萬輸入與輸出的報價,cost-per-task 則是模型實際完成一個任務所花的錢,會包含 turn 數、token 消耗與工具調用。

  • Q3:Grok 4.6 的品牌爭議為什麼會影響企業採購?

    企業不只看模型能力,也會看供應商治理、內容安全與合規風險,過去 Grok 的爭議可能讓金融、醫療或政府客戶不敢直接上線。

🪙

開始您的加密貨幣之旅

立即註冊全球最大加密貨幣交易所 幣安 (Binance),使用專屬推薦碼 CLICK168,即可享有手續費終身優惠與專屬的新人迎新大禮包!

👉 領取幣安專屬註冊優惠