Google Gemini 3.7 Flash 快攻:不是跑分翻身,而是把 Agent 成本打下來 封面圖
科技

Google Gemini 3.7 Flash 快攻:不是跑分翻身,而是把 Agent 成本打下來

Gemini 3.7 Flash 以三週迭代與一半 API 定價,主打程式開發與 Agent 工作流。本文剖析 Google 為何急著推 Flash、企業真正該測的指標,以及 Pro 缺席背後的競爭壓力

背景:Pro 缺席時,Google 先拿 Flash 補位

Gemini 3.7 Flash 推出得很快。三週前 Google 才放 Gemini 3.6 Flash,這次直接升到 3.7,並把 API 定價砍半到 2026 年底。表面是模型升級,背後是補位:旗艦 Gemini 3.5 Pro 延遲,但開發者與企業不會等。coding、agent、文件處理這些高頻工作流,已經開始決定誰能先嵌入生產環境。Google 選擇先把夠用、便宜、能跑的 Flash 推進去,讓團隊先接上 prompt、工具呼叫與評測流程。

急著推 Flash,是因為 Pro 還在補課

我比較在意的是時間點。Google 沒有把這次發布包裝成「新一代旗艦」,而是直接說它是 coding 與 agent 的 workhorse。這很務實,因為企業現在不是只看誰的模型最聰明,而是看誰能把任務穩定做完,同時把成本壓下來。

Gemini 3.5 Pro 之前被期待在五月後推出,後來變成 partner testing,再變成沒有明確時間表。Reuters 提到它曾因為 coding 表現未達內部目標而延後,Google 也開始訓練更激進的 Gemini 4。同一時間,Google DeepMind 也出現人事大變動:Demis Hassabis 轉任 Chairman 與 Alphabet chief scientist,Koray Kavukcuoglu 接手 DeepMind 日常營運,Jeff Dean、Oriol Vinyals、Quoc Le、Sanjay Ghemawat 離開成立 Discovery Loop。這一串消息放在一起,意思很簡單:Google 的 AI 組織正在重組,而產品線不能停。

所以 Flash 這條線變成急先鋒。它不需要等到所有 frontier 能力都到位,只要能在高頻工作流裡比上一版更可靠、比對手更便宜,就有機會把開發者綁進 ecosystem。

真正的痛點:Agent 不是跑一次模型,是一整條生產線

很多 benchmark 看起來像比「誰更會寫程式」,但真正落地的痛點不是單次生成。一個 coding agent 要讀 repo、改檔案、跑測試、修 bug、再重新執行;一個 business agent 要讀 PDF、抓欄位、呼叫工具、更新系統、再產出給人工複核的文件。任何一步失誤,都會把成本放大。

Google 對 Gemini 3.7 Flash 的重點,不是「少思考」,而是「更認真地規劃」。3.6 比較像降低 reasoning steps、conversational turns、tool calls,避免 execution loop 失控;3.7 則是把 effort 放回 planning,再提高執行品質。這個轉向很關鍵,因為 agent 的問題不是步數越少越好,而是每一步都要更值得

Google 真正想賣的不是「更聰明一點」,而是「每完成一次任務更便宜」。

這也解釋為什麼價格是核心。2026 年底前,Gemini 3.7 FlashAPI 定價是 $0.75 per million input tokens、$3.75 per million output tokens,context caching 則是 $0.075 per million tokens。2027 年 1 月 1 日起,輸入回升到 $1.50,輸出到 $7.50,cache 到 $0.15。對高頻 agent 來說,一個使用者請求可能觸發一串模型呼叫、reasoning tokens、tool interactions。如果模型便宜但重試多,總成本不一定低。Google 現在是想用「低價 + 首通成功率提升」這個組合,讓企業有理由先跑量測試。

模型 輸入價格 輸出價格 FrontierCode 1.1 Main DeepSWE v1.1 Code Arena Elo AutomationBench GDP.PDF
Gemini 3.7 Flash(2026 年底前) $0.75 / M tokens $3.75 / M tokens 43.6% 65.3% 1588 30.4% 34.0%
Gemini 3.6 Flash $1.50 / M tokens $7.50 / M tokens 34.4% 49.0% 1538 17.0% 22.0%
Claude Sonnet 5 $2 / M tokens $10 / M tokens 42.7% 1541 10.7% 28.0%
GPT-5.6 Terra $2 / M tokens $12 / M tokens 41.3% 69.6% 1523 23.6% 24.7%

表格裡可以看出,Gemini 3.7 Flash 的進步不是全面壓倒。GPT-5.6 TerraDeepSWE v1.1Terminal-bench 等項目仍佔優,Claude Sonnet 5 在多模態 desktop 與 OS 任務上也比較強。Artificial Analysis 的整體 index 也把 Claude Opus 5 放在前面,Gemini 3.7 Flash 是 56,比 3.6 的 52 高,但沒有回到第一線。但 Google 抓的是 coding、web development、document comprehension、workflow automation 這些比較容易變成規模化場景的項目。對企業來說,這比「總榜第一」更有用。

未來一到兩年:Flash 會變成企業流水線規格,Pro 決定品牌天花板

我預測未來一年到兩年,AI 模型競爭會更明顯分成兩層。

第一層是 Flash / workhorse 層。這層拼的是延遲、價格、工具呼叫穩定度、與既有系統整合。Google 有 Gemini Enterprise Agent PlatformGemini EnterpriseSpark,再加上 Workspace、Android、Cloud、custom AI chips,它很適合把模型塞進日常工作流。開發者會先問:我能不能用更便宜的 token 跑更多 agents?能不能把文件整理、email 草稿、status update、code review 這些事先自動化?

第二層是 Pro / frontier 層。這層拼的是最難的推理、最複雜的 coding、最長程的規劃,以及品牌聲量。Gemini 3.5 Pro 的延遲與人事變動,讓 Google 在這一層暫時比較被動。SemiAnalysis 認為 Google 可能更重視向 AI 公司賣雲與基礎設施,而不是死守模型前端;The Verge 則認為 Google 仍有很深的分發與平台優勢。Google 也強調 Gemini app 月活躍用戶已超過 950 million,這讓它有分發優勢。我的看法是,兩者都在說同一件事:Google 短期內不會因為一個 Pro 缺席就掉隊,但如果 Gemini 4 再慢下來,市場對它「前沿領導者」的敘事會更冷。

對開發團隊而言,真正該做的不是追著 leaderboard 換模型,而是建立自己的 task-level benchmark。你的 repo、prompt、tool schemas、failure modes 跟公開測試集不一定一樣。我建議至少測三件事:

  • 每成功完成任務的成本:包含 retries、人工修正、工具呼叫失敗與重跑。
  • 首通穩定度:第一次生成結果能直接用多少,需要多少 human oversight。
  • 跨文件工作流:PDF、表格、email、ticket、code 之間能不能串起來,而不是只測單一 prompt。

Gemini 3.7 Flash 的折扣期,就是用來跑這類測試的窗口。如果 2027 年回升到全價後,它的 cost per task 仍然比對手低,或者至少穩定度足以抵銷價格差,Google 就能把 Flash 變成企業 agent 流水線的預設選項。

延伸思考與常見問題

點選問題可展開答案

  • Q1:為什麼 Google 會在三週內就推出 Gemini 3.7 Flash,而不是等下一代 Pro?

    因為 Flash 是企業大量跑 agent 與 coding 的主力,低延遲、低成本與快速迭代能直接搶下開發者與工作流;Pro 還在內部調整,Google 先讓可量產的模型落地。

  • Q2:所謂的入門優惠到 2027 年會怎樣?

    2026 年底前輸入 $0.75、輸出 $3.75 每百萬 token,2027 年 1 月 1 日起回升到 $1.50 與 $7.50,這代表折扣是導入測試期,不是永久定價。

  • Q3:企業該看 token 價格,還是看跑分?

    單一指標都不夠,真正該測的是每成功完成任務的成本,包含重試、人工修正、工具呼叫失敗與文件處理穩定度。

🪙

開始您的加密貨幣之旅

立即註冊全球最大加密貨幣交易所 幣安 (Binance),使用專屬推薦碼 CLICK168,即可享有手續費終身優惠與專屬的新人迎新大禮包!

👉 領取幣安專屬註冊優惠