背景:Pro 缺席時,Google 先拿 Flash 補位
Gemini 3.7 Flash 推出得很快。三週前 Google 才放 Gemini 3.6 Flash,這次直接升到 3.7,並把 API 定價砍半到 2026 年底。表面是模型升級,背後是補位:旗艦 Gemini 3.5 Pro 延遲,但開發者與企業不會等。coding、agent、文件處理這些高頻工作流,已經開始決定誰能先嵌入生產環境。Google 選擇先把夠用、便宜、能跑的 Flash 推進去,讓團隊先接上 prompt、工具呼叫與評測流程。
急著推 Flash,是因為 Pro 還在補課
我比較在意的是時間點。Google 沒有把這次發布包裝成「新一代旗艦」,而是直接說它是 coding 與 agent 的 workhorse。這很務實,因為企業現在不是只看誰的模型最聰明,而是看誰能把任務穩定做完,同時把成本壓下來。
Gemini 3.5 Pro 之前被期待在五月後推出,後來變成 partner testing,再變成沒有明確時間表。Reuters 提到它曾因為 coding 表現未達內部目標而延後,Google 也開始訓練更激進的 Gemini 4。同一時間,Google DeepMind 也出現人事大變動:Demis Hassabis 轉任 Chairman 與 Alphabet chief scientist,Koray Kavukcuoglu 接手 DeepMind 日常營運,Jeff Dean、Oriol Vinyals、Quoc Le、Sanjay Ghemawat 離開成立 Discovery Loop。這一串消息放在一起,意思很簡單:Google 的 AI 組織正在重組,而產品線不能停。
所以 Flash 這條線變成急先鋒。它不需要等到所有 frontier 能力都到位,只要能在高頻工作流裡比上一版更可靠、比對手更便宜,就有機會把開發者綁進 ecosystem。
真正的痛點:Agent 不是跑一次模型,是一整條生產線
很多 benchmark 看起來像比「誰更會寫程式」,但真正落地的痛點不是單次生成。一個 coding agent 要讀 repo、改檔案、跑測試、修 bug、再重新執行;一個 business agent 要讀 PDF、抓欄位、呼叫工具、更新系統、再產出給人工複核的文件。任何一步失誤,都會把成本放大。
Google 對 Gemini 3.7 Flash 的重點,不是「少思考」,而是「更認真地規劃」。3.6 比較像降低 reasoning steps、conversational turns、tool calls,避免 execution loop 失控;3.7 則是把 effort 放回 planning,再提高執行品質。這個轉向很關鍵,因為 agent 的問題不是步數越少越好,而是每一步都要更值得。
Google 真正想賣的不是「更聰明一點」,而是「每完成一次任務更便宜」。
這也解釋為什麼價格是核心。2026 年底前,Gemini 3.7 Flash 的 API 定價是 $0.75 per million input tokens、$3.75 per million output tokens,context caching 則是 $0.075 per million tokens。2027 年 1 月 1 日起,輸入回升到 $1.50,輸出到 $7.50,cache 到 $0.15。對高頻 agent 來說,一個使用者請求可能觸發一串模型呼叫、reasoning tokens、tool interactions。如果模型便宜但重試多,總成本不一定低。Google 現在是想用「低價 + 首通成功率提升」這個組合,讓企業有理由先跑量測試。
| 模型 | 輸入價格 | 輸出價格 | FrontierCode 1.1 Main |
DeepSWE v1.1 |
Code Arena Elo |
AutomationBench |
GDP.PDF |
|---|---|---|---|---|---|---|---|
Gemini 3.7 Flash(2026 年底前) |
$0.75 / M tokens | $3.75 / M tokens | 43.6% | 65.3% | 1588 | 30.4% | 34.0% |
Gemini 3.6 Flash |
$1.50 / M tokens | $7.50 / M tokens | 34.4% | 49.0% | 1538 | 17.0% | 22.0% |
Claude Sonnet 5 |
$2 / M tokens | $10 / M tokens | 42.7% | — | 1541 | 10.7% | 28.0% |
GPT-5.6 Terra |
$2 / M tokens | $12 / M tokens | 41.3% | 69.6% | 1523 | 23.6% | 24.7% |
表格裡可以看出,Gemini 3.7 Flash 的進步不是全面壓倒。GPT-5.6 Terra 在 DeepSWE v1.1、Terminal-bench 等項目仍佔優,Claude Sonnet 5 在多模態 desktop 與 OS 任務上也比較強。Artificial Analysis 的整體 index 也把 Claude Opus 5 放在前面,Gemini 3.7 Flash 是 56,比 3.6 的 52 高,但沒有回到第一線。但 Google 抓的是 coding、web development、document comprehension、workflow automation 這些比較容易變成規模化場景的項目。對企業來說,這比「總榜第一」更有用。
未來一到兩年:Flash 會變成企業流水線規格,Pro 決定品牌天花板
我預測未來一年到兩年,AI 模型競爭會更明顯分成兩層。
第一層是 Flash / workhorse 層。這層拼的是延遲、價格、工具呼叫穩定度、與既有系統整合。Google 有 Gemini Enterprise Agent Platform、Gemini Enterprise、Spark,再加上 Workspace、Android、Cloud、custom AI chips,它很適合把模型塞進日常工作流。開發者會先問:我能不能用更便宜的 token 跑更多 agents?能不能把文件整理、email 草稿、status update、code review 這些事先自動化?
第二層是 Pro / frontier 層。這層拼的是最難的推理、最複雜的 coding、最長程的規劃,以及品牌聲量。Gemini 3.5 Pro 的延遲與人事變動,讓 Google 在這一層暫時比較被動。SemiAnalysis 認為 Google 可能更重視向 AI 公司賣雲與基礎設施,而不是死守模型前端;The Verge 則認為 Google 仍有很深的分發與平台優勢。Google 也強調 Gemini app 月活躍用戶已超過 950 million,這讓它有分發優勢。我的看法是,兩者都在說同一件事:Google 短期內不會因為一個 Pro 缺席就掉隊,但如果 Gemini 4 再慢下來,市場對它「前沿領導者」的敘事會更冷。
對開發團隊而言,真正該做的不是追著 leaderboard 換模型,而是建立自己的 task-level benchmark。你的 repo、prompt、tool schemas、failure modes 跟公開測試集不一定一樣。我建議至少測三件事:
- 每成功完成任務的成本:包含 retries、人工修正、工具呼叫失敗與重跑。
- 首通穩定度:第一次生成結果能直接用多少,需要多少 human oversight。
- 跨文件工作流:PDF、表格、email、ticket、code 之間能不能串起來,而不是只測單一 prompt。
Gemini 3.7 Flash 的折扣期,就是用來跑這類測試的窗口。如果 2027 年回升到全價後,它的 cost per task 仍然比對手低,或者至少穩定度足以抵銷價格差,Google 就能把 Flash 變成企業 agent 流水線的預設選項。
延伸思考與常見問題
點選問題可展開答案
Q1:為什麼 Google 會在三週內就推出 Gemini 3.7 Flash,而不是等下一代 Pro?
因為 Flash 是企業大量跑 agent 與 coding 的主力,低延遲、低成本與快速迭代能直接搶下開發者與工作流;Pro 還在內部調整,Google 先讓可量產的模型落地。
Q2:所謂的入門優惠到 2027 年會怎樣?
2026 年底前輸入 $0.75、輸出 $3.75 每百萬 token,2027 年 1 月 1 日起回升到 $1.50 與 $7.50,這代表折扣是導入測試期,不是永久定價。
Q3:企業該看 token 價格,還是看跑分?
單一指標都不夠,真正該測的是每成功完成任務的成本,包含重試、人工修正、工具呼叫失敗與文件處理穩定度。