想像你要搬家。以前請一輛大貨車,裝得滿載但油錢燒得很兇,司機還經常繞路;現在換成一輛小型廂型車,雖然一趟裝不了那麼多,但跑一趟省一半油錢,而且司機特別會規劃路線,不走冤枉路。Google 這次推出的 Gemini 3.6 Flash 系列,就是在幹這件事。以前大家玩 AI 只在乎「聰不聰明」,現在市場終於轉念:與其讓模型傻傻地吐一堆廢話,不如讓它省著用腦力、精準下單。這背後反映的不是技術退步,而是 AI 從「玩具階段」正式邁入「商用算帳」的現實。
別再為 Token 燒錢了!Google 這次把「省錢公式」寫進模型裡
我常跟朋友開玩笑說,以前用 AI 就像在百貨公司吃自助餐廳:不管你能不能吃得下,每多夾一筷東西,帳單就跳一跳。AI 裡的那個計費單位 Token,基本上就是把文字拆成最小單位的「計價塊」。以前大型模型為了確保回答正確,常常會囉嗦地鋪陳一大堆推理步驟,結果客戶付的錢全花在「廢話」上。
這次 Google DeepMind 直接把 Gemini 3.6 Flash 的內建邏輯精簡了。根據第三方測試,在處理長篇軟體工程任務(像是從零開始寫一套複雜系統)時,它能省下高達 65% 的 Token;一般任務也省了 17%。簡單說,以前模型要走十步才能答對的問題,現在五步就搞定,而且吐出的字更少、更精準。對於天天靠 API 呼叫 AI 的開發者來說,這代表什麼?代表你的月度帳單直接砍掉一大截,預算終於能拿去買更多算力或測試新功能了。
三款新模型各吃哪一頓?一張表幫你挑對工具
Google 這次一次丟出三顆子彈,但每顆的攻擊目標完全不同。我幫大家整理了一張對照表,下次選型時直接照著填:
| 型號 | 主打場景 | 輸入/輸出價格(每百萬 Token) | 關鍵亮點 |
|---|---|---|---|
Gemini 3.6 Flash |
複雜程式碼、長文分析、多模態處理 | $1.50 / $7.50 | 省 Token 之王,工程任務效率高 |
Gemini 3.5 Flash-Lite |
高流量搜尋、大量文件批處理 | $0.30 / $2.50 | 速度最快,每秒 350 Token 輸出 |
Gemini 3.5 Flash Cyber |
資安漏洞掃描與修補 | 未公開(低於大型模型) | 搭配 CodeMender,專攻紅隊攻防 |
以前我們以為 AI 越胖越厲害,現在才發現,能精準省力的才是打工人的救星。
挑模型其實就跟選工具一樣。如果你每天要處理幾百萬份文件,Flash-Lite 就是那個不知疲倦的快打工人;如果你要寫複雜的後端架構或分析財報,3.6 Flash 才是正職;而資安團隊想自動補洞,就等 Flash Cyber 上線。特別提一下,Flash-Lite 雖然叫 Lite,但在 SWE-Bench Pro 這種程式碼測試裡居然打到 54.2%,比上一代標準版還強,這就很適合拿來跑高併發的 Agentic(自主代理)任務。
閉源租房子 vs. 買房子,Google 的算盤打得響亮
價格雖然漂亮,但我必須潑一盆冷水:這些模型都是閉源的。也就是說,你付錢租用 Google 的算力,但拿不到底層的權重檔案或訓練資料。跟你常聽的 MIT 或 Apache 2.0 開源授權不同,閉源意味著你永遠被綁在 Google 的 API 上。公司資安要求完全離線隔離的,就得去談昂貴的企业級方案;不然每個提示詞和回傳結果都得經過 Google 的伺服器,綁定感相當強。
另外,很多開發者在社群上問:「 promised 的旗艦 Gemini 3.5 Pro 呢?」目前 Google 技術人員回應還在跟夥伴測試中。這其實透露了一個訊號:Google 現在的策略是「先鋪量、再衝頂」。先把 Flash 系列的效率打透,把企業客戶的用量拉起來,等旗艦版準備好再一舉拿下 Benchmark 榜單。至於資安版的 Flash Cyber,目前只開放給政府和受信任的夥伴,走的是 Anthropic 以前搞的封閉試點路線,防止這把雙面刃被亂用。
給你的小提醒
看完這一輪,我覺得你不用急著把舊模型全換掉。AI 的競爭早就不是單打獨鬥,而是「場景匹配」的遊戲。如果你的業務大量依賴高併發、低延遲的自動化流程,把 Flash-Lite 拉進你的 pipeline 絕對會讓你帳單好看很多;如果是做深度推理,再上 3.6 Flash。別忘了,Google 還在跑 Gemini 4 的預訓練,現在的價格戰才剛開打,手邊留點預算觀察一下後續的 Pro 版動態,絕對不吃虧。
延伸思考與常見問題
Q1:什麼是 Token?為什麼省 Token 就能省錢? 答:Token 是 AI 處理文字時的最小單位,通常一個中文字約等於 1.5 到 2 個 Token。模型每讀取或吐出一個 Token,Google 就會收費,所以能精準回應、減少囉嗦的模型,自然就能幫你省下一大筆 API 費用。
Q2:
Gemini 3.5 Flash-Lite為什麼比標準版還強,卻還要叫 Lite? 答:Lite 代表的是「輕量級、高吞吐量」的架構設計,專為速度與大量請求優化。它在特定程式碼測試中表現亮眼,但面對極度複雜的推理或多模態任務時,還是會略遜於旗艦版,屬於「專精快打」而非「全能通才」。Q3:為什麼這次沒有等到
Gemini 3.5 Pro一起發布? 答:根據 Google 技術人員的回應,3.5 Pro目前仍在與特定夥伴進行封閉測試。Google 選擇先推出Flash系列搶佔企業用量與效率市場,旗艦版的發布時機會配合實際優化進度,確保一上線就能對標OpenAI與Anthropic的最新旗艦。