科技

模型再強也沒用,Waymo 的「eval 決定生死」哲學正在重新定義 AI 上線標準

Waymo 認為 AI 專案不是模型表現好就能上線,而是必須先過關 eval。這篇文章拆解他們以評估為核心的開發哲學,以及這對企業部署 AI 代理與大模型的實質啟示。

Waymo 在 VB Transform 2026 丟出一個頗具殺傷力的觀點:AI 專案的成熟度,不看模型跑得多漂亮,而是看 eval(評估體系)長得有多穩。 我對這套邏輯相當買單。現在一堆企業把 LLM 包一層 UI 就喊產品上線,連邊界條件都測不明確,出事才來緊急修補。Waymo 把評估從「上線前的最後一關」拉高成「開發過程的核心引擎」,這不僅是工程方法的演進,簡直是在教業界怎麼避免 AI 盲飛。

過去我們習慣的節奏是「訓練模型 → 跑基準測試 → 推上線」。Waymo 的工程總監 Manasi Joshi 直接告訴我們,這套流程已經過時了。他們推行的是「eval-centric development」,也就是說,一個子專案連測試數據集長什麼樣、指標怎麼設計、模擬環境夠不夠逼真,這些評估設施的成熟度,直接決定了專案能不能進入生產環境。這意味著什麼?市場的贏家會是那些願意在評估基礎設施上砸重本的團隊,而輸家則是只追參數規模、卻懶得建評估流水線的「跑馬圈地」派。模型再強,測不完的路況一樣會讓你在真實世界翻車。

為了讓讀者更直觀地感受這兩套邏輯的落差,我整理了一張對比表:

維度 傳統 AI 上線邏輯 Waymo 的 eval 驅動邏輯
評估時機 模型訓練完成後,上線前做一次 貫穿訓練、驗證、模擬的全生命週期
失敗定義 基準測試分數未達標 數據分佈偏移、罕見場景覆蓋不足或業務指標脫鉤
人力介入 自動化為主,人工抽檢 安全主管與領域專家擁有最終否決權
效率取向 追求參數規模與算力堆疊 資料效率優先,寧缺勿濫

「評估不是一勞永逸的上線任務,它是一個持續進化的過程。

這句話點出了最關鍵的差異。Waymo 跑了超過 2.2 億英里 的完全無人駕駛里程,嚴重碰撞傷害率比人類低 17 倍。這背後不是單靠一個超級模型,而是他們把評估拆成了開環模擬與閉環驗證,並且持續監控資料品質。對企業界來說,這啟示很大:你的客服 Agent、金融風控系統或程式碼助手,不能只測「常規用戶會怎麼問」。你得刻意去測那些「暴雷場景」——比如網路延遲、語意歧義、或者突發的業務規則變更。如果連罕見錯誤都接不住,上線只是把風險延後爆發。

另一個很多人容易忽略的盲點,是 Waymo 現在連自家的 AI Agent 都要評估。工程師用 Agent 分析資料分佈、排修車輛遙測數據,但這些 Agent 本身如果判斷失準,就會把整個團隊帶入死胡同。所以他們在推高效率的同時,強調「資料效率」大於「資料量」。這很合理,盲目堆算力和歷史日志只會讓評估成本指數型飆升。真正的護城河,是你能不能從海量資料裡精準挑出那 1% 最能代表真實風險的樣本。

總之,AI 時代的競爭早已不是「誰的模型參數多」這種小學問。誰的評估體系能持續捕捉真實世界的雜訊,誰才擁有最終的上線話語權。 Waymo 這套玩法或許門檻高,但絕對是正解。

延伸思考與常見問題

  • Q1:文章提到「eval-centric development」,這跟一般的模型評估有什麼本質差異? 答:一般評估通常是開發末端的「驗收關卡」,而 eval-centric 是把評估視為驅動開發方向的核心引擎,測試數據集的設計、指標的選擇會反向決定模型該如何訓練與迭代,兩者是不可分割的閉環。

  • Q2:Waymo 區分的「開環模擬」與「閉環驗證」分別是什麼意思? 答:開環模擬是將歷史行駛資料輸入模型,觀察其決策是否符合預期,屬於靜態回放分析;閉環驗證則是讓模型在即時產生的虛擬環境中自主驅動,系統會動態根據模型的行為調整環境變數,以測試其在真實互動中的應變能力。

  • Q3:文中提到的 VLA model(Vision-Language-Action Model)在無人駕駛中扮演什麼角色? 答:VLA model 是一種能同時處理視覺輸入、語言理解並直接輸出控制動作的基礎模型,它讓車輛不再只是「看到」物體,而是能理解複雜場景語意後,直接生成煞車、轉向等具體駕駛動作,大幅簡化了傳統感知到規劃的冗長管線。

🪙

開始您的加密貨幣之旅

立即註冊全球最大加密貨幣交易所 幣安 (Binance),使用專屬推薦碼 CLICK168,即可享有手續費終身優惠與專屬的新人迎新大禮包!

👉 領取幣安專屬註冊優惠