Waymo 在 VB Transform 2026 丟出一個頗具殺傷力的觀點:AI 專案的成熟度,不看模型跑得多漂亮,而是看 eval(評估體系)長得有多穩。 我對這套邏輯相當買單。現在一堆企業把 LLM 包一層 UI 就喊產品上線,連邊界條件都測不明確,出事才來緊急修補。Waymo 把評估從「上線前的最後一關」拉高成「開發過程的核心引擎」,這不僅是工程方法的演進,簡直是在教業界怎麼避免 AI 盲飛。
過去我們習慣的節奏是「訓練模型 → 跑基準測試 → 推上線」。Waymo 的工程總監 Manasi Joshi 直接告訴我們,這套流程已經過時了。他們推行的是「eval-centric development」,也就是說,一個子專案連測試數據集長什麼樣、指標怎麼設計、模擬環境夠不夠逼真,這些評估設施的成熟度,直接決定了專案能不能進入生產環境。這意味著什麼?市場的贏家會是那些願意在評估基礎設施上砸重本的團隊,而輸家則是只追參數規模、卻懶得建評估流水線的「跑馬圈地」派。模型再強,測不完的路況一樣會讓你在真實世界翻車。
為了讓讀者更直觀地感受這兩套邏輯的落差,我整理了一張對比表:
| 維度 | 傳統 AI 上線邏輯 | Waymo 的 eval 驅動邏輯 |
|---|---|---|
| 評估時機 | 模型訓練完成後,上線前做一次 | 貫穿訓練、驗證、模擬的全生命週期 |
| 失敗定義 | 基準測試分數未達標 | 數據分佈偏移、罕見場景覆蓋不足或業務指標脫鉤 |
| 人力介入 | 自動化為主,人工抽檢 | 安全主管與領域專家擁有最終否決權 |
| 效率取向 | 追求參數規模與算力堆疊 | 資料效率優先,寧缺勿濫 |
「評估不是一勞永逸的上線任務,它是一個持續進化的過程。」
這句話點出了最關鍵的差異。Waymo 跑了超過 2.2 億英里 的完全無人駕駛里程,嚴重碰撞傷害率比人類低 17 倍。這背後不是單靠一個超級模型,而是他們把評估拆成了開環模擬與閉環驗證,並且持續監控資料品質。對企業界來說,這啟示很大:你的客服 Agent、金融風控系統或程式碼助手,不能只測「常規用戶會怎麼問」。你得刻意去測那些「暴雷場景」——比如網路延遲、語意歧義、或者突發的業務規則變更。如果連罕見錯誤都接不住,上線只是把風險延後爆發。
另一個很多人容易忽略的盲點,是 Waymo 現在連自家的 AI Agent 都要評估。工程師用 Agent 分析資料分佈、排修車輛遙測數據,但這些 Agent 本身如果判斷失準,就會把整個團隊帶入死胡同。所以他們在推高效率的同時,強調「資料效率」大於「資料量」。這很合理,盲目堆算力和歷史日志只會讓評估成本指數型飆升。真正的護城河,是你能不能從海量資料裡精準挑出那 1% 最能代表真實風險的樣本。
總之,AI 時代的競爭早已不是「誰的模型參數多」這種小學問。誰的評估體系能持續捕捉真實世界的雜訊,誰才擁有最終的上線話語權。 Waymo 這套玩法或許門檻高,但絕對是正解。
延伸思考與常見問題
Q1:文章提到「
eval-centric development」,這跟一般的模型評估有什麼本質差異? 答:一般評估通常是開發末端的「驗收關卡」,而eval-centric 是把評估視為驅動開發方向的核心引擎,測試數據集的設計、指標的選擇會反向決定模型該如何訓練與迭代,兩者是不可分割的閉環。Q2:Waymo 區分的「開環模擬」與「閉環驗證」分別是什麼意思? 答:開環模擬是將歷史行駛資料輸入模型,觀察其決策是否符合預期,屬於靜態回放分析;閉環驗證則是讓模型在即時產生的虛擬環境中自主驅動,系統會動態根據模型的行為調整環境變數,以測試其在真實互動中的應變能力。
Q3:文中提到的
VLA model(Vision-Language-Action Model)在無人駕駛中扮演什麼角色? 答:VLA model是一種能同時處理視覺輸入、語言理解並直接輸出控制動作的基礎模型,它讓車輛不再只是「看到」物體,而是能理解複雜場景語意後,直接生成煞車、轉向等具體駕駛動作,大幅簡化了傳統感知到規劃的冗長管線。