Runway 的 AI 即時影片模型有個頑固 Bug:生成角色時會不自覺往畫面邊緣漂移。換作一般工程師,大概會死磕後端程式碼、重訓幾輪模型硬剛到底。但 Runway 的企業產品負責人 Ryan Phillips 直接攤牌:「幾週都修不乾淨,不如我們乾脆在前端加個 Optimize for Image Quality 功能,幫使用者自動把圖片置中。」聽起來很像在掩耳盜鈴,但我反而覺得這才是這波生成式 AI 真正落地的關鍵思維。與其無止盡地追求模型層面的完美,不如把技術限制包裝成使用者體驗的亮點,這招比任何底層突破都來得務實。
這套模型的技術債其實藏得很深。Runway 走的是典型的「先大後小」路線:先用昂貴的基礎模型做預訓練,再用蒸餾(Distillation)技術把生成時間砍掉 80 到 90%,接著上對抗後訓練(APT)找回畫質。但問題就出在這裡——蒸餾和 APT 改變了模型結構,角色漂移的 Bug 就是這個過程的副作用。傳統做法是繼續投入算力硬修,但 Runway 發現只要使用者輸入的原始圖片是正中心的,影片就不會歪。於是他們選擇了「繞道而行」。這其實點出了一個很多 AI 團隊忽略的盲點:即時性(Real-time)和穩定性永遠在拉鋸,選錯取捨點就會製造出修不好的 Bug。
更讓我覺得有趣的是他們的品質管控跟基礎設施細節。你們猜他們用什麼工具追蹤評估結果?沒有昂貴的 AI 評分儀表板,就是最土的 Excel 電子表格。每天手動記錄,分級為「Minor」或「Major」失敗,達標才上線。連邊緣案例都考慮到了,比如拿一個沒有鼻子、牙齒長很奇怪的虛構角色「Tooth」來測試模型在人類結構之外的表現。至於基礎設施?他們後來發現有 8% 的 API 呼叫掉到 16fps,用 Claude 驅動的 AI Agent 搭配 Datadog 和 Sentry 追蹤,最後鎖定 us-east-1 某個資料中心,解決方案不是改設定,而是直接派人去機房物理替換 GPU。這告訴我們,AI 不只是跑在雲端的軟體,硬體顆粒度的異常一樣會直接砸壞使用者體驗。
| 維度 | 傳統修 Bug 思維 | Runway 的包裝思維 |
|---|---|---|
| 目標 | 從底層根除問題 | 將限制轉化為產品亮點 |
| 資源投入 | 持續消耗算力與時間重訓 | 前端 UI 一層薄包裹即可 |
| 使用者感知 | 可能完全無感,或等到下版才修好 | 覺得是「貼心新功能」而非「修補」 |
| 適合場景 | 對穩定性要求極高的金融或醫療級應用 | 強調即時互動與體驗的生成式工具 |
「把模型的限制變成產品功能,你就能實際擴展模型的運作邊界。內部看起來是缺陷,但如果你把它包成產品功能,客戶根本不會那麼覺得。」—— Ryan Phillips, Runway ML
說到底,Runway 這波操作不是在逃避技術債,而是把「什麼時候該硬剛、什麼時候該包裝」的節奏感拿捏得很準。這波 AI 應用大戰,贏的往往不是底層模型最強的,而是最懂怎麼把技術限制轉譯成市場語言的團隊。下次看到你的 AI 工具又出現詭異 Bug 時,別急著罵,也許他們正在偷偷把它變成下一版的 Feature。
延伸思考與常見問題
Q1:蒸餾(Distillation)技術在 AI 模型裡到底是做什麼的? 答:蒸餾是一種模型壓縮技術,讓體型龐大、推理緩慢的教師模型將其知識轉移給一個體型較小、速度較快的學生模型,從而大幅降低推理時間與運算成本,但往往會犧牲部分畫質或穩定性。
Q2:什麼是對抗後訓練(APT, Adversarial Post-Training)? 答:這是一種在模型訓練後期引入挑刺系統的技術,持續用專門設計來尋找模型弱點的敵對樣本去測試它,迫使模型不斷修正缺點、提升畫質與穩定性,常用於彌補模型壓縮過程中的損耗。
Q3:為什麼 Runway 最後選擇物理替換 GPU,而不是改軟體設定? 答:因為透過監控工具追蹤後發現,是 us-east-1 某個資料中心裡特定批次的實體 GPU 硬體出現異常,導致部分 API 呼叫的解碼效能下降。軟體層的設定調整無法解決硬體本身的物理缺陷,必須直接更換實體晶片才能根除。