85% 還在試水溫,5% 已經上線:亞馬遜 AGI 主管點破企業 AI Agent 部署的真正卡關點 封面圖
科技

85% 還在試水溫,5% 已經上線:亞馬遜 AGI 主管點破企業 AI Agent 部署的真正卡關點

企業導入 AI Agent 為什麼卡在試點階段上不了生產環境?亞馬遜 AGI 主管 Bryan Silverthorn 在 VB Transform 2026 指出,瓶頸不在模型能力,而在於可靠性維度的精確測量與管理思維的轉變。本文深度剖析這道數學題背後的技术框架與產業演進方向。

去年在 VentureBeat Transform 2026 的活動現場,亞馬遜 AGI 自主性部門主管 Bryan Silverthorn 甩出一組讓人背脊發涼的數據:根據 Cisco 的調查,85% 的企業正在試點 AI Agent,但真正送進生產環境(Production)的只有 5%。這道「試點地獄」的數學題,其實在過去兩三年裡早就顯露跡象。當大廠還在爭相展示 Agent 能寫程式、能跑數據分析時,企業客戶已經開始問一個更務實的問題:「它到底靠不靠譜?」Silverthorn 這次沒有拿新的 benchmark 出來秀肌肉,反而直言答案不在於把模型練得更聰明,而在於我們測量的方式根本沒對。這番話直接戳破了當前企業 AI 部署的泡沫,也讓業界開始正視一個被忽略已久的課題。

為什麼內部測驗全過,上線卻頻頻翻車?

我們來拆解 Silverthorn 提出的可靠性四維框架。他認為,業界習慣把「靠不靠谱」混為一談,但真正的工程標準應該切開成四個獨立維度:一致性(Consistency)、健壯性(Robustness)、可預測性(Predictability)與安全性(Safety)。這個框架源自普林斯頓的研究,但被帶進產業界後,才真正變成可操作的檢查清單。

舉個現場分享的真實案例。有一家企業部署了一個負責軟體 QA 的 Agent,專門從螢幕上抓取序號。前兩個月運作完美,突然某天開始時不時讀錯數字。查了半天發現,底層的 vision encoder 會因為序號出現在螢幕的不同位置而產生差異化行為,再加上前端 UI 做了一個人眼幾乎看不見的微調,就直接引爆了連鎖故障。你看,模型本身沒問題,問題出在我們根本沒針對「位置變異」或「UI 微調」設計對應的測量機制。

企業現在普遍只盯著 uptime(系統在線時間),卻完全忽略 accuracy(準確率)。這就像醫生只量心跳,卻不做血液檢驗。

為了更清楚看清這兩者的落差,我整理了一份對比:

維度 內部評估(Internal Eval)常見做法 生產環境(Production)真實需求
一致性 固定測試集跑多次,確認輸出穩定 需針對不同輸入分布(如螢幕位置、語氣)進行壓力測試
健壯性 忽略邊緣案例或假設環境乾淨 必須容忍 UI 微調、網路延遲、第三方 API 變動
可預測性 只看成功率百分比 企業需要知道「失敗時會怎麼失敗」以及風險邊界在哪
安全性 模型廠自帶的 LLM-as-judge 評估 需額外設定金流、資料外洩、錯誤執行的 undo 機制

過去一年多的經驗告訴我們,模型能力已經過剩,測量精度才是稀缺資源。亞馬遜內部也承認,大多數企業現在根本沒有自己的評估策略,純粹把命運交給模型供應商。這就像擲銅板決定信不信廠商,風險極高。

把 Agent 當「實習生」管,未來兩年會怎麼演?

Silverthorn 最讓我認同的一點,是他們在 AGI Lab 裡直接叫自己的 Agent 「實習生」(Intern)。這聽起來像玩笑,但背後是一套嚴謹的營運哲學。實習生很有潛力,但偶爾會犯蠢;你能給他們驚人的任務,也可能看著他們把實驗室炸了。所以管理重點不在於寫更多程式碼,而在於管理思維:隨時問自己「最壞會怎樣?」、保留備份與 undo 按鈕、明確劃定你能承受的風險區間。

亞馬遜的實驗室甚至已經允許 Agent 在深夜獨自執行實驗,只為了追求研究速度。這種「放權但留後路」的文化,正是生產環境最需要的。

展望未來一到兩年,我認為產業會經歷三個明顯的轉變:

  1. 從「能不能做」轉向「能不能連續做對一千次」。企業採購 Agent 時,第一次的惊艳展示已經不夠看,穩定性會成為簽約的核心條款。
  2. MCP(Model Context Protocol)與 API 的混合架構會成為主流。單靠模擬人眼操作螢幕(Computer Use)不夠,Agent 會同時串接後端 API 與標準化協議,打造端到端的自動化流程。
  3. 自適應與自我改進(Self-improving AI)會從熱詞降溫。Silverthorn 直說這是個「充滿包袱的詞」。短期內,企業更需要的是可控的妥協,而不是讓 Agent 自己改自己的參數然後出包沒人知道。

最終,能突破那 5% 生產環境壁壘的企業,不會是擁有最聰明 Agent 的那一家,而是管理 Agent 最成熟的那一家。這波 AI 部署的洗牌,才剛剛開始。

延伸思考與常見問題

點選問題可展開答案

  • Q1:可靠性四維框架中的「一致性」與「健壯性」有什麼具體差別?

    一致性指的是 Agent 在相同或相似輸入下,能否持續輸出符合預期的結果;健壯性則強調當外部環境發生微調或出現邊緣條件時,系統能否維持運作而不崩潰。

  • Q2:文章提到的 MCP(Model Context Protocol)是什麼技術?

    MCP 是由 Anthropic 推動的開放協議,旨在讓 AI Agent 能標準化地連線與操作各種外部資料來源與工具,解決過去各廠商工具串接格式不兼容的碎片化問題。

  • Q3:為什麼企業內部評估通過的 Agent,到了生產環境容易失敗?

    因為內部測試通常使用乾淨、固定的數據集,且忽略真實世界中的 UI 變動、網路延遲與輸入分佈偏移;生產環境的變異性遠高於實驗室,若沒有針對這些變量設計對應的測量機制,失敗是必然的。

🪙

開始您的加密貨幣之旅

立即註冊全球最大加密貨幣交易所 幣安 (Binance),使用專屬推薦碼 CLICK168,即可享有手續費終身優惠與專屬的新人迎新大禮包!

👉 領取幣安專屬註冊優惠