想像一下,你平常點外送或訂機票時,得自己打開瀏覽器、搜尋、比價、登入帳號、輸入信用卡號,一套流程走下來大概要十分鐘。但如果現在有個「數位代辦」,你只需要對它說一句:「幫我訂一份麻辣鍋,送到我家」,它就會自己開瀏覽器、翻菜單、加購物車、結帳,全程不用你動一根手指頭。這台代辦不只是在聊天框裡打字,而是長了一雙手,能像人類一樣滑鼠點擊、滾動頁面、甚至操作終端機。Hark 這次推出的 Handoff 就是這麼一個「網頁操作員」,它號稱能替你搞定從訂晚餐到寫信找工作的一切瑣事,而且價格便宜到你懷疑是不是算錯小數點。
別急著喊讚,先來看看這台「虛擬代辦」到底在跟誰比賽
先說價格,這真的是這次新聞裡最殺的一刀。Hark 把輸入 token 壓到 $0.18 / 百萬,輸出只要 $2.37。對照一下大廠的定價,OpenAI 的 GPT 5.5 輸入就要 $5、輸出 $30,Anthropic 的 Opus 4.8 也差不多。算下來 Handoff 的成本不到人家十分之一,難怪他們敢在官網大聲嚷嚷自己是「頂規性能、平民價格」。至於速度,官方宣稱單次回應只要 0.8 秒,聽起來確實流暢。
為了讓數字更直觀,我幫大家整理了一張對照表:
| 對比項目 | Hark Handoff | OpenAI GPT 5.5 | Anthropic Opus 4.8 |
|---|---|---|---|
| 輸入價格/百萬 token | $0.18 | $5 | $5 |
| 輸出價格/百萬 token | $2.37 | $30 | $25 |
| OM2W 網頁操作評分 | 97.7 | 未公開 | 84.1 |
| 單次回應延遲 | 0.8 秒 | 6.8 秒 | 6 秒 |
但價格漂亮不代表比賽沒問題。Hark 拿到的 OM2W 第一名(97.7 分),比的是上一代的 GPT 5.4、Opus 4.8 跟 Gemini 2.5 Pro。目前最強的最新模型像是 GPT 5.6 和 Opus 5 根本沒上場,連 DeepSeek V4、Kimi K3 這些開源強者也不在榜上。換句話說,它是在跟上一屆冠軍賽跑,然後拿了金牌。更微妙的是,在另一個叫 WebTailBench v2 的測驗裡,GPT 5.5 其實考出 72.3 分,反而比 Handoff 的 68.6 還高。而且有三項評比裡有兩項是「自己考、自己批改」,用的是他們內部的 LLM judge,這就像體育課老師同時也是裁判,成績單雖然沒造假,但公正性總讓人想多問一句。
「等等,它不會只是自己跟自己比,然後拿個獎狀出來自我陶醉吧?」
技術面來看,Handoff 的架構其實挺聰明。每個請求都會獨立啟動一台虛擬電腦,裡面有專屬瀏覽器、檔案系統跟終端機,你可以掛上自己的帳號,讓它幫你操作。這解決了過去 AI 代理只能靠 API 介面的痛點,畢竟全網幾千萬個網站裡,不到千分之一有公開 API。不過底層模型是誰訓練的、用了什麼數據,官網到現在都賣關子,只知道目前只做過後訓練(post-training),預訓練預計年底才上。對於企業用戶最在意的資料安全與檔案存取權, spokesperson 也只說「重視隱私,等正式上架再公佈」,目前還是技術預覽版。
總之,Handoff 這把刀磨得很快,價格也真的讓人心動。但科技圈的老毛病依舊沒變:演示影片再精彩,最終還是得看實戰表現。如果你只是日常點個外賣、訂張機票,這台虛擬代辦現在就能上線試用;但要是打算把企業核心流程丟給它,建議再等幾個月,看看它能不能在最新模型的對決裡依然站穩腳跟。畢竟,便宜好用是優點,但「打得贏最新對手」才是真本事。
延伸思考與常見問題
點選問題可展開答案
Q1:什麼是 Computer Use Agent(CUA)?
CUA 是一種能像人類一樣操作電腦介面的 AI 代理,它不只是在對話框裡回覆文字,而是能自己移動滑鼠、點擊按鈕、滾動頁面來完成任務。
Q2:為什麼 Hark 的 OM2W 評分高,但有人覺得不夠有說服力?
因為 Hark 拿前三名去比的 GPT 5.4、Opus 4.8 都是上一代模型,目前市場上最新的 GPT 5.6 與 Opus 5 尚未公開該榜單成績,且部分測驗是內部自行評分。
Q3:文中提到的 GRPO 演算法跟後訓練(post-training)是什麼關係?
GRPO 是一種強化學習演算法,常用於後訓練階段讓模型透過反覆試錯來優化特定任務表現;Hark 目前僅完成這階段,底層預訓練模型尚未公開。