想像一家軟體公司不招新人,卻把一位資深工程師丟進更完整的專案現場:從讀 codebase、查文件、跑實驗、改系統,到最後證明效能真的變好。以前他只寫一小段函式,現在要接手好幾天的工程流程。做久了,他不只寫程式變穩,還開始像安全工程師一樣挑漏洞。GLM-5.3 就是這種感覺:Z.ai 沒有換全新大腦,而是讓 同一個底模做更多實戰實習。結果它 寫程式更會跑長任務,資安能力也意外變強,據說還找到 Cursor 的潛在嚴重漏洞。
不用換新大腦,也能讓 AI 工程師變強?
Z.ai 說得很直白:GLM-5.3 和 GLM-5.2 用同一個底模,提升主要來自 scaling post-training。白話講,就是讓模型在更多環境、更多樣任務、更多 reinforcement learning 計算量裡練功。
我個人覺得,這就像同一位工程師,昨天還在修一個小 bug,今天已經能接手整個微服務專案,還順手揪出安全漏洞。
以前很多模型比的是「誰會答題」。現在 GLM-5.3 比的是「誰能長時間完成真實工程」。它要讀文件、改程式碼、跑測試、處理實驗結果,還要保持正確性。對開發者來說,這代表 coding agent 可能從「幫你補幾行程式」變成「幫你跑一個完整工單」。
重點不是它一定拿第一,而是 效率。Z.ai 的自評 Code Bench 顯示,GLM-5.3 在 Max 設定下完成更多任務,同時輸出 token 比 GLM-5.2 少。對企業部署 coding agent 很重要,因為長流程任務會讓推理成本和延遲一直疊加。
| 比較項目 | 傳統思路 | GLM-5.3 的做法 |
|---|---|---|
| 底模 | 重新預訓練一個更大模型 | 沿用 GLM-5.2 的底模 |
| 訓練重點 | 堆資料、堆參數 | 更多環境、更多任務、更多 RL |
| 能力方向 | 答題、短任務 | 長流程工程、找漏洞、攻擊鏈 |
| 對開發者的影響 | 換模型重跑 | 可能省成本,但要注意 API 變更與資安風險 |
資安能力為什麼突然變快?
這部分最有意思。Z.ai 原本預期它會更會找漏洞,沒想到能力往 exploitation chain 跑,也就是不只指出哪裡有洞,還開始接近「怎麼利用這個洞」。
數據上,GLM-5.3 在 CyberGym 的漏洞發現與驗證分數是 84.5%,比 GLM-5.2 的 77.2% 高,也略勝 Z.ai 列出的 GPT-5.6 Sol 與 Mythos 5。在 ExploitBench 它從 24.4% 拉到 54.4%,但仍落後 GPT 與 Mythos。
對一般讀者,這聽起來像黑帽駭客,但對開發團隊,它可能是雙面刀:你可以請它幫你審視程式碼,找潛在風險;但如果你把它接進生產環境,也要想清楚它能讀什麼、能改什麼、能碰哪些 API key。
Z.ai 也提到,已和中國安全團隊合作,經過專家審查、去重後,有 2,436 個漏洞發現,其中 1,097 個被歸為 critical 或 high severity。多數還處於 embargo,也就是沒公開。公司也說要引入 trusted access 這類管控,處理敏感功能,這解釋為什麼它要先把 API 和 open weights 放慢,等安全評估與加固完成。
Cursor 漏洞這件事,現在要怎麼看?
據 z.ai developer advocate Lou 在 X 上說,GLM-5.3 找到了 Cursor 的「potentially serious vulnerability」。Cursor 是 AI coding startup,最近被 SpaceX 收購。VentureBeat 也在 X 上標記 Cursor 等回應,但截至新聞時還沒確認。
我個人會把它當成「高可信度但未證實」的消息。原因很簡單:Z.ai 有動機展示資安能力,Cursor 方面尚未回應。對開發者來說,真正值得注意的不是八卦,而是 AI coding agent 開始有能力主動找漏洞,這會改變未來安全審查的流程。
開發者要小心的一個 API 小坑
如果你打算把現有 GLM 應用換到 GLM-5.3,別只改模型名稱。它支援 low、high、max 三種 reasoning effort,max 是預設,也是 Z.ai 建議 coding 用的設定。
但和之前版本不同的是:thinking 不能關掉。如果你現在有送 thinking.type: "disabled",要改成 enabled,並指定 reasoning effort,否則請求會失敗。
這對一些生產環境是真正的 migration,不是簡單換 model ID。
最後,怎麼看 GLM-5.3?
我個人覺得,GLM-5.3 像是一個很清楚的訊號:AI coding agent 不再只是「更會寫程式」,它開始變成能長時間跑工程、也能做安全研究的角色。對開發者,它可能幫你省時間、省 token;對企業,它也可能把資安風險往前推。
如果你用 AI 寫程式,可以先關注 ZCode、GLM Coding Plan 和後續 API 開放時間。如果你管的是安全,則要提前想清楚:哪些模型能碰生產程式碼?哪些操作要留 audit log?哪些敏感功能要限制 access?
一句話:AI 工程師變強是真的,但它開始會找漏洞,也是真的。
延伸思考與常見問題
點選問題可展開答案
Q1:GLM-5.3 的 open weights 什麼時候出?
Z.ai 說要等安全評估和加固完成後才開放,預計發布後約兩週,但實際時間仍可能調整。
Q2:為什麼 GLM-5.3 沒有重新訓練底模,卻能在寫程式和資安上進步很多?
因為它把同一個底模丟進更多真實工程環境,用強化學習和後訓練讓它學會長流程任務,從寫程式到找漏洞和攻擊鏈。
Q3:Cursor 漏洞是被證實了嗎?
目前只是 Z.ai 的人說 GLM-5.3 找到 Cursor 的潛在嚴重漏洞,Cursor 尚未公開證實,所以先當待確認處理。