GLM-5.3 拿下 84.5 分,看起來像是資安能力迎來突破;但這個數字其實來自一個資訊量充足、條件明確的 CyberGym 測試設定。比較務實的結論是:GLM-5.3 確實大幅超越 GLM-5.2,但目前最有力的公開證據仍顯示,它在端到端漏洞利用程式建構方面存在差距,獨立複現也還不完整。
GLM-5.3 的資安數據,實際上測的是什麼?
GLM-5.3 公開的資安測試結果涵蓋漏洞重現、漏洞利用程式建構,以及長時間代理執行。這些是彼此相關、但不能混為一談的任務,也不能直接當成「資安效能」的同義詞。
| 基準測試 | GLM-5.3 | 相關比較 | 衡量內容 |
|---|---|---|---|
| CyberGym | Z.ai 公布:84.5% | GLM-5.2:77.2%;Mythos 5:83.8%;GPT-5.6 Sol:83.6% | 在指定資訊量下重現已知漏洞 |
| ExploitBench | 54.4% | GLM-5.2:24.4%;Mythos 5:78%;GPT-5.6 Sol:76.5% | 從漏洞利用原語推進至程式碼執行 |
| ExploitGym | 2 小時完成 105 項;6 小時完成 130 項 | GLM-5.2:29 項和 39 項;Mythos 5:181 項和 247 項 | 在不同時間限制下完成漏洞利用任務 |
以上數據來自 Z.ai 公布的比較結果,以及同期的分析文章。Anthropic 的評估則提供了另一組數字:在 410 次端到端 ExploitBench 嘗試中,GLM-5.3 完成了 50 次,Claude Mythos Preview 則完成 56 次。這種落差提醒我們,每一個數字都必須連同模型版本、測試框架與評分方式一起看。
看懂測試差異:漏洞發現、利用程式建構與時間限制
CyberGym 最容易被一句標題帶偏
CyberGym 並不代表 GLM-5.3 能攻陷 84.5% 的任意真實系統。它是一項受控的漏洞重現評估,而題目難度會隨提供的資訊量改變。公開結果涵蓋的條件,從只有修補前程式碼,到同時提供漏洞描述、崩潰追蹤、修補差異與修補後程式碼都有。
這個差別非常重要:在白箱環境中拿到大量線索,和從零開始進行開放式漏洞發現,根本是兩種不同的考試。D-Central 直接點出了問題:
「在那種設定下拿到 84.5 分,不代表相較於文獻中約 20% 的上限提升了四倍;那是另一場考試。」——D-Central
比較站得住腳的解讀是:在公開的 CyberGym 設定中,GLM-5.3 表現非常強。但這個分數不能被當成它找出或利用未知漏洞的普遍機率。
ExploitBench 顯示的是實質進步,不是已經追平
如果你想知道 GLM-5.3 能不能不只辨識漏洞,ExploitBench 會更有參考價值。Lumina 將它描述為一項衡量模型如何從易受攻擊的程式碼,一路推進到漏洞利用原語與程式碼執行的測試。
GLM-5.3 的追蹤分數為 54.4%,GLM-5.2 則是 24.4%。這代表世代之間有相當明顯的提升,但還不能說已經追上同一份公開比較中最強的封閉模型:Mythos 5 的公開數字為 78%,GPT-5.6 Sol 則為 76.5%。
Lumina 的來源追蹤基準測試頁面也提醒,不同版本、推理投入程度與執行系統產生的結果,未必能直接互相比較。Anthropic 的 50 對 56 結果同樣說明了這一點:在某個測試框架下接近的成績,換到另一個框架後,可能會呈現更大的差距。
ExploitGym 更能反映長時間堅持的差異
ExploitGym 加入了時間這個變數。Z.ai 公布的結果是:在兩小時限制下完成 105 項任務,六小時限制下完成 130 項。D-Central 整理的比較中,GLM-5.2 對應的數字為 29 項和 39 項,Mythos 5 則達到 181 項和 247 項。
因此,六小時結果確實顯示 GLM-5.3 比 GLM-5.2 有實質進步,但還不能證明它在獲得更多時間後,能像領先的封閉模型那樣持續擴大成果。長時間代理執行既能暴露模型的推理能力,也能看出它的效能上限;同時,它還會增加運算成本與人工審查需求。
這些證據對實際使用代表什麼?
GLM-5.3 值得放進經授權的防禦工作流程中評估,尤其適合程式碼分流、漏洞重現與修補驗證。不過,公開證據還不足以支持把它部署成無人監督的攻擊操作員,也不能把基準測試上的成功當成授權的替代品。
Z.ai 表示,其漏洞揭露工作已在 269 個開源專案中發現 2,436 個問題,其中 1,097 個被列為重大或高風險;在公布這些數字時,已有 53 個公開揭露,另有 2,383 個仍處於保密期。這些數據可視為實務運作上的證據,但仍屬供應商自行公布,也不代表每一項發現都已驗證為可利用漏洞。
另一則真實使用者的回應,也說明了為什麼這次發布會受到那些無法使用受限資安模型的實務工作者注意:
「我自己實際用過 Kimi-K3 和 GLM-5.3;在進行任何滲透測試或資安分析時,它們就是我真正會優先使用的模型。」——@raopreetam_,X
這是使用者經驗,不是基準測試結果。它支持的較狹義結論是:GLM-5.3 對資安專業人士而言確實具備實務吸引力,但不能據此宣稱它在所有情境下都是最佳選擇。
如果要負責任地評估,應把模型放在隔離且經授權的環境中,並測量誤報率、報告品質、修補驗證準確度、Token 成本與審查時間。若模型雖然找出更多候選問題,卻讓團隊被大量雜訊淹沒,那它可能還不如一個能力稍弱、但報告更乾淨的模型實用。
API、權重與遷移限制
發布期間的供應狀況曾經變動,因此「GLM-5.3 是否可用?」必須精確回答。VentureBeat 報導,初期可透過 Z.ai 的 GLM Coding Plan 與 ZCode 取得使用權,API 存取與開放權重則在完成安全評估與強化後分階段推出。後續第三方報導提到 API 已可使用,但正式投入生產環境前,仍應向供應商確認目前的普遍可用性、授權條款與價格。
對開發者來說,遷移行為同樣重要。GLM-5.3 採用永遠開啟的思考模式,並提供 low、high、max 等推理投入程度。如果應用程式送出 thinking.type: "disabled",就必須先修改這項請求才能切換模型 ID,否則請求可能失敗。換句話說,這不是單純替換字串,而是一次 API 遷移。
不要假設 GLM-5.2 的開放權重授權同樣適用於 GLM-5.3。對資安團隊而言,權重是否提供、授權允許的用途、託管 API 存取權,以及資料所在地條款,都是彼此分開的決策。
資安團隊該不該評估 GLM-5.3?
把 GLM-5.3 當成受控評估的候選模型,而不是成熟資安流程的自動替代品。
| 情境 | 建議 |
|---|---|
| 針對自有儲存庫進行大範圍分流 | 值得測試;公開結果顯示它比 GLM-5.2 有實質提升 |
| 在隔離實驗室中驗證修補 | 在人工核准與確定性檢查下進行測試 |
| 需要適合揭露、品質穩定的報告 | 與已測量精準度及審查工時的模型比較 |
| 未經監督地測試第三方系統 | 不要部署;模型不會替你提供授權 |
| 自行託管敏感程式碼 | 等候確認權重、授權、硬體需求與安全審查結果 |
比較實際的做法,是用過去已獲授權的漏洞案例建立一套小型重播測試集,再把 GLM-5.3 與目前使用的模型放在相同條件下比較召回率、誤報率、產出可用報告所需時間與成本。這種來自自身環境的證據,比根據排行榜上的單一數字做選擇更有價值。
常見問題
GLM-5.3 是最強的資安模型嗎?
目前沒有公開證據支持這麼廣泛的結論。GLM-5.3 在部分公開測試設定中領先或接近領先,但在其他漏洞利用基準測試中落後於 Mythos 5 和 GPT-5.6 Sol,而且獨立複現仍然有限。
CyberGym 的 84.5 分代表什麼?
這是特定漏洞重現設定下公布的成功率,不代表 GLM-5.3 能自主攻陷 84.5% 的任意系統。
GLM-5.3 是開放權重模型嗎?
發布期間的供應狀況與授權曾經變動。若要規劃自行託管,請先確認目前官方發布狀態與授權條款;不要假設 GLM-5.2 的條款會自動延續到 GLM-5.3。
GLM-5.3 可以用於滲透測試嗎?
只能測試你擁有或明確獲得授權的系統。模型主打資安防禦,並不代表你因此取得存取或攻擊目標的許可。
為什麼不同來源的基準測試數字不一樣?
它們可能測試了不同的模型版本、測試框架、資訊量、時間限制或評分規則。Anthropic 的 50/410 對 56/410 評估結果,不能和 Z.ai 更廣泛的基準測試表格硬合併成同一張排行榜。
取捨其實很明顯:GLM-5.3 已經強到值得進行認真的防禦用途試用,但 CyberGym 的醒目分數並不是完整答案。團隊應該根據可量化的工作流程來選擇它,特別是漏洞分流或修補驗證,同時把漏洞利用的界線、授權界線與人工審查界線分開看待。