GLM-5.3의 사이버보안 점수 84.5만 보면 획기적인 돌파구처럼 보인다. 하지만 이 수치는 정보가 풍부하게 제공되는 특정 CyberGym 설정에서 나온 결과다. 더 정확한 결론은 따로 있다. GLM-5.3은 GLM-5.2보다 확실히 좋아졌지만, 공개된 최선의 근거만으로는 엔드투엔드 익스플로잇 제작에서 여전히 격차가 있고 독립적인 재현도 충분히 이뤄지지 않았다.
GLM-5.3의 사이버보안 수치는 실제로 무엇을 측정하나
GLM-5.3의 사이버보안 평가에는 취약점 재현, 익스플로잇 제작, 장시간 에이전트 실행이 포함된다. 서로 연관된 과제이기는 하지만, 모두를 뭉뚱그려 하나의 ‘보안 성능’으로 볼 수는 없다.
| 벤치마크 | GLM-5.3 | 주요 비교 대상 | 측정 항목 |
|---|---|---|---|
| CyberGym | Z.ai 보고 기준 84.5% | GLM-5.2: 77.2%; Mythos 5: 83.8%; GPT-5.6 Sol: 83.6% | 정해진 정보 수준에서 알려진 취약점을 재현하는 능력 |
| ExploitBench | 54.4% | GLM-5.2: 24.4%; Mythos 5: 78%; GPT-5.6 Sol: 76.5% | 익스플로잇 프리미티브와 코드 실행으로 이어지는 진행 정도 |
| ExploitGym | 2시간에 105개 과제, 6시간에 130개 과제 | GLM-5.2: 29개와 39개; Mythos 5: 181개와 247개 | 서로 다른 시간 제한에서 수행한 익스플로잇 과제 |
위 수치는 Z.ai가 보고한 비교 결과와 같은 시기에 나온 분석을 바탕으로 한다. 여기에 Anthropic의 평가는 또 다른 결과를 제시한다. GLM-5.3은 엔드투엔드 ExploitBench 시도 410건 중 50건을 완료했고, Claude Mythos Preview는 56건을 완료했다. 결과가 엇갈리는 이유는 모든 수치에 모델 버전, 실행 하니스, 점수 산정 프로토콜을 함께 붙여서 봐야 한다는 점을 보여준다.
벤치마크를 나눠서 봐야 하는 이유: 탐색, 익스플로잇 제작, 시간 제한
CyberGym 점수만으로는 판단하기 어렵다
CyberGym의 84.5점이 GLM-5.3이 현실의 임의 시스템 84.5%를 뚫을 수 있다는 뜻은 아니다. 이 평가는 통제된 취약점 재현 과제이며, 제공되는 정보의 양에 따라 난도가 달라진다. 공개된 설정에는 패치 전 코드만 주어지는 경우부터 취약점 설명, 크래시 추적 정보, 패치 diff, 패치 후 코드까지 제공되는 경우가 포함된다.
이 차이는 중요하다. 단서가 풍부한 화이트박스 평가와 아무런 전제 없이 취약점을 찾아야 하는 평가는 전혀 다른 시험이기 때문이다. D-Central은 이 문제를 다음과 같이 요약했다.
“그 설정에서 나온 84.5는 기존 연구의 약 20%라는 상한선보다 네 배 향상됐다는 뜻이 아니다. 아예 다른 시험이다.” — D-Central
가장 타당한 해석은 GLM-5.3이 해당 CyberGym 설정에서 매우 강력하다는 것이다. 이 점수는 알려지지 않은 버그를 찾아내거나 익스플로잇할 일반적인 확률을 의미하지 않는다.
ExploitBench는 큰 도약을 보여주지만 선두와 동급은 아니다
GLM-5.3이 결함을 찾아내는 데서 그치지 않고 실제 공격 단계로 나아갈 수 있는지 궁금하다면 ExploitBench가 더 유용한 지표다. Lumina에 따르면 이 벤치마크는 취약한 코드에서 출발해 익스플로잇 프리미티브를 거쳐 코드 실행에 이르는 진행 상황을 측정한다.
GLM-5.3의 기록 점수는 54.4%로, GLM-5.2의 24.4%보다 크게 높아졌다. 세대 간 성능 향상은 분명하다. 다만 같은 공개 비교에서 가장 강력한 폐쇄형 시스템과 동급이라고 보기는 어렵다. 보고된 점수는 Mythos 5가 78%, GPT-5.6 Sol이 76.5%다.
Lumina의 출처 추적형 벤치마크 페이지 역시 버전, 추론 노력 설정, 실행 시스템이 다르면 결과를 단순 비교할 수 없다고 경고한다. Anthropic의 50건 대 56건 결과도 같은 주의점을 뒷받침한다. 한 하니스에서는 결과가 비슷해도 다른 하니스에서는 격차가 더 크게 나타날 수 있다.
ExploitGym은 긴 실행 시간에서 다른 모습을 보여준다
ExploitGym은 시간이라는 변수를 추가한다. Z.ai는 2시간 제한에서 105개, 6시간 제한에서 130개의 과제를 완료했다고 보고했다. D-Central이 정리한 비교에서 GLM-5.2는 각각 29개와 39개였고, Mythos 5는 181개와 247개에 도달했다.
따라서 6시간 결과는 GLM-5.2보다 의미 있는 개선을 보여주지만, 더 많은 시간이 주어졌을 때 GLM-5.3이 선두 폐쇄형 모델처럼 성능을 확장한다는 증거는 아니다. 장시간 에이전트 실행은 추론 능력과 성능 한계를 함께 드러내며, 동시에 컴퓨팅 비용과 사람의 검토 필요성도 키운다.
실무 활용에 대해 확인할 수 있는 것
GLM-5.3은 코드 분류, 취약점 재현, 패치 검증처럼 권한이 부여된 방어적 업무에서 평가해볼 만하다. 하지만 공개된 근거만으로 감독 없는 공격용 에이전트로 배포하거나, 벤치마크 성과를 권한 부여의 대체재로 취급해서는 안 된다.
Z.ai는 공개 소스 프로젝트 269개에서 총 2,436건의 발견 사항을 확보했으며, 이 가운데 1,097건은 심각 또는 높음 등급으로 분류됐고 53건은 공개됐으며 2,383건은 발표 당시 엠바고 상태였다고 밝혔다. 운영 환경에서 나온 근거라는 점은 의미가 있지만, 여전히 공급업체가 직접 보고한 수치이며 모든 발견 사항이 검증된 익스플로잇이라는 뜻은 아니다.
게이트가 걸린 사이버 모델에 접근하기 어려운 실무자들 사이에서 이번 출시가 주목받은 이유는 한 사용자의 반응에서도 드러난다.
“저는 실제로 진행하는 침투 테스트나 보안 분석에서 Kimi-K3와 GLM-5.3을 주력 모델로 사용해왔습니다.” — @raopreetam_, X
이는 사용자의 경험이지 벤치마크 결과는 아니다. GLM-5.3이 보안 전문가에게 실무적으로 흥미로운 모델이라는 점은 뒷받침하지만, 모든 면에서 최고의 모델이라는 뜻은 아니다.
책임 있는 평가를 하려면 모델을 격리된 권한 부여 환경 안에 두고 오탐률, 보고서 품질, 패치 검증 정확도, 토큰 비용, 검토에 걸리는 시간을 측정해야 한다. 더 많은 후보를 찾아내더라도 팀에 잡음을 쏟아내는 모델이라면, 조금 약하더라도 더 깔끔한 보고서를 만드는 모델보다 유용성이 떨어질 수 있다.
API, 가중치, 마이그레이션 제약
출시 기간 중 이용 가능 범위가 바뀌었기 때문에 ‘GLM-5.3을 사용할 수 있나?’라는 질문에는 조건을 붙여 답해야 한다. VentureBeat에 따르면 초기 접근은 Z.ai의 GLM Coding Plan과 ZCode를 통해 제공됐고, API 접근과 오픈 웨이트는 안전성 평가 및 강화 작업 뒤 단계적으로 공개될 예정이었다. 이후 외부 보도에서는 API 접근이 가능하다고 전했지만, 실제 운영에 투입하기 전에는 일반 이용 가능 여부, 라이선스 조건, 가격을 제공업체에서 확인해야 한다.
개발자에게는 마이그레이션 방식도 중요하다. GLM-5.3은 항상 활성화된 사고 모드를 사용하며, 추론 노력 수준으로 low, high, max 등을 제공한다. thinking.type: "disabled"를 전송하는 애플리케이션은 모델 ID를 바꾸기 전에 해당 요청을 수정해야 한다. 그렇지 않으면 요청이 실패할 수 있다. 단순히 모델 문자열만 바꾸는 작업이 아니라 API 마이그레이션이 필요한 이유다.
GLM-5.2의 오픈 웨이트 라이선스가 GLM-5.3에도 적용된다고 가정해서는 안 된다. 웨이트 공개 여부, 라이선스 권한, 호스팅 API 접근, 데이터 레지던시 조건은 보안팀이 각각 별도로 판단해야 한다.
보안팀이 GLM-5.3을 평가해야 할까?
GLM-5.3은 통제된 평가의 후보로 활용하되, 성숙한 보안 파이프라인을 자동으로 대체할 모델로 봐서는 안 된다.
| 상황 | 판단 |
|---|---|
| 보유한 저장소 전체를 폭넓게 분류해야 하는 경우 | 테스트할 가치가 있다. GLM-5.2보다 보고된 향상이 크다 |
| 격리된 실험실에서 패치를 검증하는 경우 | 사람의 승인과 결정론적 검사를 함께 적용해 테스트한다 |
| 깔끔하고 공개 가능한 수준의 보고서가 필요한 경우 | 측정된 정밀도와 검토 시간을 기준으로 다른 모델과 비교한다 |
| 제3자 시스템을 감독 없이 테스트하는 경우 | 배포하지 않는다. 모델이 테스트 권한을 부여하는 것은 아니다 |
| 민감한 코드를 직접 호스팅해야 하는 경우 | 확인된 웨이트, 라이선스, 하드웨어 요구 사항, 보안 검토가 마련될 때까지 기다린다 |
실무적으로는 과거의 권한 부여된 발견 사례를 바탕으로 작은 재현 테스트 모음을 만드는 것이 좋다. 현재 사용하는 모델과 GLM-5.3을 대상으로 재현율, 오탐률, 유용한 보고서가 나오기까지 걸리는 시간, 비용을 비교하자. 단일 리더보드의 한 줄보다 조직의 실제 환경에서 얻은 근거가 훨씬 중요하다.
FAQ
GLM-5.3이 최고의 사이버보안 모델인가?
그처럼 광범위한 결론을 뒷받침하는 공개 근거는 없다. GLM-5.3은 일부 보고된 설정에서 선두이거나 선두에 가깝지만, 다른 익스플로잇 벤치마크에서는 Mythos 5와 GPT-5.6 Sol에 뒤처지며 독립적인 재현도 아직 제한적이다.
CyberGym 84.5점은 무엇을 의미하나?
정해진 취약점 재현 설정에서 기록한 보고 성공률이다. GLM-5.3이 임의의 시스템 84.5%를 자율적으로 침해할 수 있다는 뜻은 아니다.
GLM-5.3은 오픈 웨이트인가?
출시 기간 동안 이용 가능 여부와 라이선스가 바뀌었다. 직접 호스팅을 계획하기 전 현재 공식 출시 상태와 라이선스를 확인해야 하며, GLM-5.2의 조건이 그대로 적용된다고 가정해서는 안 된다.
GLM-5.3을 침투 테스트에 사용할 수 있나?
소유하고 있거나 명시적인 테스트 권한을 받은 시스템에서만 사용할 수 있다. 모델이 사이버 방어를 지향한다고 해서 대상에 접근하거나 공격할 권한이 생기는 것은 아니다.
출처마다 벤치마크 수치가 다른 이유는 무엇인가?
서로 다른 모델 버전, 하니스, 정보 수준, 시간 제한, 점수 산정 규칙을 사용했을 수 있다. Anthropic의 50/410 대 56/410 평가와 Z.ai의 종합 벤치마크 표를 하나의 리더보드로 합쳐서는 안 된다.
트레이드오프는 분명하다. GLM-5.3은 이제 진지하게 방어적 활용을 시험해볼 만한 수준에 도달했지만, CyberGym의 headline 점수만으로 전체를 판단할 수는 없다. 팀은 특히 분류나 패치 검증처럼 측정 가능한 워크플로에 맞춰 모델을 선택해야 하며, 익스플로잇의 경계와 권한의 경계, 사람의 검토 경계를 서로 분리해 관리해야 한다.