AIREITER

Бенчмарки GLM-5.3 по кибербезопасности: что на самом деле означает результат 84,5

Последнее обновление: 2026-09-30 07:29:49

Результат 84,5% легко принять за прорыв GLM-5.3 в кибербезопасности. Но это число получено в конкретном, насыщенном подсказками сценарии CyberGym. Более точный вывод звучит скромнее: GLM-5.3 значительно превосходит GLM-5.2, однако лучшие доступные публичные данные по-прежнему показывают отставание в сквозном создании эксплойтов, а независимое воспроизведение результатов пока остается неполным.

Что именно измеряют показатели GLM-5.3 в кибербезопасности

Заявленные результаты GLM-5.3 охватывают воспроизведение уязвимостей, создание эксплойтов и длительные агентские запуски. Это связанные, но все же разные задачи — их нельзя сводить к единому показателю «эффективности в безопасности».

БенчмаркGLM-5.3Релевантное сравнениеЧто измеряет
CyberGym84,5% по данным Z.aiGLM-5.2: 77,2%; Mythos 5: 83,8%; GPT-5.6 Sol: 83,6%Воспроизведение известных уязвимостей при заданном объеме информации
ExploitBench54,4%GLM-5.2: 24,4%; Mythos 5: 78%; GPT-5.6 Sol: 76,5%Продвижение от поиска примитивов эксплойта к выполнению кода
ExploitGym105 задач за 2 часа; 130 за 6 часовGLM-5.2: 29 и 39; Mythos 5: 181 и 247Решение задач на создание эксплойтов при разных лимитах времени

Приведенные выше цифры взяты из сравнений Z.ai и опубликованных в тот же период анализов. В оценке Anthropic приводится другой результат: GLM-5.3 завершила 50 из 410 сквозных попыток в ExploitBench, тогда как Claude Mythos Preview — 56. Разница напоминает о важном правиле: для каждой цифры нужно указывать вариант модели, тестовый стенд и протокол подсчета.

Три разных среза: поиск уязвимостей, создание эксплойтов и время работы

Заголовочный результат CyberGym проще всего неправильно понять

Показатель 84,5% в CyberGym не означает, что GLM-5.3 способен взломать 84,5% любых реальных систем. Это контролируемый тест на воспроизведение уязвимостей, причем сложность задания меняется в зависимости от объема предоставленной информации. В разных режимах модели могут дать только код до установки патча, а могут дополнительно предоставить описание уязвимости, трассировку сбоя, diff патча и код после внесения исправлений.

Это принципиальная разница: тестирование в режиме white-box с большим количеством подсказок — совсем не то же самое, что поиск неизвестной уязвимости с нуля. D-Central сформулировал мысль предельно прямо:

«Результат 84,5 в таком сценарии — это не четырехкратный рост относительно потолка примерно в 20% в научных работах; это другой экзамен». — D-Central

Корректный вывод таков: в заявленной конфигурации CyberGym GLM-5.3 показывает очень сильный результат. Но этот показатель не является общей вероятностью найти или эксплуатировать неизвестную ошибку.

ExploitBench подтверждает настоящий рывок, но не равенство с лидерами

ExploitBench лучше отвечает на вопрос, умеет ли GLM-5.3 двигаться дальше простого обнаружения дефекта. Lumina описывает этот тест как оценку пути от уязвимого кода через примитивы эксплойта к выполнению кода.

Зафиксированный результат GLM-5.3 составляет 54,4% против 24,4% у GLM-5.2. Для нового поколения это серьезный прирост. Однако до уровня самых сильных закрытых систем в том же опубликованном сравнении модель не дотягивает: у Mythos 5 заявлено 78%, у GPT-5.6 Sol — 76,5%.

На странице бенчмарка Lumina с отслеживанием источников также есть важное предупреждение: результаты, полученные на разных версиях, уровнях усилий и системах исполнения, нельзя автоматически считать сопоставимыми. Сравнение Anthropic — 50 против 56 — подтверждает это ограничение: на одном стенде модели могут показывать близкие результаты, а на другом разрыв окажется заметно больше.

ExploitGym по-другому проверяет способность к долгой работе

ExploitGym добавляет в оценку фактор времени. Z.ai заявила о 105 выполненных задачах за два часа и 130 за шесть часов. Для GLM-5.2 соответствующие показатели составили 29 и 39, а Mythos 5 в сравнении, пересказанном D-Central, достигла 181 и 247 задач.

Таким образом, результат за шесть часов показывает заметное улучшение относительно GLM-5.2, но не говорит о том, что GLM-5.3 масштабируется так же, как ведущая закрытая модель, при увеличении лимита времени. Длительные агентские запуски позволяют увидеть не только способности к рассуждению, но и потолок производительности модели. Одновременно они повышают вычислительные затраты и потребность в проверке человеком.

Что эти результаты означают для практического применения

GLM-5.3 стоит проверить в авторизованных защитных сценариях — прежде всего для сортировки кода, воспроизведения уязвимостей и проверки патчей. Однако открытые данные не дают оснований использовать модель как автономного оператора для атак или считать успешный результат бенчмарка заменой разрешению на тестирование.

Z.ai сообщает, что в рамках работы по раскрытию уязвимостей были получены 2 436 находок в 269 проектах с открытым исходным кодом. Из них 1 097 классифицированы как критические или высокорисковые, 53 уже раскрыты публично, а 2 383 на заявленный момент запуска находились под эмбарго. Это операционные данные, но они предоставлены самой компанией и не означают, что каждая находка представляет собой подтвержденный эксплойт.

Отдельная реакция реального пользователя хорошо объясняет, почему релиз привлек внимание специалистов, у которых нет доступа к закрытым кибермоделям:

«Лично я использовал Kimi-K3 и GLM-5.3 — это были мои основные модели для пентестов и анализа безопасности». — @raopreetam_, X

Это пользовательский опыт, а не результат бенчмарка. Он подтверждает более узкий тезис: GLM-5.3 представляет практический интерес для специалистов по безопасности, но не доказывает ее универсальное превосходство.

Ответственную проверку стоит проводить в изолированной среде с явным разрешением и оценивать не только количество найденных проблем, но и долю ложных срабатываний, качество отчетов, точность проверки патчей, расход токенов и время ревью. Модель, которая находит больше кандидатов, но заваливает команду шумом, может оказаться менее полезной, чем немного более слабая система с аккуратными отчетами.

Ограничения API, весов и миграции

В период запуска условия доступа менялись, поэтому на вопрос «Доступна ли GLM-5.3?» нужен точный ответ. VentureBeat сообщала о первоначальном доступе через GLM Coding Plan и ZCode от Z.ai, тогда как API и открытые веса должны были появиться после оценки безопасности и дополнительного усиления защиты. Более поздние публикации сторонних источников описывали доступ к API, но перед использованием в продакшене нужно проверить у провайдера актуальные условия доступности, лицензирования и цены.

Разработчикам важно учесть поведение модели при миграции. GLM-5.3 постоянно использует режим рассуждений с уровнями усилий, включая low, high и max. Приложения, которые отправляют thinking.type: "disabled", придется изменить перед заменой идентификатора модели — в противном случае запрос может завершиться ошибкой. Поэтому переход на GLM-5.3 — это миграция API, а не простая замена строки.

Не следует считать, что лицензия открытых весов GLM-5.2 автоматически распространяется на GLM-5.3. Доступность весов, разрешения лицензии, размещение API у провайдера и условия хранения данных — разные вопросы, которые команде по безопасности нужно рассматривать отдельно.

Стоит ли команде по безопасности тестировать GLM-5.3

Рассматривайте GLM-5.3 как кандидата для контролируемой проверки, а не как автоматическую замену зрелому процессу безопасности.

СценарийРешение
Массовая сортировка задач в принадлежащих вам репозиторияхПроверить: заявленный прирост относительно GLM-5.2 существенный
Проверка патчей в изолированной лабораторииПроверить с одобрением человека и детерминированными тестами
Требуются аккуратные отчеты, готовые к раскрытиюСравнить с моделью, для которой измерены точность, доля ложных срабатываний и трудозатраты ревьюеров
Автономное тестирование сторонних системНе использовать: модель не дает разрешения на тестирование
Самостоятельное размещение чувствительного кодаДождаться подтвержденных данных о весах, лицензии, требованиях к оборудованию и пройти проверку безопасности

Практичный подход — собрать небольшой набор воспроизведения из исторических находок, полученных с разрешения. Сравните GLM-5.3 с текущей моделью по полноте обнаружения, доле ложных срабатываний, времени до полезного отчета и стоимости. Такие локальные данные ценнее, чем выбор одной строки в таблице лидеров.

FAQ

GLM-5.3 — лучшая модель для кибербезопасности?

Публичные данные не подтверждают столь широкий вывод. В некоторых заявленных конфигурациях GLM-5.3 лидирует или почти лидирует, но на других тестах создания эксплойтов уступает Mythos 5 и GPT-5.6 Sol, а независимое воспроизведение результатов остается ограниченным.

Что означает результат 84,5% в CyberGym?

Это заявленная доля успешных попыток в конкретной конфигурации теста на воспроизведение уязвимостей. Она не означает, что GLM-5.3 способна автономно взломать 84,5% любых систем.

GLM-5.3 распространяется с открытыми весами?

Условия доступности и лицензирования менялись в период запуска. Перед планированием самостоятельного размещения проверьте актуальный официальный статус релиза и лицензию; нельзя предполагать, что условия GLM-5.2 автоматически распространяются на новую модель.

Можно ли использовать GLM-5.3 для пентестов?

Только в системах, которыми вы владеете, или на тестирование которых у вас есть явное разрешение. Позиционирование модели как инструмента защиты не дает права получать доступ к цели или атаковать ее.

Почему разные источники приводят разные цифры бенчмарков?

Они могут тестировать разные варианты модели, стенды, уровни доступной информации, лимиты времени или правила подсчета. Результаты Anthropic — 50/410 против 56/410 — и более широкую таблицу бенчмарков Z.ai не следует объединять в один рейтинг.

Общий вывод достаточно четкий: GLM-5.3 уже достаточно сильна, чтобы всерьез проверить ее в защитных сценариях, но один громкий результат в CyberGym не дает полной картины. Выбирать модель стоит под конкретный и измеримый процесс — особенно сортировку задач или проверку патчей, — не смешивая границу допустимого создания эксплойтов, границу авторизации и обязательность проверки человеком.