Новый подход к обучению
Компания Z.ai представила модель GLM-5.3. В отличие от предыдущих версий, архитектура модели осталась прежней, как и в GLM-5.2. Весь прирост возможностей был достигнут за счет масштабирования этапа пост-обучения (post-training).
Вместо изменения структуры нейросети разработчики сосредоточились на расширении среды обучения. Модель тренировали в максимально разнообразных сценариях, которые имитируют реальные рабочие задачи профессионалов, а не просто учебные упражнения по программированию.
Профессиональные задачи вместо тестов
Для обучения использовались сложные среды, максимально приближенные к реальной работе. Например, модель помещали в рабочее окружение инженера по инфраструктуре машинного обучения. Ей предоставляли доступ к вычислительным кластерам, внутренней документации, кодовым базам и результатам экспериментов.
Задача модели заключалась в диагностике узких мест, внедрении оптимизаций и обеспечении измеримого ускорения работы. Некоторые из таких задач по сложности соответствуют нескольким дням работы опытного инженера.
Успехи в программировании
По результатам внутренних тестов Z.ai, GLM-5.3 стала сильнейшей системой с открытыми весами в области написания кода. Модель показала значительный рост на сложных тестах: например, на бенчмарке Terminal-Bench 3.0 результат вырос с 4.6 до 28.3 баллов по сравнению с предыдущей версией.
В сравнении с конкурентами результаты смешанные. Модель превзошла Claude Opus 4.8 по эффективности, потребляя при этом меньше токенов на выполнение задачи, но уступила Anthropic Claude Fable 5 и OpenAI GPT-5.6 Sol в наиболее сложных тестах на программирование.
Неожиданный рост в кибербезопасности
Одним из самых неожиданных результатов стал резкий скачок способностей модели в сфере кибербезопасности. Z.ai планировала лишь улучшить навыки поиска отдельных уязвимостей, но масштабирование обучения привело к другому эффекту.
Вместо поиска разрозненных ошибок модель научилась выстраивать последовательные планы по эксплуатации уязвимостей. Она начала понимать цепочки атак, переходя от обнаружения одной ошибки к реализации полноценного сценария взлома.
На тесте ExploitGym, где оценивается количество выполненных задач по эксплуатации уязвимостей за ограниченное время, GLM-5.3 показала результат в 130 задач за шесть часов, тогда как предыдущая версия справлялась лишь с 39. При этом лидер среди конкурентов, модель Mythos 5, показала еще более высокие результаты.
Практическое применение и безопасность
Возможности модели уже подтверждены на практике. Совместно с командами специалистов из Китая, модель обнаружила 2436 уязвимостей в 269 проектах с открытым исходным кодом. Среди них — критические ошибки в ядрах систем, браузерных движках и сетевых протоколах. Некоторые из этих уязвимостей не замечались годами, включая ошибки, внесенные еще в 1981 году.
В связи с тем, что модель продемонстрировала более высокие навыки в области наступательной кибербезопасности, чем ожидалось, Z.ai отложила публикацию весов на две недели. Это время необходимо для проведения проверок безопасности и укрепления защиты модели.
Что это значит
Разработчики планируют опубликовать веса модели GLM-5.3 в открытом доступе через две недели, после завершения всех проверок безопасности.
