GLM-5.3 от Z.ai: кодинг, кибербезопасность и уже найденная уязвимость в Cursor
Z.ai (Zhipu) выпустила GLM-5.3 — без переобучения базовой модели на 743B параметров, только за счёт масштабированного пост-треинга. Terminal-Bench 3.0 вырос с 4.6 до 28.3, CyberGym достиг 84.5%, обойдя GPT-5.6 Sol и Mythos 5. Веса выйдут примерно через две недели после safety-проверки. Модель уже предположительно обнаружила серьёзную уязвимость в редакторе Cursor.
Пекинская Z.ai (она же Zhipu) выпустила GLM-5.3 — и уже в первые дни после релиза модель предположительно нашла серьёзную уязвимость в популярном AI-редакторе Cursor.
Что изменилось без переобучения
GLM-5.3 работает на той же базовой модели с 743 млрд параметров, что и GLM-5.2. Никакой новой архитектуры нет. Весь прирост получен за счёт масштабированного пост-тренинга: больше задачных сред, больше типов окружений, дольше обучение.
Это важный момент: Z.ai показывает, что значительный прирост возможностей достигается без переобучения базы — только за счёт работы с данными и средами на этапе после предобучения.
Цифры по кодингу
Кодинг вырос сильнее всего именно на задачах с длинным горизонтом:
- Terminal-Bench 3.0: с 4.6 до 28.3
- DeepSWE v1.1: с 46.2 до 66.9
- Agents’ Last Exam (CLI): с 23.8 до 28.5
На внутреннем бенчмарке Z.ai Code Bench компания сообщает о 50% улучшении по сравнению с GLM-5.2. На нём же GLM-5.3 набирает 31.4% при ~50 000 выходных токенов на задачу. Claude Opus 4.8 берёт 29.5%, но при 120 000 токенов. Claude Fable 5 сохраняет лидерство — 39.5% при максимальных усилиях.
На публичных бенчмарках GLM-5.3 пока уступает GPT-5.6 Sol и Claude Fable 5 на ряде сложных задач. Все цифры — вендорные, с задокументированными настройками harness, контекста и семплинга.
На GDPval-AA v2, охватывающем 44 профессии, GLM-5.3 набирает 1 769 баллов.
Кибербезопасность: неожиданный скачок
Здесь Z.ai признаётся, что результат вышел за пределы ожиданий. Компания добавляла данные по обнаружению уязвимостей ради улучшения рассуждений в рамках одного бага. В итоге модель начала выстраивать связные планы через целые цепочки эксплуатации.
- CyberGym (обнаружение и валидация из белого ящика): с 77.2% до 84.5% — обгоняет Mythos 5 (83.8%) и GPT-5.6 Sol (83.6%)
- ExploitBench (требует рассуждений о первопричине и рабочего эксплойта): с 24.4% до 54.4%; Mythos 5 здесь набирает 78.0%
- ExploitGym: GLM-5.3 закрывает 105 задач за 2 часа и 130 за 6 часов; GLM-5.2 давала 29 и 39 соответственно; Mythos 5 — 181 и 247
Паттерн устойчивый: чем глубже бенчмарк погружается в цепочку эксплуатации, тем больше отрыв от GLM-5.2. Разрыв с закрытыми фронтирными моделями при этом тоже растёт.
Уязвимость в Cursor
По данным VentureBeat, GLM-5.3 предположительно уже обнаружила серьёзную уязвимость в редакторе Cursor. Детали пока не раскрываются, подробности в источнике не приводятся. Z.ai ведёт Security Disclosure Ledger — публичный журнал раскрытий.
Доступность и веса
Сейчас GLM-5.3 доступна через:
- Z.ai API
- GLM Coding Plan
- ZCode
Веса пока не опубликованы. Z.ai обещает выложить их примерно через две недели после запуска — после завершения safety-оценки и hardening. По данным Incrussia, модель выходит под открытой лицензией, что должно привлечь разработчиков.
Контекст: Z.ai на рынке
Z.ai — один из пионеров китайского рынка ИИ и первый разработчик крупных языковых моделей, вышедший на биржу. По данным Incrussia, на пике после релиза GLM-5.2 рыночная капитализация компании достигала $137 млрд, сейчас — около $80 млрд, что всё равно в десять раз выше уровня январского листинга в Гонконге. Годовой повторяющийся доход (ARR) достиг $1 млрд в июле.
Компания также построила дата-центр с не менее чем 10 000 китайских чипов для разработки и развёртывания моделей семейства GLM.
Среди конкурентов в открытом сегменте — Kimi от Moonshot, DeepSeek V4 и Qwen от Alibaba. DeepSeek на прошлой неделе поднял цены на V4 Flash и Pro до четырёх раз, хотя смешанная цена V4 Pro пока остаётся ниже стоимости GLM-5.2, по данным Artificial Analysis.
Что это значит
Если ты работаешь с кодом или занимаешься безопасностью — GLM-5.3 уже сейчас доступна через API и Coding Plan, и её можно тестировать на реальных задачах.
Для security-команд это одновременно возможность и повод для беспокойства: модель с ExploitBench на 54.4% и способностью выстраивать цепочки эксплуатации — это инструмент, который меняет планку white-box аудита. Но он же работает на всех, у кого есть API-ключ.
Если тебе нужны веса для локального запуска или кастомизации — жди примерно до конца августа.
Источники: VentureBeat, 14 августа · Incrussia · Marktechpost, 14 августа