VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиGLM-5.2 от Z.ai почти догнал GPT-5.5 по кибервозможностям — и не отказал ни на один опасный запрос
НовостьНовость

GLM-5.2 от Z.ai почти догнал GPT-5.5 по кибервозможностям — и не отказал ни на один опасный запрос

VCL
Редакция
Vibe Coding Lab
4 августа 2026обновлено 04.08
4 мин чтения
КОРОТКО

Некоммерческая организация SaferAI опубликовала отчёт: китайская открытая модель GLM-5.2 от Z.ai отстаёт от GPT-5.5 и Claude Opus 4.7 по кибер- и биовозможностям всего на несколько месяцев. При этом GLM-5.2 не отказала ни на один из тестовых опасных запросов. Z.ai не опубликовала ни фреймворка безопасности, ни результатов предрелизного тестирования.

Открытые модели давно перестали быть «слабыми братьями» закрытых систем. Новый отчёт SaferAI показывает, что разрыв в возможностях стремительно сокращается - а вот разрыв в практиках безопасности растёт.

Что нашла SaferAI

SaferAI - некоммерческая организация в сфере AI safety - протестировала GLM-5.2, открытую модель от китайской компании Z.ai, через публичный API. Вывод: по возможностям в кибербезопасности и биологии GLM-5.2 отстаёт от GPT-5.5 (OpenAI) и Claude Opus 4.7 (Anthropic) всего на несколько месяцев.

При этом GLM-5.2 не отказала ни на один из тестовых запросов по offensive cyber и dual-use biology.

Для сравнения: Claude Opus 4.7 отказывал настолько последовательно, что SaferAI вообще не смогла завершить на нём бенчмарк CyberGym. CyberGym - это бенчмарк оценки кибервозможностей, который OpenAI использовала в оценке накануне недавнего взлома Hugging Face.

В чём проблема с открытыми весами

Z.ai может добавить защитные меры на своём hosted API - но это ничего не даёт, если человек скачал веса и запустил модель на собственном железе. Там любые safeguards можно убрать, модифицировать, сменить системный промпт или дообучить модель под свои нужды.

Закрытые модели вроде GPT или Claude опираются на классификаторы, refusal training и контроль на уровне API. Эти меры, конечно, не абсолютны: Far.ai (тоже AI safety nonprofit) нашла сотни универсальных джейлбрейков во фронтирных моделях - в частности, в Grok 4.5 от xAI и Gemini 3.1 Pro от Google DeepMind. Джейлбрейки срабатывают, когда атакующий комбинирует несколько техник: ролплей, имперсонацию авторитетов, поддельную историю переписки, follow-up промпты.

Но даже несовершенные меры закрытых моделей совсем не работают с открытыми - там их просто нет.

Что говорит SaferAI

«Фронтир по возможностям - это не фронтир по риску. Чтобы правильно оценить риск, нужно учитывать состояние защитных мер», - сказал TechCrunch Генри Пападатос, исполнительный директор SaferAI.

В качестве одного из подходов Пападатос упомянул pre-training data filtering - фильтрацию обучающих данных от offensive cybersecurity информации до начала тренировки модели. Некоторые исследования показывают, что это снижает опасные биологические знания без потери общей производительности. Но для кибербезопасности этот подход гораздо сложнее реализовать: модель, которая хорошо пишет код, неизбежно умеет и в хакинг, а код - главный источник монетизации в AI.

Поэтому фронтирные разработчики всё чаще идут другим путём. Например, Anthropic’s Opus 5 умеет искать уязвимости в исходном коде, но не в скомпилированном ПО - такое ограничение прописано прямо в system card модели. Это усложняет использование для offensive целей.

Что делает (и не делает) Z.ai

По данным SaferAI, Z.ai не опубликовала ни фреймворка безопасности, ни обязательств по предрелизному тестированию, ни оценки рисков для GLM-5.2. TechCrunch направил запрос в Z.ai с вопросом, проводила ли компания внутреннее или стороннее тестирование перед релизом - ответа не последовало.

Китайский регуляторный контекст

На Всемирной конференции по AI в прошлом месяце председатель КНР Си Цзиньпин подчеркнул важность открытых моделей и необходимость держать AI под строгим контролем людей.

Грэм Уэбстер, исследователь китайской AI-политики в Stanford Cyber Policy Center, объяснил TechCrunch: у Китая есть серьёзное AI-регулирование, но исторически оно сфокусировано на политически чувствительном контенте, дезинформации и социальной стабильности - а не на катастрофических рисках вроде offensive cyber или биомисиуза.

«Американские AI-исследователи, как правило, больше озабочены экзистенциальными и катастрофическими рисками, чем китайские коллеги», - сказал Уэбстер, добавив, что многие китайские policy researchers считают: если и возникнет новый фронтирный риск, с ним столкнутся сначала американские компании.

Уэбстер также отметил, что в Китае интернет-активность привязана к реальным именам, а компании и пользователи могут быть привлечены к ответственности. По его мнению, те же механизмы, которые заставляют модели отказывать на политически чувствительные темы, теоретически можно настроить и для блокировки offensive cyber или опасных биотехнических запросов.

Что это значит

Пока ты читаешь дискуссию о том, «могут ли открытые модели конкурировать с фронтиром», ответ уже «да» - по крайней мере в чувствительных областях. Вопрос сдвинулся: как управлять рисками после того, как веса уже выложены в открытый доступ.

Если ты работаешь с AI в компании и принимаешь решения о том, какие модели использовать - это не абстрактная дискуссия. Открытые модели без публичных safety-фреймворков несут реальные риски при использовании в enterprise-контексте. Есть смысл отслеживать, публикует ли вендор предрелизные оценки рисков, - их отсутствие теперь само по себе сигнал.


Источник: TechCrunch, 4 августа, ссылка


FAQ

Что такое GLM-5.2? Открытая (open-weight) языковая модель от китайской компании Z.ai. Открытые веса означают, что модель можно скачать и запустить на своём оборудовании.

Что такое CyberGym? Бенчмарк для оценки кибервозможностей AI-моделей. OpenAI использовала его в оценке перед недавним взломом Hugging Face.

Почему нельзя просто добавить safeguards к открытым моделям? Можно - на уровне API. Но если пользователь скачал веса и запускает модель локально, любые защиты можно убрать или обойти. Никакого централизованного контроля нет.

TechCrunch · 4 августа
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться