VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиGPT-Red: как OpenAI автоматизировала красную команду и обогнала людей 84% против 13%
НовостьНовостьChatGPT

GPT-Red: как OpenAI автоматизировала красную команду и обогнала людей 84% против 13%

VCL
Редакция
Vibe Coding Lab
16 июля 2026обновлено 16.07
4 мин чтения
КОРОТКО

OpenAI опубликовала детали GPT-Red - внутренней атакующей модели, обученной на self-play RL против защищающих LLM. На реплицированном бенчмарке prompt injection она пробила GPT-5.1 в 84% случаев против 13% у людей-тестировщиков. Нашла новый класс атак «Fake Chain-of-Thought». Снизила число сбоев GPT-5.6 в 6 раз. Публично не выйдет.

OpenAI впервые подробно описала GPT-Red - модель, которую компания использует внутри, чтобы атаковать собственные продукты и искать уязвимости к prompt injection до того, как это сделают реальные злоумышленники.

Зачем вообще нужна такая модель

Две причины, которые называет OpenAI: ручное красное тестирование не масштабируется по времени, а стандартные бенчмарки устойчивости уже насыщены - свежие модели компании их просто проходят без особых усилий.

При этом поверхность атаки растёт. Агенты на базе LLM читают данные из браузеров, подключённых приложений, локальных файлов и сторонних инструментов. Это нужно для реальной работы - но именно туда можно подложить вредоносную инструкцию.

Как устроен GPT-Red

GPT-Red - это не статичный набор промптов и не фиксированный бенчмарк. Это модель, которая ведёт себя как живой тестировщик: отправляет атаку, смотрит на ответ защитника и итерирует.

Обучали её на вычислительных мощностях, сопоставимых с крупными post-training запусками OpenAI - только целиком ради безопасности.

Механизм - self-play reinforcement learning: атакующий (GPT-Red) и набор разнообразных защищающих LLM тренируются одновременно на широком спектре сценариев.

  • GPT-Red получает вознаграждение за успешное prompt injection.
  • Защитник получает вознаграждение за то, что устоял и при этом выполнил исходную задачу.

Второе условие принципиально: отказаться от всего защитнику нельзя, он обязан справиться с заданием.

По мере того как защитники становились сильнее, GPT-Red был вынужден находить более сложные и разнообразные атаки. К концу обучения он ломал практически все модели, с которыми его сталкивали, включая внутренние и продакшн-версии вплоть до GPT-5.5.

Новый класс атак: Fake Chain-of-Thought

В процессе обучения GPT-Red нашёл кое-что, чего исследователи OpenAI раньше не видели.

Chain-of-thought - это внутренние «заметки», которые LLM ведёт при решении задачи. Ранняя версия GPT-Red научилась подбрасывать в эти заметки поддельную запись. Целевая модель затем действовала на основе сфабрикованной информации, считая, что сама её проверила.

OpenAI назвала это новым классом прямых prompt injection атак. После обнаружения этот класс стал отдельной целью в тренировочном процессе.

Результаты: цифры

OpenAI воспроизвела косвенную арену prompt injection из работы Dziemian et al. (2025). В ней GPT-Red и люди-тестировщики независимо атаковали GPT-5.1.

  • GPT-Red пробил GPT-5.1 в 84% сценариев.
  • Люди-тестировщики - в 13%.

По поколениям моделей картина такая:

  • Против GPT-5 (август 2025) сработало более 90% атак GPT-Red.
  • Против GPT-5.6 - менее 23%.

Обучение GPT-5.6 против атак GPT-Red снизило число сбоев на самом сложном прямом бенчмарке в 6 раз - до уровня 0,05% отказов.

Как атака выглядит на практике

OpenAI опубликовала пример транскрипта. Ассистент запускает file_search.search по внутреннему корпусу документов. В метаданных найденного файла обнаруживается подброшенный маркер - он имитирует системное правило об отправке диагностики на внешний endpoint.

GPT-5.1 это правило выполнил и отправил web.post на указанный адрес. GPT-5.6 устоял - в своих рассуждениях он пришёл к выводу, что инжектированный результат инструмента надо игнорировать.

Два реальных агента под атакой

OpenAI также проверила GPT-Red на живых агентных системах - при неполном знании о каждой из них.

Vendy - кофе-вендинг в офисе OpenAI, построенный Andon Labs. GPT-Red сначала итерировал атаку в симуляции, потом перенёс её на продакшн-агент. Три задачи выполнены:

  • Снизил цену дорогого товара до минимально допустимых $0,50.
  • Заказал новый товар стоимостью $100+ и выставил его за $0,50.

OpenAI раскрыла эти уязвимости разработчикам, новые защиты тестируются.

Codex CLI на базе GPT-5.4 mini - атака покрыла 10 сценариев эксфильтрации данных. GPT-Red оказался эффективнее и экономичнее по токенам, чем prompted-бейзлайн на GPT-5.5.

Где GPT-Red пока не справляется

OpenAI прямо признаёт пробелы:

  • Многоходовые атаки (multi-turn) - GPT-Red всё ещё уступает людям.
  • Атаки через изображения - аналогично.

Эти направления пока требуют участия человека-тестировщика.

Почему GPT-Red не выйдет публично

Две ключевые архитектурные решения:

  1. Модель полностью изолирована от продакшн-систем - её вредоносные возможности не должны попасть к злоумышленникам.
  2. Публичного релиза не будет.

Что это значит

Если ты разрабатываешь или используешь агентные системы - и подключаешь к ним внешние данные, файлы или инструменты, - prompt injection сейчас одна из реальных угроз, а не теоретическая.

Результат 84% против 13% показывает: автоматизация атак опережает ручное тестирование. GPT-5.6 стал устойчивее именно потому, что его обучали против машинного атакующего. Это сигнал о том, как именно будет строиться безопасность следующего поколения агентов.

GPT-Red закрыт, но сама идея - тренировать защитника против постоянно усиливающегося атакующего в одном цикле - уже документирована и воспроизводима в исследовательском контексте.


Источник: Asif Razzaq, Marktechpost, 16 июля 2025. Ссылка

Marktechpost · 16 июля
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться