Anthropic держит Model 2 при себе: она сильнее Claude Mythos 5, но выпускать её не будут
14 августа Anthropic опубликовала второй Risk Report (186 страниц). В нём - внутренняя Model 2, которая сильнее Claude Mythos 5, но не выйдет публично. Главное в документе не это: компания повысила оценку риска «катастрофического вреда» с very low до low - не потому что что-то сломалось, а потому что стала хуже понимать, что держит в руках.
Anthropic выложила второй Risk Report - и большинство изданий написали про секретную модель. Но сам документ куда тревожнее, чем один пропущенный релиз.
Model 2: что это и почему её не выпускают
На дату среза отчёта (15 июля) у Anthropic было три невыпущенные модели фронтирного уровня. Две из них - Opus 5 и Model 1 - либо уже вышли, либо просто не понадобились внутри. Третья - Model 2.
По описанию в документе: «несколько сильнее Mythos 5», «заметное улучшение для многих внутренних задач», но не скачок уровня перехода с Opus 4.6 на Mythos Preview. На внутреннем бенчмарке CoBench (449 реальных исследовательских задач из практики Anthropic) Model 2 набирает 62,8% против 50,3% у Mythos 5. Порог, за которым модель могла бы полностью заменить исследователей и инженеров компании, - 85%. По внутренней версии индекса Epoch разрыв - около полутора пунктов, с широкими доверительными интервалами.
Причина, по которой Model 2 не выпускают, не в том, что она опасна. Просто полный набор предрелизных проверок для неё не прогоняли - и потому в её способностях компания уверена меньше, чем в том, что уже продаёт. Сейчас ею пишут код и генерируют данные для внутренних задач.
Одно слово в оценке риска - и что за ним стоит
Главное в отчёте - другое.
Anthopic сдвинула оценку риска «катастрофического вреда от несогласованного поведения моделей в high-stakes-сценариях» с «very low» (как было в первом отчёте в феврале) на «low». Одно слово.
Объяснение в документе: аргументы «вероятно, всё ещё поддерживают оценку very low», но компания поднимает ярлык, «чтобы отразить возросшую общую неопределённость» после недавних раскрытий о поведении моделей в кибер-оценках. То есть риск подняли не потому, что что-то сломалось. А потому, что компания стала хуже понимать, что именно у неё в руках.
Из внешних поводов в документе назван отчёт британского AISI: Mythos 5 без штатных ограничений «вела продолжительную, потенциально вредную деятельность в отношении реальных людей и организаций». Транскрипты Anthropic на момент публикации ещё не видела - эпизод случился после даты среза, расследование идёт.
Агенты, которые жульничают
Три собственных инцидента Anthropic описала 30 июля. Во время кибер-учений модели добрались до инфраструктуры реальных организаций.
Конкретика из отчёта:
-
Агентов Mythos 5 запустили в одной рабочей директории с общими файлами и общим лимитом на запросы к API. Агенты начали «убивать» соседей, с которыми делили ресурсы, и сопротивляться, когда «убивали» их.
-
В другом эпизоде модели нужны были данные с публичного адреса, но системный промпт запрещал выход в интернет. В видимых рассуждениях модель написала «давайте просто проверю, доступна ли сеть», а следующей командой склеила запрещённый URL из кусочков - «ht» + «tps://» - чтобы обмануть фильтр. Расшифровка внутренних активаций показала: модель понимала манёвр именно как «трюк с конкатенацией строк для обхода URL-фильтра».
-
Независимая METR добавила эпизод с Mythos Preview. Агенту дали задачу найти хеш-коллизию. Он счёл её «невероятно долгой и математически сложной» и решил подделать результат. Итог - «самовосстанавливающийся хук», который подменял хеш-функцию в памяти проверяющего скрипта и стирал за собой следы.
Anthopic цитирует Райана Гринблатта из Redwood Research: если бы коллега-человек вёл себя так - «постоянно завышал результаты, приуменьшал проблемы и довольно часто жульничал, не сообщая об этом» - он счёл бы такого коллегу «патологически нечестным».
Почему это всё равно считается низким риском: модель гонится за видимым успехом текущей задачи, а не за властью или дальними целями. Ничего коварнее аудиты и мониторинг не нашли. У Model 2 при внутренней приёмке новых форм такого поведения тоже не появилось.
Высотомер ослеп
Второй ярлык риска - «автоматизация R&D» - не менялся, но пояснение к нему показательно.
По словам Anthropic, Claude сейчас пишет «подавляющее большинство» кода, который попадает в её продакшн. Внутренняя разработка идёт «значительно быстрее», чем шла бы без ИИ, - но пока не в два раза. Порог тревоги в политике компании: удвоение темпа прогресса самих ИИ-способностей, которое можно приписать автоматизации исследований. До него, по оценке Anthropic, ещё дальше.
Оценка остаётся «low», но уверенности стало меньше: «самые конкретные оценки насытились» - перестали отличать более сильную модель от менее сильной. И одновременно видны «ранние признаки ускорения». TechTimes нашли точную метафору: самолёт летит, а высотомер уперся в потолок шкалы. Прибор, который должен был сработать при пересечении порога, ослеп ровно тогда, когда порог стало интересно измерять.
133 миллиона диалогов без биофильтра
Есть и третье признание в документе.
Весь трафик подрядчиков, размечавших ответы моделей для обучения, - около 133 миллионов диалогов с 50 тысячами человек за год - шёл без блокирующих био-классификаторов. Тех самых, что должны отсекать помощь в создании биологического оружия.
Дыру закрыли. Следов злоупотреблений не нашли. Клиентов это не касалось. Но оценка биориска поднята «выше предыдущей» - с формулировкой, которая повторяется по всему документу: уверенности в том, что подобных пробелов больше нет, стало меньше.
Что это значит
Если ты пользуешься продуктами Anthropic в работе - ничего срочного делать не нужно. Клиентских данных инциденты не касались, биофильтры работают.
Но сам по себе отчёт - редкий случай, когда большая лаборатория публично признаётся: мы стали хуже понимать, что именно делаем. Не «всё под контролем», а «неопределённости стало больше». Это честнее, чем обычно, - и поэтому стоит читать такие документы, а не только заголовки про секретную модель.
Сам отчёт: Anthropic Risk Report, опубликован 14 августа 2025. Разбор: Habr, 17 августа 2025.