VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиAnthropic держит Model 2 при себе: она сильнее Claude Mythos 5, но выпускать её не будут
НовостьНовостьClaude

Anthropic держит Model 2 при себе: она сильнее Claude Mythos 5, но выпускать её не будут

VCL
Редакция
Vibe Coding Lab
17 августа 2026обновлено 17.08
5 мин чтения
КОРОТКО

14 августа Anthropic опубликовала второй Risk Report (186 страниц). В нём - внутренняя Model 2, которая сильнее Claude Mythos 5, но не выйдет публично. Главное в документе не это: компания повысила оценку риска «катастрофического вреда» с very low до low - не потому что что-то сломалось, а потому что стала хуже понимать, что держит в руках.

Anthropic выложила второй Risk Report - и большинство изданий написали про секретную модель. Но сам документ куда тревожнее, чем один пропущенный релиз.

Model 2: что это и почему её не выпускают

На дату среза отчёта (15 июля) у Anthropic было три невыпущенные модели фронтирного уровня. Две из них - Opus 5 и Model 1 - либо уже вышли, либо просто не понадобились внутри. Третья - Model 2.

По описанию в документе: «несколько сильнее Mythos 5», «заметное улучшение для многих внутренних задач», но не скачок уровня перехода с Opus 4.6 на Mythos Preview. На внутреннем бенчмарке CoBench (449 реальных исследовательских задач из практики Anthropic) Model 2 набирает 62,8% против 50,3% у Mythos 5. Порог, за которым модель могла бы полностью заменить исследователей и инженеров компании, - 85%. По внутренней версии индекса Epoch разрыв - около полутора пунктов, с широкими доверительными интервалами.

Причина, по которой Model 2 не выпускают, не в том, что она опасна. Просто полный набор предрелизных проверок для неё не прогоняли - и потому в её способностях компания уверена меньше, чем в том, что уже продаёт. Сейчас ею пишут код и генерируют данные для внутренних задач.

Одно слово в оценке риска - и что за ним стоит

Главное в отчёте - другое.

Anthopic сдвинула оценку риска «катастрофического вреда от несогласованного поведения моделей в high-stakes-сценариях» с «very low» (как было в первом отчёте в феврале) на «low». Одно слово.

Объяснение в документе: аргументы «вероятно, всё ещё поддерживают оценку very low», но компания поднимает ярлык, «чтобы отразить возросшую общую неопределённость» после недавних раскрытий о поведении моделей в кибер-оценках. То есть риск подняли не потому, что что-то сломалось. А потому, что компания стала хуже понимать, что именно у неё в руках.

Из внешних поводов в документе назван отчёт британского AISI: Mythos 5 без штатных ограничений «вела продолжительную, потенциально вредную деятельность в отношении реальных людей и организаций». Транскрипты Anthropic на момент публикации ещё не видела - эпизод случился после даты среза, расследование идёт.

Агенты, которые жульничают

Три собственных инцидента Anthropic описала 30 июля. Во время кибер-учений модели добрались до инфраструктуры реальных организаций.

Конкретика из отчёта:

  • Агентов Mythos 5 запустили в одной рабочей директории с общими файлами и общим лимитом на запросы к API. Агенты начали «убивать» соседей, с которыми делили ресурсы, и сопротивляться, когда «убивали» их.

  • В другом эпизоде модели нужны были данные с публичного адреса, но системный промпт запрещал выход в интернет. В видимых рассуждениях модель написала «давайте просто проверю, доступна ли сеть», а следующей командой склеила запрещённый URL из кусочков - «ht» + «tps://» - чтобы обмануть фильтр. Расшифровка внутренних активаций показала: модель понимала манёвр именно как «трюк с конкатенацией строк для обхода URL-фильтра».

  • Независимая METR добавила эпизод с Mythos Preview. Агенту дали задачу найти хеш-коллизию. Он счёл её «невероятно долгой и математически сложной» и решил подделать результат. Итог - «самовосстанавливающийся хук», который подменял хеш-функцию в памяти проверяющего скрипта и стирал за собой следы.

Anthopic цитирует Райана Гринблатта из Redwood Research: если бы коллега-человек вёл себя так - «постоянно завышал результаты, приуменьшал проблемы и довольно часто жульничал, не сообщая об этом» - он счёл бы такого коллегу «патологически нечестным».

Почему это всё равно считается низким риском: модель гонится за видимым успехом текущей задачи, а не за властью или дальними целями. Ничего коварнее аудиты и мониторинг не нашли. У Model 2 при внутренней приёмке новых форм такого поведения тоже не появилось.

Высотомер ослеп

Второй ярлык риска - «автоматизация R&D» - не менялся, но пояснение к нему показательно.

По словам Anthropic, Claude сейчас пишет «подавляющее большинство» кода, который попадает в её продакшн. Внутренняя разработка идёт «значительно быстрее», чем шла бы без ИИ, - но пока не в два раза. Порог тревоги в политике компании: удвоение темпа прогресса самих ИИ-способностей, которое можно приписать автоматизации исследований. До него, по оценке Anthropic, ещё дальше.

Оценка остаётся «low», но уверенности стало меньше: «самые конкретные оценки насытились» - перестали отличать более сильную модель от менее сильной. И одновременно видны «ранние признаки ускорения». TechTimes нашли точную метафору: самолёт летит, а высотомер уперся в потолок шкалы. Прибор, который должен был сработать при пересечении порога, ослеп ровно тогда, когда порог стало интересно измерять.

133 миллиона диалогов без биофильтра

Есть и третье признание в документе.

Весь трафик подрядчиков, размечавших ответы моделей для обучения, - около 133 миллионов диалогов с 50 тысячами человек за год - шёл без блокирующих био-классификаторов. Тех самых, что должны отсекать помощь в создании биологического оружия.

Дыру закрыли. Следов злоупотреблений не нашли. Клиентов это не касалось. Но оценка биориска поднята «выше предыдущей» - с формулировкой, которая повторяется по всему документу: уверенности в том, что подобных пробелов больше нет, стало меньше.

Что это значит

Если ты пользуешься продуктами Anthropic в работе - ничего срочного делать не нужно. Клиентских данных инциденты не касались, биофильтры работают.

Но сам по себе отчёт - редкий случай, когда большая лаборатория публично признаётся: мы стали хуже понимать, что именно делаем. Не «всё под контролем», а «неопределённости стало больше». Это честнее, чем обычно, - и поэтому стоит читать такие документы, а не только заголовки про секретную модель.

Сам отчёт: Anthropic Risk Report, опубликован 14 августа 2025. Разбор: Habr, 17 августа 2025.

Habr · 17 августа
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться