IBM выпустила Granite 4.2: открытые reasoning-модели с агентным RL
IBM выпустила Granite 4.2 - три открытые reasoning-модели: 3B, 8B и 30B параметров, лицензия Apache 2.0. Каждая умеет переключаться между режимами thinking / low-effort / non-thinking. Модели 8B и 30B прошли агентный RL-блок: работа с кодом, терминалом и веб-поиском в реальных sandbox-средах. 30B набирает 57.00 на SWE-Bench Verified.
IBM опубликовала Granite 4.2 - семейство открытых reasoning-моделей, которое закрывает сразу несколько болей: нет лицензионных ограничений, есть выбор по размеру, и модели реально обучены работать как агенты, а не просто отвечать на вопросы.
Что вышло
Три модели - 3B, 8B и 30B параметров - все под Apache 2.0. Это значит: скачивай, дообучай, деплой в продакшен без каких-либо лицензионных ограничений.
Вместе с LLM IBM выпустила две модели Granite Speech 5.0 Turbo CTC на 470M параметров - отдельный разговор о них ниже.
Режимы мышления и зачем они нужны
Каждая из трёх моделей получила переключатель прямо в chat template: thinking (полная цепочка рассуждений), low-effort (короткий reasoning-бюджет для простых задач) и non-thinking (обычный ответ без CoT).
Это удобно: не нужно держать отдельную модель под каждый сценарий. Если вопрос простой - экономишь токены и время. Если нужна глубина - переключаешься.
Агентный RL: только для 8B и 30B
Вот где Granite 4.2 расходится с обычными instruction-following моделями. 8B и 30B прошли отдельный агентный RL-блок, в котором модель училась:
- редактировать код в реальных средах,
- управлять терминалом,
- проводить веб-поиск.
Трейнинг шёл на реальных sandbox-окружениях через OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex и Goose. 3B агентный блок не получила - только базовый RL и выравнивание. Именно это объясняет разрыв в возможностях между размерами.
По бенчмаркам 30B показала 57.00 на SWE-Bench Verified и 29.24 на Terminal-Bench 2.1.
Архитектура и данные предобучения
Все три модели - decoder-only плотные трансформеры, без MoE. Под капотом: Grouped Query Attention с 8 KV-головами, RoPE с θ = 10 000 000, SwiGLU MLP, RMSNorm, bfloat16.
Размеры:
- 3B - 40 слоёв, embedding size 2560.
- 8B - 40 слоёв, 4096.
- 30B - 64 слоя, MLP hidden size 32 768.
Контекстное окно по архитектуре - 128K токенов (131 072), а в фазе длинного контекста предобучение расширялось до 512K токенов. Предобучение - с нуля на примерно 15 триллионах токенов, включая 1 триллион токенов синтетического кода из pipeline IBM CodeAlchemy.
SFT-этап: около 7,2 млн примеров, ~100B токенов. Соотношение - 31,6% агентных и 68,4% неагентных данных, причём 69% агентного слоя - задачи по software engineering.
Пост-обучение построено как цепочка отдельных асинхронных GRPO-прогонов: RLVR, затем skill boosters, затем SWE, Terminal, Search и RLHF. Качество данных проверяли GPT-OSS-120B и Gemma 4 в роли судей, плюс SHA-256-дедупликация.
Обучение проходило на кластере NVIDIA GB200 NVL72 у CoreWeave через фреймворки NeMo-RL и NeMo-Gym.
Granite Speech 5.0 Turbo CTC
Это отдельный зверь - 470M параметров, без LLM-бэкенда вообще. Вместо него - connectionist temporal classification (CTC) для маппинга аудио в текст напрямую.
IBM сообщает RTFx-пропускную способность около 12 600 на одном H200 - против примерно 6 000 у текущих лидеров скорости на Open ASR Leaderboard. Есть WebGPU-демо.
Кому и на чём запускать
- 3B - solo-разработчики и стартапы: работает на ноутбуке через Ollama или LM Studio, доступны GGUF-кванты до Q4_K_M.
- 8B - команды на одном современном GPU.
- 30B - энтерпрайз с A100/H100, или FP8/NVFP4-сервинг через vLLM.
Регулируемые отрасли (здравоохранение, финансы, госсектор) получают дополнительный плюс - on-prem веса без облачных зависимостей.
Что это значит
Если ты строишь агентные пайплайны или просто ищешь открытую модель под локальный деплой без лицензионных вопросов - Granite 4.2 стоит попробовать. Apache 2.0 снимает юридические головные боли, агентный RL в 8B и 30B - это не маркетинг, а конкретный набор задач, на которых модель реально тренировалась.
Единственный честный вопрос - насколько 57.00 на SWE-Bench Verified конкурентоспособно относительно закрытых моделей в твоём реальном сценарии. Проверить можно только на своих задачах.
Источник: IBM Research blog, MarkTechPost, Asif Razzaq, 26 августа 2025. Код и веса - на GitHub IBM.
FAQ
Можно ли использовать Granite 4.2 коммерчески? Да, все три модели под Apache 2.0 - никаких ограничений на скачивание, дообучение и продакшен.
Granite Speech 5.0 Turbo CTC - это тоже LLM? Нет. Это CTC-модель на 470M параметров без LLM-бэкенда, заточенная под быструю транскрипцию.
Где запускать 3B без сервера? Через Ollama или LM Studio - есть готовые GGUF-кванты вплоть до Q4_K_M.