VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиIBM выпустила Granite 4.2: открытые reasoning-модели с агентным RL
НовостьРелизgranite

IBM выпустила Granite 4.2: открытые reasoning-модели с агентным RL

VCL
Редакция
Vibe Coding Lab
26 августа 2026обновлено 26.08
4 мин чтения
КОРОТКО

IBM выпустила Granite 4.2 - три открытые reasoning-модели: 3B, 8B и 30B параметров, лицензия Apache 2.0. Каждая умеет переключаться между режимами thinking / low-effort / non-thinking. Модели 8B и 30B прошли агентный RL-блок: работа с кодом, терминалом и веб-поиском в реальных sandbox-средах. 30B набирает 57.00 на SWE-Bench Verified.

IBM опубликовала Granite 4.2 - семейство открытых reasoning-моделей, которое закрывает сразу несколько болей: нет лицензионных ограничений, есть выбор по размеру, и модели реально обучены работать как агенты, а не просто отвечать на вопросы.

Что вышло

Три модели - 3B, 8B и 30B параметров - все под Apache 2.0. Это значит: скачивай, дообучай, деплой в продакшен без каких-либо лицензионных ограничений.

Вместе с LLM IBM выпустила две модели Granite Speech 5.0 Turbo CTC на 470M параметров - отдельный разговор о них ниже.

Режимы мышления и зачем они нужны

Каждая из трёх моделей получила переключатель прямо в chat template: thinking (полная цепочка рассуждений), low-effort (короткий reasoning-бюджет для простых задач) и non-thinking (обычный ответ без CoT).

Это удобно: не нужно держать отдельную модель под каждый сценарий. Если вопрос простой - экономишь токены и время. Если нужна глубина - переключаешься.

Агентный RL: только для 8B и 30B

Вот где Granite 4.2 расходится с обычными instruction-following моделями. 8B и 30B прошли отдельный агентный RL-блок, в котором модель училась:

  • редактировать код в реальных средах,
  • управлять терминалом,
  • проводить веб-поиск.

Трейнинг шёл на реальных sandbox-окружениях через OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex и Goose. 3B агентный блок не получила - только базовый RL и выравнивание. Именно это объясняет разрыв в возможностях между размерами.

По бенчмаркам 30B показала 57.00 на SWE-Bench Verified и 29.24 на Terminal-Bench 2.1.

Архитектура и данные предобучения

Все три модели - decoder-only плотные трансформеры, без MoE. Под капотом: Grouped Query Attention с 8 KV-головами, RoPE с θ = 10 000 000, SwiGLU MLP, RMSNorm, bfloat16.

Размеры:

  • 3B - 40 слоёв, embedding size 2560.
  • 8B - 40 слоёв, 4096.
  • 30B - 64 слоя, MLP hidden size 32 768.

Контекстное окно по архитектуре - 128K токенов (131 072), а в фазе длинного контекста предобучение расширялось до 512K токенов. Предобучение - с нуля на примерно 15 триллионах токенов, включая 1 триллион токенов синтетического кода из pipeline IBM CodeAlchemy.

SFT-этап: около 7,2 млн примеров, ~100B токенов. Соотношение - 31,6% агентных и 68,4% неагентных данных, причём 69% агентного слоя - задачи по software engineering.

Пост-обучение построено как цепочка отдельных асинхронных GRPO-прогонов: RLVR, затем skill boosters, затем SWE, Terminal, Search и RLHF. Качество данных проверяли GPT-OSS-120B и Gemma 4 в роли судей, плюс SHA-256-дедупликация.

Обучение проходило на кластере NVIDIA GB200 NVL72 у CoreWeave через фреймворки NeMo-RL и NeMo-Gym.

Granite Speech 5.0 Turbo CTC

Это отдельный зверь - 470M параметров, без LLM-бэкенда вообще. Вместо него - connectionist temporal classification (CTC) для маппинга аудио в текст напрямую.

IBM сообщает RTFx-пропускную способность около 12 600 на одном H200 - против примерно 6 000 у текущих лидеров скорости на Open ASR Leaderboard. Есть WebGPU-демо.

Кому и на чём запускать

  • 3B - solo-разработчики и стартапы: работает на ноутбуке через Ollama или LM Studio, доступны GGUF-кванты до Q4_K_M.
  • 8B - команды на одном современном GPU.
  • 30B - энтерпрайз с A100/H100, или FP8/NVFP4-сервинг через vLLM.

Регулируемые отрасли (здравоохранение, финансы, госсектор) получают дополнительный плюс - on-prem веса без облачных зависимостей.

Что это значит

Если ты строишь агентные пайплайны или просто ищешь открытую модель под локальный деплой без лицензионных вопросов - Granite 4.2 стоит попробовать. Apache 2.0 снимает юридические головные боли, агентный RL в 8B и 30B - это не маркетинг, а конкретный набор задач, на которых модель реально тренировалась.

Единственный честный вопрос - насколько 57.00 на SWE-Bench Verified конкурентоспособно относительно закрытых моделей в твоём реальном сценарии. Проверить можно только на своих задачах.

Источник: IBM Research blog, MarkTechPost, Asif Razzaq, 26 августа 2025. Код и веса - на GitHub IBM.


FAQ

Можно ли использовать Granite 4.2 коммерчески? Да, все три модели под Apache 2.0 - никаких ограничений на скачивание, дообучение и продакшен.

Granite Speech 5.0 Turbo CTC - это тоже LLM? Нет. Это CTC-модель на 470M параметров без LLM-бэкенда, заточенная под быструю транскрипцию.

Где запускать 3B без сервера? Через Ollama или LM Studio - есть готовые GGUF-кванты вплоть до Q4_K_M.

Marktechpost · 26 августа
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться