Inkling от Thinking Machines: открытая MoE-модель на 975 млрд параметров
Стартап Thinking Machines Lab (основательница - бывший CTO OpenAI Мира Мурати) выпустил Inkling: мультимодальную MoE-модель на 975 млрд параметров с открытыми весами. Работает с текстом, изображениями и аудио, контекст до 1 млн токенов. Веса уже на Hugging Face. Часть SFT-данных получена от китайской Kimi K2.5.
Thinking Machines Lab выпустила Inkling - свою первую модель спустя полтора года работы. Для американского рынка открытых весов это заметное событие: после того как линейка Llama 4 фактически закрылась, сильных открытых моделей из США почти не осталось.
Что такое Inkling
Inkling - мультимодальная модель с архитектурой «смесь экспертов» (MoE). Общее число параметров - 975 млрд, из которых на каждый токен активны 41 млрд. Поддерживает текст, изображения и аудио, контекстное окно - до 1 млн токенов, есть режим рассуждений.
Главное отличие от флагманов OpenAI, Anthropic и Google - открытые веса. Модель уже лежит на Hugging Face, её можно скачать и дообучить под свои задачи.
Архитектура: что внутри
Предварительное обучение провели на 45 трлн токенов текста, изображений, аудио и видео с использованием ускорителей NVIDIA GB300 NVL72.
Дизайн MoE напоминает DeepSeek-V3: 256 роутируемых экспертов плюс два общих, шесть активных на токен. Вместо стандартных RoPE-эмбеддингов команда выбрала относительные позиционные - по их замерам, те лучше экстраполируются на длинные последовательности.
Мультимодальность реализована без отдельных энкодеров: аудио подаётся дискретными dMel-спектрограммами, изображения - патчами 40х40 пикселей, и всё это обрабатывается одним трансформером вместе с текстом.
Регулируемое «усилие мышления»
Одна из нестандартных особенностей - настраиваемый уровень усилия при рассуждении. Не три фиксированных уровня, как обычно, а диапазон от 0.2 до 0.99.
На бенчмарке агентного кодинга Terminal Bench 2.1 Inkling достигает результата Nemotron 3 Ultra от Nvidia, потратив втрое меньше токенов. Идея в том, чтобы смотреть на всю кривую цена/качество, а не на один рекорд при максимальных настройках.
Бенчмарки: где стоит, где уступает
Сама Thinking Machines честно пишет в пресс-релизе: Inkling - «не самая производительная модель из доступных сегодня, ни закрытая, ни открытая».
Среди американских открытых моделей Inkling обходит Nemotron 3 Ultra почти по всем пунктам - от HLE и GPQA до SWEBench. Лучшим китайским моделям вроде Kimi K2.6 и GLM-5.2 уступает.
На лидерборде Design Arena (люди вслепую сравнивают сгенерированные веб-приложения) Inkling занял 9-е место с Elo 1257 - в одной группе с Claude Opus 4.6 и Gemini 3.5 Flash. После релиза организаторы отдельно отметили, что это открытая модель из США с самым высоким рейтингом в агентных задачах.
На ForecastBench модель прогнозирует на уровне Gemini 3.1 Pro и Grok 4.3.
Эпистемика: учили говорить «не знаю»
Команда делает акцент не на рекордах, а на том, что они называют эпистемикой - умении модели калибровать уверенность. Обучение с подкреплением шло на корпусе реальных вопросов с известными исходами, награда выдавалась по правилам оценки прогнозов. На коротких фактических вопросах модель поощряли отвечать «не знаю», когда уверенности нет.
Отдельно команда Cognition проверила Inkling на устойчивость к цензуре - модель показала высокую готовность говорить на неудобные темы.
Та самая деталь про китайскую модель
Самая любопытная деталь релиза - в разделе про обучение. Начальный этап SFT проводился на синтетических данных, которые сгенерировали другие открытые модели, в том числе Kimi K2.5 от китайской Moonshot AI.
Thinking Machines оговаривается, что на этот подготовительный этап пришлась малая доля вычислений, а основной объём ушёл на масштабное обучение с подкреплением. Но ирония очевидна: релиз, который пресса подаёт как возвращение США в гонку открытых весов, стартовал с помощью китайской модели - тех самых, альтернативой которым Inkling должен стать.
Побочный эффект: «стенография» в мышлении
В ходе обучения с подкреплением обнаружился неожиданный паттерн. Inkling начала выбрасывать из внутреннего монолога артикли и связки - «We need to understand» превращалось в телеграфное «We need determine» - оставаясь понятной и приходя к тем же ответам.
Похожее сжатие рассуждений команда Cognition недавно наблюдала при обучении SWE-1.7. Похоже, модели самостоятельно изобретают что-то вроде стенографии для оптимизации.
Платформа Tinker и самодообучение
Бизнес Thinking Machines строят не на чат-боте, а на кастомизации через платформу Tinker. В демо к релизу показали, как Inkling дообучает саму себя: написала код задачи, сгенерировала синтетические данные и оценки, запустила обучение через Tinker API и загрузила собственные новые веса.
Вместе с основной моделью анонсировано превью Inkling-Small - версия на 276 млрд параметров с 12 млрд активных. По словам команды, улучшенный рецепт претрейна местами позволяет ей обгонять старшую модель. Веса обещают выложить после завершения тестов.
Что это значит
Если ты работаешь с открытыми моделями - Inkling стоит попробовать. Веса уже на Hugging Face, дообучение под конкретную задачу поддерживается через Tinker.
Регулируемое усилие мышления (0.2-0.99) потенциально интересно там, где модель используется в больших объёмах: можно найти точку, где качество устраивает, а токены не сжигаются на максимуме.
Для России отдельный плюс - открытые веса можно скачать и развернуть локально или на своём облаке, без зависимости от API-доступа.
Источник: Habr, 15 июля 2025 - https://habr.com/ru/articles/1059632/