VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиInkling от Thinking Machines: открытая MoE-модель на 975 млрд параметров
НовостьРелизinkling

Inkling от Thinking Machines: открытая MoE-модель на 975 млрд параметров

VCL
Редакция
Vibe Coding Lab
15 июля 2026обновлено 15.07
4 мин чтения
КОРОТКО

Стартап Thinking Machines Lab (основательница - бывший CTO OpenAI Мира Мурати) выпустил Inkling: мультимодальную MoE-модель на 975 млрд параметров с открытыми весами. Работает с текстом, изображениями и аудио, контекст до 1 млн токенов. Веса уже на Hugging Face. Часть SFT-данных получена от китайской Kimi K2.5.

Thinking Machines Lab выпустила Inkling - свою первую модель спустя полтора года работы. Для американского рынка открытых весов это заметное событие: после того как линейка Llama 4 фактически закрылась, сильных открытых моделей из США почти не осталось.

Что такое Inkling

Inkling - мультимодальная модель с архитектурой «смесь экспертов» (MoE). Общее число параметров - 975 млрд, из которых на каждый токен активны 41 млрд. Поддерживает текст, изображения и аудио, контекстное окно - до 1 млн токенов, есть режим рассуждений.

Главное отличие от флагманов OpenAI, Anthropic и Google - открытые веса. Модель уже лежит на Hugging Face, её можно скачать и дообучить под свои задачи.

Архитектура: что внутри

Предварительное обучение провели на 45 трлн токенов текста, изображений, аудио и видео с использованием ускорителей NVIDIA GB300 NVL72.

Дизайн MoE напоминает DeepSeek-V3: 256 роутируемых экспертов плюс два общих, шесть активных на токен. Вместо стандартных RoPE-эмбеддингов команда выбрала относительные позиционные - по их замерам, те лучше экстраполируются на длинные последовательности.

Мультимодальность реализована без отдельных энкодеров: аудио подаётся дискретными dMel-спектрограммами, изображения - патчами 40х40 пикселей, и всё это обрабатывается одним трансформером вместе с текстом.

Регулируемое «усилие мышления»

Одна из нестандартных особенностей - настраиваемый уровень усилия при рассуждении. Не три фиксированных уровня, как обычно, а диапазон от 0.2 до 0.99.

На бенчмарке агентного кодинга Terminal Bench 2.1 Inkling достигает результата Nemotron 3 Ultra от Nvidia, потратив втрое меньше токенов. Идея в том, чтобы смотреть на всю кривую цена/качество, а не на один рекорд при максимальных настройках.

Бенчмарки: где стоит, где уступает

Сама Thinking Machines честно пишет в пресс-релизе: Inkling - «не самая производительная модель из доступных сегодня, ни закрытая, ни открытая».

Среди американских открытых моделей Inkling обходит Nemotron 3 Ultra почти по всем пунктам - от HLE и GPQA до SWEBench. Лучшим китайским моделям вроде Kimi K2.6 и GLM-5.2 уступает.

На лидерборде Design Arena (люди вслепую сравнивают сгенерированные веб-приложения) Inkling занял 9-е место с Elo 1257 - в одной группе с Claude Opus 4.6 и Gemini 3.5 Flash. После релиза организаторы отдельно отметили, что это открытая модель из США с самым высоким рейтингом в агентных задачах.

На ForecastBench модель прогнозирует на уровне Gemini 3.1 Pro и Grok 4.3.

Эпистемика: учили говорить «не знаю»

Команда делает акцент не на рекордах, а на том, что они называют эпистемикой - умении модели калибровать уверенность. Обучение с подкреплением шло на корпусе реальных вопросов с известными исходами, награда выдавалась по правилам оценки прогнозов. На коротких фактических вопросах модель поощряли отвечать «не знаю», когда уверенности нет.

Отдельно команда Cognition проверила Inkling на устойчивость к цензуре - модель показала высокую готовность говорить на неудобные темы.

Та самая деталь про китайскую модель

Самая любопытная деталь релиза - в разделе про обучение. Начальный этап SFT проводился на синтетических данных, которые сгенерировали другие открытые модели, в том числе Kimi K2.5 от китайской Moonshot AI.

Thinking Machines оговаривается, что на этот подготовительный этап пришлась малая доля вычислений, а основной объём ушёл на масштабное обучение с подкреплением. Но ирония очевидна: релиз, который пресса подаёт как возвращение США в гонку открытых весов, стартовал с помощью китайской модели - тех самых, альтернативой которым Inkling должен стать.

Побочный эффект: «стенография» в мышлении

В ходе обучения с подкреплением обнаружился неожиданный паттерн. Inkling начала выбрасывать из внутреннего монолога артикли и связки - «We need to understand» превращалось в телеграфное «We need determine» - оставаясь понятной и приходя к тем же ответам.

Похожее сжатие рассуждений команда Cognition недавно наблюдала при обучении SWE-1.7. Похоже, модели самостоятельно изобретают что-то вроде стенографии для оптимизации.

Платформа Tinker и самодообучение

Бизнес Thinking Machines строят не на чат-боте, а на кастомизации через платформу Tinker. В демо к релизу показали, как Inkling дообучает саму себя: написала код задачи, сгенерировала синтетические данные и оценки, запустила обучение через Tinker API и загрузила собственные новые веса.

Вместе с основной моделью анонсировано превью Inkling-Small - версия на 276 млрд параметров с 12 млрд активных. По словам команды, улучшенный рецепт претрейна местами позволяет ей обгонять старшую модель. Веса обещают выложить после завершения тестов.

Что это значит

Если ты работаешь с открытыми моделями - Inkling стоит попробовать. Веса уже на Hugging Face, дообучение под конкретную задачу поддерживается через Tinker.

Регулируемое усилие мышления (0.2-0.99) потенциально интересно там, где модель используется в больших объёмах: можно найти точку, где качество устраивает, а токены не сжигаются на максимуме.

Для России отдельный плюс - открытые веса можно скачать и развернуть локально или на своём облаке, без зависимости от API-доступа.

Источник: Habr, 15 июля 2025 - https://habr.com/ru/articles/1059632/

Habr · 15 июля
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться