VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиBonsai 27B: PrismML запустила Qwen3-27B на iPhone в 3,9 ГБ с 90% точности оригинала
НовостьРелизqwen

Bonsai 27B: PrismML запустила Qwen3-27B на iPhone в 3,9 ГБ с 90% точности оригинала

VCL
Редакция
Vibe Coding Lab
15 июля 2026обновлено 15.07
4 мин чтения
КОРОТКО

PrismML выпустила Bonsai 27B - две сжатые версии Qwen3.6-27B под лицензией Apache 2.0. Троичная (5,9 ГБ, 1,71 бит/вес) подходит для ноутбуков, двоичная (3,9 ГБ, 1,125 бит/вес) - для смартфонов. На iPhone 17 Pro Max модель рассуждает, вызывает инструменты и работает со скриншотами без интернета. Точность: 95% и 90% от оригинала по 15 бенчмаркам.

PrismML показала, как 27-миллиардная модель помещается в смартфон - без потери большей части возможностей и без обращения к облаку.

Что такое Bonsai 27B

Bonsai 27B - это не новая модель с нуля. PrismML взяла открытую Qwen3.6-27B и применила экстремальное сжатие весов, сохранив архитектуру нетронутой. Получилось два варианта, оба под лицензией Apache 2.0, веса на Hugging Face.

В стандартной 16-битной точности Qwen3.6-27B занимает около 54 ГБ. Даже обычная 4-битная сборка весит порядка 18 ГБ - слишком много для большинства ноутбуков и тем более телефонов.

Два варианта сжатия

Троичная Bonsai 27B - каждый вес принимает одно из трёх значений {-1, 0, +1}. Реальный размер: 5,9 ГБ, 1,71 бит на вес (сжатие в 9,4 раза против FP16). Рассчитана на ноутбуки и недорогие видеокарты.

Двоичная Bonsai 27B - только {-1, +1}. Размер: 3,9 ГБ, 1,125 бита на вес (сжатие в 14,2 раза). Это вариант для смартфонов.

Точность при этом не разваливается благодаря общим FP16-масштабным коэффициентам: один коэффициент на каждую группу из 128 весов. Низкобитное представление применено ко всей языковой сети целиком - эмбеддингам, вниманию, MLP-слоям и выходному слою. Никаких «островков» повышенной точности, которые раздувают реальный размер (именно поэтому у обычных «2-битных» моделей в среднем выходит 2,8 бита на вес).

Из 27 миллиардов параметров модели примерно 24,8 млрд - языковые веса, 0,46 млрд - визуальный энкодер (vision tower), 2,5 млрд - эмбеддинги и LM head.

Почему именно iPhone 17 Pro Max

iPhone 17 Pro Max оснащён 12 ГБ оперативной памяти, но iOS выделяет одному приложению не более 6 ГБ. В этот бюджет должна влезть не только модель, но и KV-кэш, который растёт вместе с контекстом.

При 100 тысячах токенов с FP16-кэшем двоичная версия пикует на 11,6 ГБ, троичная - на 14,7 ГБ. Обычная Q4_K_XL-сборка требует около 25,6 ГБ.

Двоичная Bonsai 27B со своими 3,9 ГБ в этот бюджет проходит - и у неё ещё остаётся место для работы.

Что показали бенчмарки

PrismML прогнала обе версии через 15 бенчмарков в шести категориях в thinking-режиме (EvalScope + vLLM на H100 GPU).

Троичная версия сохраняет 94,6% от уровня исходной модели, двоичная - 89,5%.

Просадка неравномерная:

  • Математика (GSM8K, MATH-500, AIME) пострадала минимально: 95,3 балла у оригинала против 93,4 и 91,7 у сжатых версий.
  • Программирование просело умеренно: с 88,7 до 86,0 и 81,9.
  • Агентные задачи и вызов инструментов (BFCL v3, TauBench) упали заметнее всего: с 80,0 до 74,0 у троичной и до 66,0 у двоичной.

Последний пункт - реальная проблема, учитывая, что именно агентные сценарии PrismML называет целевым применением.

Для сравнения: обычная 2-битная сборка того же Qwen (IQ2_XXS) на коротких тестах вроде MMLU-Redux держится на 88,93, но на AIME26 падает до 57,5, а на LiveCodeBench - до 56,4. Короткие бенчмарки маскируют провал в сложных цепочках рассуждений.

Возможности, которые сохранились

Сжатые версии не потеряли:

  • Мультимодальность - визуальный энкодер поставляется отдельно, в 4 битах (HQQ).
  • Контекст в 262 тысячи токенов - это реально используемый размер, потому что около 75% механизмов внимания в Qwen3.6-27B линейные.
  • Вызов инструментов по стандартному OpenAI-style API (массив tools, ответ в choices[0].message.tool_calls).
  • Thinking-режим включён по умолчанию, управляется параметром thinking_budget_tokens.

Спекулятивное декодирование тоже поддерживается: PrismML выпустила драфтер DSpark, обученный под Bonsai 27B. На H100 при глубине черновика k=4 двоичная версия достигает 143,8 токена/с (ускорение в 1,37 раза, верификация без потерь качества). На Apple Silicon драфтер по умолчанию отключён.

На iPhone 17 Pro Max двоичная версия в обычном режиме выдаёт 11 токенов в секунду - ниже порога комфортного диалога, но для фоновой обработки или нечастых запросов приемлемо.

Сырой релиз: что пока не работает

LM Studio и Unsloth на старте формат не поддерживали. Троичная версия частично требует фирменных форков llama.cpp. Для Apple-устройств нужен форк MLX от самой PrismML. Android официально не поддерживается - пользователь на Hacker News жаловался, что модель отвечала строкой восклицательных знаков.

Типичный ранний релиз с шероховатостями в экосистеме.

Apple уже смотрит

CEO PrismML Бабак Хассиби рассказал CNBC, что технологию компании уже оценивает Apple - но охарактеризовал переговоры как очень ранние. Apple системно вкладывает ресурсы в исследование моделей для мобильных устройств, так что интерес логичен.

Что это значит

Если ты работаешь с персональными данными - документами, перепиской, скриншотами - локальная модель на телефоне убирает вопрос о том, куда уходят данные. Это актуально и в роуминге, и просто там, где нет стабильного соединения.

Для разработчиков Bonsai 27B интереснее всего в троичном варианте: 5,9 ГБ укладываются в большинство ноутбуков с дискретной графикой, а уровень сохранения точности (95%) делает её рабочим инструментом для локальных агентов.

Веса и код - на Hugging Face, лицензия Apache 2.0.

Источники: Habr, 15 июля 2025, Marktechpost, 14 июля 2025

Habr · 15 июля
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться