Bonsai 27B: PrismML запустила Qwen3-27B на iPhone в 3,9 ГБ с 90% точности оригинала
PrismML выпустила Bonsai 27B - две сжатые версии Qwen3.6-27B под лицензией Apache 2.0. Троичная (5,9 ГБ, 1,71 бит/вес) подходит для ноутбуков, двоичная (3,9 ГБ, 1,125 бит/вес) - для смартфонов. На iPhone 17 Pro Max модель рассуждает, вызывает инструменты и работает со скриншотами без интернета. Точность: 95% и 90% от оригинала по 15 бенчмаркам.
PrismML показала, как 27-миллиардная модель помещается в смартфон - без потери большей части возможностей и без обращения к облаку.
Что такое Bonsai 27B
Bonsai 27B - это не новая модель с нуля. PrismML взяла открытую Qwen3.6-27B и применила экстремальное сжатие весов, сохранив архитектуру нетронутой. Получилось два варианта, оба под лицензией Apache 2.0, веса на Hugging Face.
В стандартной 16-битной точности Qwen3.6-27B занимает около 54 ГБ. Даже обычная 4-битная сборка весит порядка 18 ГБ - слишком много для большинства ноутбуков и тем более телефонов.
Два варианта сжатия
Троичная Bonsai 27B - каждый вес принимает одно из трёх значений {-1, 0, +1}. Реальный размер: 5,9 ГБ, 1,71 бит на вес (сжатие в 9,4 раза против FP16). Рассчитана на ноутбуки и недорогие видеокарты.
Двоичная Bonsai 27B - только {-1, +1}. Размер: 3,9 ГБ, 1,125 бита на вес (сжатие в 14,2 раза). Это вариант для смартфонов.
Точность при этом не разваливается благодаря общим FP16-масштабным коэффициентам: один коэффициент на каждую группу из 128 весов. Низкобитное представление применено ко всей языковой сети целиком - эмбеддингам, вниманию, MLP-слоям и выходному слою. Никаких «островков» повышенной точности, которые раздувают реальный размер (именно поэтому у обычных «2-битных» моделей в среднем выходит 2,8 бита на вес).
Из 27 миллиардов параметров модели примерно 24,8 млрд - языковые веса, 0,46 млрд - визуальный энкодер (vision tower), 2,5 млрд - эмбеддинги и LM head.
Почему именно iPhone 17 Pro Max
iPhone 17 Pro Max оснащён 12 ГБ оперативной памяти, но iOS выделяет одному приложению не более 6 ГБ. В этот бюджет должна влезть не только модель, но и KV-кэш, который растёт вместе с контекстом.
При 100 тысячах токенов с FP16-кэшем двоичная версия пикует на 11,6 ГБ, троичная - на 14,7 ГБ. Обычная Q4_K_XL-сборка требует около 25,6 ГБ.
Двоичная Bonsai 27B со своими 3,9 ГБ в этот бюджет проходит - и у неё ещё остаётся место для работы.
Что показали бенчмарки
PrismML прогнала обе версии через 15 бенчмарков в шести категориях в thinking-режиме (EvalScope + vLLM на H100 GPU).
Троичная версия сохраняет 94,6% от уровня исходной модели, двоичная - 89,5%.
Просадка неравномерная:
- Математика (GSM8K, MATH-500, AIME) пострадала минимально: 95,3 балла у оригинала против 93,4 и 91,7 у сжатых версий.
- Программирование просело умеренно: с 88,7 до 86,0 и 81,9.
- Агентные задачи и вызов инструментов (BFCL v3, TauBench) упали заметнее всего: с 80,0 до 74,0 у троичной и до 66,0 у двоичной.
Последний пункт - реальная проблема, учитывая, что именно агентные сценарии PrismML называет целевым применением.
Для сравнения: обычная 2-битная сборка того же Qwen (IQ2_XXS) на коротких тестах вроде MMLU-Redux держится на 88,93, но на AIME26 падает до 57,5, а на LiveCodeBench - до 56,4. Короткие бенчмарки маскируют провал в сложных цепочках рассуждений.
Возможности, которые сохранились
Сжатые версии не потеряли:
- Мультимодальность - визуальный энкодер поставляется отдельно, в 4 битах (HQQ).
- Контекст в 262 тысячи токенов - это реально используемый размер, потому что около 75% механизмов внимания в Qwen3.6-27B линейные.
- Вызов инструментов по стандартному OpenAI-style API (массив
tools, ответ вchoices[0].message.tool_calls). - Thinking-режим включён по умолчанию, управляется параметром
thinking_budget_tokens.
Спекулятивное декодирование тоже поддерживается: PrismML выпустила драфтер DSpark, обученный под Bonsai 27B. На H100 при глубине черновика k=4 двоичная версия достигает 143,8 токена/с (ускорение в 1,37 раза, верификация без потерь качества). На Apple Silicon драфтер по умолчанию отключён.
На iPhone 17 Pro Max двоичная версия в обычном режиме выдаёт 11 токенов в секунду - ниже порога комфортного диалога, но для фоновой обработки или нечастых запросов приемлемо.
Сырой релиз: что пока не работает
LM Studio и Unsloth на старте формат не поддерживали. Троичная версия частично требует фирменных форков llama.cpp. Для Apple-устройств нужен форк MLX от самой PrismML. Android официально не поддерживается - пользователь на Hacker News жаловался, что модель отвечала строкой восклицательных знаков.
Типичный ранний релиз с шероховатостями в экосистеме.
Apple уже смотрит
CEO PrismML Бабак Хассиби рассказал CNBC, что технологию компании уже оценивает Apple - но охарактеризовал переговоры как очень ранние. Apple системно вкладывает ресурсы в исследование моделей для мобильных устройств, так что интерес логичен.
Что это значит
Если ты работаешь с персональными данными - документами, перепиской, скриншотами - локальная модель на телефоне убирает вопрос о том, куда уходят данные. Это актуально и в роуминге, и просто там, где нет стабильного соединения.
Для разработчиков Bonsai 27B интереснее всего в троичном варианте: 5,9 ГБ укладываются в большинство ноутбуков с дискретной графикой, а уровень сохранения точности (95%) делает её рабочим инструментом для локальных агентов.
Веса и код - на Hugging Face, лицензия Apache 2.0.
Источники: Habr, 15 июля 2025, Marktechpost, 14 июля 2025