Qwen 3.8 27B: локальная модель с контекстом 262K и бенчмарками выше Claude Opus 4.6
Alibaba выпустила Qwen 3.8 27B — 27B-параметровую мультимодальную модель с лицензией Apache 2.0. По собственным бенчмаркам обходит Qwen 3.6 27B и закрытый Qwen 3.7-Plus. Работает локально на картах с 24+ ГБ VRAM, контекст 262K (с YARN — до 1M). На OpenRouter доступна уже сейчас за $0.45/$3.20 за 1M токенов.
Alibaba выкатила Qwen 3.8 27B — следующее поколение своей флагманской локальной модели с поддержкой изображений и контекстом 262K токенов.
Что за модель
Qwen 3.8 27B — 27-миллиардная мультимодальная LLM от Qwen Research Lab (Alibaba). Лицензия Apache 2.0, то есть можно использовать коммерчески без ограничений.
Модель поддерживает MTP (спекулятивное предсказание токенов) и работает с изображениями прямо из коробки. Контекст по умолчанию 262 144 токена, через YARN расширяется до 1M.
Бенчмарки
По данным самой Qwen, модель обходит предыдущий Qwen 3.6 27B и закрытый Qwen 3.7-Plus — один из сильнейших вариантов в семействе совсем недавно, в мае этого года. Некоторые бенчмарки показывают результаты выше Claude Opus 4.6.
Стоит оговориться: это пока собственные измерения Alibaba. По данным Simonwillison, независимые бенчмарки ещё не вышли — будет интересно посмотреть на внешние оценки.
Как запустить локально
Для большинства удобнее всего llama.cpp. GGUF-кванты доступны на Hugging Face:
- Основная сборка: unsloth/Qwen3.8-27B-GGUF
- Специальный квант для 16 ГБ VRAM: cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF
Комфортный запуск начинается с 24+ ГБ VRAM. На RTX 3090/4090 (24 ГБ) потребуется квант поменьше и/или квантизация KV-кеша, и/или частичная выгрузка в обычную RAM.
На RTX 5090 (32 ГБ) при кванте UD-Q5_K_XL, без слоя изображений и без MTP, помещается контекст 190K токенов.
По данным Simonwillison, модель также отлично идёт через LM Studio на MacBook Pro с M5 Max (128 ГБ unified memory) и NVIDIA DGX Spark — квант Q4_K_M весит около 17 ГБ.
Как выжать больше контекста на GPU
Если памяти в обрез, есть несколько рычагов:
- Квантизация KV-кеша (
--cache-type-k,--cache-type-v) — даёт больше места, но пользователи отмечают деградацию качества в кодинге. - Отключить MTP (
--spec-type draft-mtpубрать) — при кванте UD-Q5_K_XL освобождает ещё 46K контекста. Скорость генерации падает примерно в 2 раза. - Не грузить слой изображений на GPU (
--no-mmprojили--no-mmproj-offload) — добавляет 19K контекста. На текстовых задачах скорость не меняется вообще. Но обработка изображений становится медленнее: запрос с одним изображением занимает 13 секунд на GPU против 76 секунд на 16-ядерном AMD Ryzen 9950X3D.
Важный нюанс: модель думает слишком долго по умолчанию
По данным Simonwillison, Qwen 3.8 27B по умолчанию работает в режиме xhigh — максимальное «рассуждение». Это приводит к забавным ситуациям: просьба нарисовать SVG-круг запускает многостраничный внутренний монолог о том, как сделать его «произведением искусства».
Просьба нарисовать пеликана на велосипеде заняла 21 минуту и потребовала 22 276 reasoning-токенов для вывода 3 223 токенов результата. С отключённым reasoning тот же запрос выполнился за 137 секунд.
Доступные режимы:
xhigh(по умолчанию) — для сложных задач с глубоким анализомlow— быстро и экономично
Для большинства повседневных задач на потребительском железе лучше сразу переключиться на low или отключить reasoning совсем.
Доступность по API
Сама Alibaba пока не добавила модель в собственный API на Model Studio. На OpenRouter модель уже есть: $0.45 за 1M входных токенов и $3.20 за 1M выходных токенов.
Для пользователей из России это актуально: OpenRouter принимает карты и работает без VPN, то есть запустить Qwen 3.8 27B через API можно прямо сейчас.
Что это значит
Если у тебя есть карта с 24+ ГБ VRAM или Mac с большим unified memory — это, пожалуй, самая интересная локальная модель прямо сейчас. Весит 17 ГБ в Q4, работает с изображениями, контекст огромный, лицензия свободная.
Главное: сразу ограничивай reasoning или отключай его совсем. Иначе модель будет «думать» дольше, чем нужно для любой обычной задачи.
Источники: