VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиQwen 3.8 27B: локальная модель с контекстом 262K и бенчмарками выше Claude Opus 4.6
НовостьРелизqwen

Qwen 3.8 27B: локальная модель с контекстом 262K и бенчмарками выше Claude Opus 4.6

VCL
Редакция
Vibe Coding Lab
14 августа 2026обновлено 14.08
3 мин чтения
КОРОТКО

Alibaba выпустила Qwen 3.8 27B — 27B-параметровую мультимодальную модель с лицензией Apache 2.0. По собственным бенчмаркам обходит Qwen 3.6 27B и закрытый Qwen 3.7-Plus. Работает локально на картах с 24+ ГБ VRAM, контекст 262K (с YARN — до 1M). На OpenRouter доступна уже сейчас за $0.45/$3.20 за 1M токенов.

Alibaba выкатила Qwen 3.8 27B — следующее поколение своей флагманской локальной модели с поддержкой изображений и контекстом 262K токенов.

Что за модель

Qwen 3.8 27B — 27-миллиардная мультимодальная LLM от Qwen Research Lab (Alibaba). Лицензия Apache 2.0, то есть можно использовать коммерчески без ограничений.

Модель поддерживает MTP (спекулятивное предсказание токенов) и работает с изображениями прямо из коробки. Контекст по умолчанию 262 144 токена, через YARN расширяется до 1M.

Бенчмарки

По данным самой Qwen, модель обходит предыдущий Qwen 3.6 27B и закрытый Qwen 3.7-Plus — один из сильнейших вариантов в семействе совсем недавно, в мае этого года. Некоторые бенчмарки показывают результаты выше Claude Opus 4.6.

Стоит оговориться: это пока собственные измерения Alibaba. По данным Simonwillison, независимые бенчмарки ещё не вышли — будет интересно посмотреть на внешние оценки.

Как запустить локально

Для большинства удобнее всего llama.cpp. GGUF-кванты доступны на Hugging Face:

Комфортный запуск начинается с 24+ ГБ VRAM. На RTX 3090/4090 (24 ГБ) потребуется квант поменьше и/или квантизация KV-кеша, и/или частичная выгрузка в обычную RAM.

На RTX 5090 (32 ГБ) при кванте UD-Q5_K_XL, без слоя изображений и без MTP, помещается контекст 190K токенов.

По данным Simonwillison, модель также отлично идёт через LM Studio на MacBook Pro с M5 Max (128 ГБ unified memory) и NVIDIA DGX Spark — квант Q4_K_M весит около 17 ГБ.

Как выжать больше контекста на GPU

Если памяти в обрез, есть несколько рычагов:

  • Квантизация KV-кеша (--cache-type-k, --cache-type-v) — даёт больше места, но пользователи отмечают деградацию качества в кодинге.
  • Отключить MTP (--spec-type draft-mtp убрать) — при кванте UD-Q5_K_XL освобождает ещё 46K контекста. Скорость генерации падает примерно в 2 раза.
  • Не грузить слой изображений на GPU (--no-mmproj или --no-mmproj-offload) — добавляет 19K контекста. На текстовых задачах скорость не меняется вообще. Но обработка изображений становится медленнее: запрос с одним изображением занимает 13 секунд на GPU против 76 секунд на 16-ядерном AMD Ryzen 9950X3D.

Важный нюанс: модель думает слишком долго по умолчанию

По данным Simonwillison, Qwen 3.8 27B по умолчанию работает в режиме xhigh — максимальное «рассуждение». Это приводит к забавным ситуациям: просьба нарисовать SVG-круг запускает многостраничный внутренний монолог о том, как сделать его «произведением искусства».

Просьба нарисовать пеликана на велосипеде заняла 21 минуту и потребовала 22 276 reasoning-токенов для вывода 3 223 токенов результата. С отключённым reasoning тот же запрос выполнился за 137 секунд.

Доступные режимы:

  • xhigh (по умолчанию) — для сложных задач с глубоким анализом
  • low — быстро и экономично

Для большинства повседневных задач на потребительском железе лучше сразу переключиться на low или отключить reasoning совсем.

Доступность по API

Сама Alibaba пока не добавила модель в собственный API на Model Studio. На OpenRouter модель уже есть: $0.45 за 1M входных токенов и $3.20 за 1M выходных токенов.

Для пользователей из России это актуально: OpenRouter принимает карты и работает без VPN, то есть запустить Qwen 3.8 27B через API можно прямо сейчас.

Что это значит

Если у тебя есть карта с 24+ ГБ VRAM или Mac с большим unified memory — это, пожалуй, самая интересная локальная модель прямо сейчас. Весит 17 ГБ в Q4, работает с изображениями, контекст огромный, лицензия свободная.

Главное: сразу ограничивай reasoning или отключай его совсем. Иначе модель будет «думать» дольше, чем нужно для любой обычной задачи.

Источники:

Habr · 14 августа
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться