ОБЗОР 2026

Qwen3.8-Flash-Next — обзор 2026: 125B MoE, который запускается на 75 ГБ RAM

Новая открытая модель Alibaba Qwen: 125 млрд параметров, но всего 6 млрд активных на токен — поэтому она запускается на обычной рабочей станции с 75 ГБ памяти и без дискретной GPU. Разбираем, что подтверждено цифрами, а что пока обещание.

Локальные LLMMoE2026
Категория Локальные LLM / открытые моделиФормат Обзор + бенчмаркиДанные сняты 06.10.2026

Qwen3.8-Flash-Next — открытая мультимодальная MoE-модель Alibaba Qwen, вышедшая 26 августа 2026 года. Её особенность не в размере, а в отношении: 125 млрд суммарных параметров при 6 млрд активных на токен, поэтому модель работает с системной памяти, а не требует серверной GPU. Для России и для всех, кто упирается в цену и доступность облачных API, это редкий случай открытых весов без обязательного железа.

Как мы это проверяли
Личного прогона модели на нашей стороне нет: обзор собран из первичных источников — официальной карточки модели и технического отчёта Qwen, официального репозитория QwenLM на GitHub, репозитория квантованных весов Unsloth на Hugging Face, страницы Ollama Library и публичных данных Hugging Face API. Все числа подписаны датой снятия 06.10.2026; бенчмарки — данные самого Qwen, а не независимое измерение.

01Что такое Qwen3.8-Flash-Next

Модель позиционируется как ранний предпросмотр архитектуры Qwen4. Внутри — гибридное внимание: три из четырёх слоёв работают на Gated DeltaNet (линейное внимание), четвёртый — на Qwen Sparse Attention с обработкой микро-блоками вместо отдельных токенов. Плюс Gated Residual и отдельная таблица n-gram-эмбеддингов на 20 млн записей, которая грузится как справочник и эффективно живёт в оперативной памяти.

Практический вывод из этой конструкции один: генерация токена задействует малую долю весов, поэтому пропускная способность памяти — а не вычислительная мощность — перестаёт быть узким местом. Именно поэтому по открытым весам модель сопоставима с облачными флагманами, но запускается там, где нет кластера GPU: на маке с большим объёмом unified memory, на рабочей станции или на NVIDIA DGX Spark.

Карточка модели
РазработчикQwen Team, Alibaba Group
Параметры125B суммарно / 6B активных на токен
Доп. компоненты51B n-gram эмбеддинги + 4B MTP-модуль
Контекст262 144 токена, расширяется до 1 млн (YaRN)
Модальноститекст + изображения + видео на вход, текст на выход
ЛицензияQwen Community License 1.0 (не Apache 2.0)
Дата релиза26 августа 2026
Лицензия важнее размера
Веса Flash-Next опубликованы под Qwen Community License 1.0, а не под Apache 2.0, как у младшей Qwen3.8-27B. Если планируете коммерческое использование, читайте условия лицензии в репозитории весов до старта проекта.

02Бенчмарки: что заявляет Qwen

Ниже — числа из официальной карточки модели Qwen. Это данные производителя: они воспроизводимы по методологии из технического отчёта, но независимого аудита у них нет. Обратите внимание на колонку сравнения: в агентных задачах модель обходит Claude-Opus-4.6 (Max) по опубликованным им же числам, а на HLE и части reasoning-задач — уступает.

SWE-bench Pro: агентная разработкабаллы, данные Qwen, снято 06.10.2026
04080Qwen3.8-Flash-Next62,5Qwen3.8-27B61,7DeepSeek-V4-Flash56Qwen3.7-Plus55,8Claude-Opus-4.6 (Max)53,4
SWE-bench Pro измеряет, сколько реальных задач из репозиториев модель закрывает сама. Данные Qwen (официальная карточка модели).
БенчмаркFlash-NextQwen3.8-27BClaude-Opus-4.6 (Max)
SWE-bench Pro (агентный код)62,561,753,4
SWE-bench Multilingual81,073,877,5
DeepSWE 1.158,742,2—
LiveCodeBench v691,990,388,8
GPQA Diamond (наука)91,789,291,3
HLE (сложное рассуждение)35,930,840,0
Toolathlon Verified73,567,1—
Все значения — из официальной карточки модели Qwen. Прочерк означает, что показатель не публиковался.
Бенчмарки не заменяют тест на ваших задачах: прогоняйте модель на своих данных перед выбором.
Ключевые метрики в процентах
LiveCodeBench v6 — код91,9GPQA Diamond — наука91,7SWE-bench Multilingual81Toolathlon — вызов инструментов73,5SWE-bench Pro62,5HLE — сложное рассуждение35,9
Данные Qwen. Разброс между строками честно показывает, где модель сильна, а где ещё отстаёт.

03Три варианта: Flash-Next, 27B и Max

Название «Qwen 3.8» — это семейство, а не одна модель. Пользователи путают три разные вещи: плотную Qwen3.8-27B (её и отдаёт команда ollama pull qwen3.8), экспериментальную Flash-Next на новой архитектуре и закрыто-облачную Max на 2,4 трлн параметров. Ниже — разница по фактам.

ВариантПараметрыЛицензияКак получить
Qwen3.8-27B (плотная)27BApache 2.0Ollama, HF, GGUF
Qwen3.8-Flash-Next (MoE)125B / 6B активныхCommunity 1.0HF + GGUF (llama.cpp)
Qwen3.8-Max (облако)2,4 трлн / ~95B активныхQwen3.8-Max Licenseоблачный API, веса 2.4T-A95B
Для дома и небольшой команды практичны первые два варианта; Max — это история про серверный кластер или управляемый API.
Тарифы облачного API Qwen смотрите на официальном сайте Qwen Cloud — они меняются.
Популярность на Hugging Faceмесячные загрузки репозиториев, млн, снято 06.10.2026
0 млн4 млн8 млнQwen3.8-27B6,8 млнQwen3.8-27B GGUF (Unsloth)6,5 млнQwen3.8-Flash-Next1,5 млнFlash-Next GGUF (Unsloth)1,4 млн
Проверяемые цифры Hugging Face API: у Qwen3.8-27B — 6,76 млн загрузок и 17 056 лайков против 1,53 млн и 5 946 лайков у Flash-Next.

Младшая 27B обгоняет новинку по загрузкам не случайно: она под Apache 2.0, весит около 18 ГБ в готовом кванте и запускается даже на домашнем ноутбуке. Flash-Next интереснее по качеству агентных задач, но требует минимум 75 ГБ памяти — это уже другой класс железа.

04Сколько памяти нужно

Ключевая цифра для Flash-Next — необходимость 75 ГБ RAM или unified memory в минимальном 1-bit кванте. Здесь работает архитектурная особенность: инференс с системной памяти идёт близко по скорости к VRAM, поэтому Mac, DGX Spark и многопамятные рабочие станции подходят без компромисса. Подробные шаги запуска — в отдельном гайде по локальному запуску.

Требования к памяти по квантованиюГБ суммарно (RAM + VRAM или unified), данные Unsloth
0 ГБ200 ГБ400 ГБ1-bit75 ГБ2-bit79 ГБ3-bit90 ГБ4-bit112 ГБ5-bit163 ГБ8-bit200 ГБBF16 (полная)355 ГБ
Лёстница квантований Unsloth: чем агрессивнее сжатие, тем меньше памяти нужно. 1-bit на 75% меньше полной модели и, по данным Unsloth, сохраняет около 80% точности top-1.
Правило запаса
Для 1-bit кванта практично иметь 96 ГБ памяти, а не «ровно 75»: модели нужен запас под контекст и служебные структуры. Дополнительно слой n-gram-эмбеддингов можно вынести на SSD через mmap — это снижает требования к RAM.

05Плюсы и минусы

Плюсы
  • Агентные задачи уровня топовых облачных моделей по опубликованным бенчмаркам
  • Запускается без дискретной GPU — достаточно 75+ ГБ памяти
  • Контекст 262K, расширяемый до 1 млн токенов
  • Мультимодальность: текст, изображения и видео на входе
  • Открытые веса: можно крутить локально, без внешнего API
Минусы
  • Лицензия Community 1.0, а не Apache 2.0 — проверьте условия для коммерции
  • Минимум 75 ГБ памяти: обычный ноутбук на 16–32 ГБ не подходит
  • Слабее флагманов на HLE и части reasoning-задач
  • Экспериментальная архитектура Qwen4: совместимость рантаймов ещё догоняет
  • Качество бенчмарков — данные вендора, независимых замеров мало
Кому не подойдёт
Если у вас ноутбук с 16–32 ГБ памяти, берите плотную Qwen3.8-27B или другую модель под ваш объём. Flash-Next — вариант для рабочей станции, мака с большим unified memory или сервера; попытка запустить его на слабой машине закончится свопом и неприемлемой скоростью.

06Как получить доступ

Есть три пути: облачный API Qwen Cloud (когда не хочется железа), открытые веса на Hugging Face (когда хочется полного контроля) и готовые GGUF-сборки для llama.cpp и Ollama (самый быстрый локальный путь). Для отечественных пользователей важна именно вторая и третья опции: модель остаётся у вас, оплата зарубежного API не требуется.

Путь от весов до рабочего агента
1Выбор вариантаВес 27B под ноутбук или Flash-Next под машину с 75+ ГБ памяти2Получение весовОфициальный репозиторий Qwen на Hugging Face или GGUF-сборка Unsloth3Рантаймllama.cpp / Ollama / Unsloth Desktop поднимают OpenAI-совместимый сервер4АгентРедактор или агент подключается к локальному адресу — данные не уходят наружуКаждый шаг опционален: можно остановиться на облаке и не разворачивать ничего локально

Частые вопросы

Qwen3.8-Flash-Next — это MoE-модель?
Да. Это мультимодальная смесь экспертов: 125 млрд суммарных параметров, но лишь около 6 млрд активных на каждый токен, плюс отдельная таблица n-gram-эмбеддингов на 51 млрд и 4B-модуль MTP. Именно из-за малого числа активных параметров модель работает с системной памяти.
Можно ли запустить Qwen3.8-Flash-Next без видеокарты?
Да, в этом и её смысл. Минимальный 1-bit квант требует около 75 ГБ RAM или unified memory и не использует дискретную GPU. По данным Unsloth, разница между запуском на системной памяти и на VRAM для этой архитектуры невелика.
Какая лицензия у Qwen3.8-Flash-Next?
Qwen Community License 1.0 — это не Apache 2.0. Для коммерческого использования сверьтесь с текстом лицензии в репозитории весов: условия отличаются от более свободной Qwen3.8-27B.
Чем Flash-Next отличается от Qwen3.8-27B?
27B — плотная модель на 27 млрд параметров под Apache 2.0, весит около 18 ГБ и идёт на домашнем железе. Flash-Next — экспериментальная MoE на 125B/6B активных с контекстом 262K: сильнее в агентных задачах, но требует минимум 75 ГБ памяти.
Это лучше Claude или GPT?
В агентных задачах по опубликованным Qwen числам Flash-Next обходит Claude-Opus-4.6 (Max) на SWE-bench Pro и Multilingual, но уступает на HLE и части reasoning-тестов. Это данные производителя — проверяйте на своих задачах.

Источники и официальные ссылки

Вердикт Qantcore
8,6/ 10
Qwen3.8-Flash-Next — редкий пример открытой модели, которая по агентным бенчмаркам играет в лиге облачных флагманов, но живёт на вашем железе при 75+ ГБ памяти. Главный минус — лицензия Community 1.0 и высокий порог по памяти; главный плюс — полный контроль и независимость от зарубежных API. Если у вас рабочая станция или мак с большим объёмом памяти, это один из самых интересных запусков 2026 года; если ноутбук на 16–32 ГБ — смотрите плотную Qwen3.8-27B.
Запустить Qwen3.8-Flash-Next у себя
Пошаговый гайд: кванты, llama.cpp, Ollama и подключение агента к локальному серверу.