Qwen3.8-Flash-Next — обзор 2026: 125B MoE, который запускается на 75 ГБ RAM
Новая открытая модель Alibaba Qwen: 125 млрд параметров, но всего 6 млрд активных на токен — поэтому она запускается на обычной рабочей станции с 75 ГБ памяти и без дискретной GPU. Разбираем, что подтверждено цифрами, а что пока обещание.
Qwen3.8-Flash-Next — открытая мультимодальная MoE-модель Alibaba Qwen, вышедшая 26 августа 2026 года. Её особенность не в размере, а в отношении: 125 млрд суммарных параметров при 6 млрд активных на токен, поэтому модель работает с системной памяти, а не требует серверной GPU. Для России и для всех, кто упирается в цену и доступность облачных API, это редкий случай открытых весов без обязательного железа.
Как мы это проверяли
Личного прогона модели на нашей стороне нет: обзор собран из первичных источников — официальной карточки модели и технического отчёта Qwen, официального репозитория QwenLM на GitHub, репозитория квантованных весов Unsloth на Hugging Face, страницы Ollama Library и публичных данных Hugging Face API. Все числа подписаны датой снятия 06.10.2026; бенчмарки — данные самого Qwen, а не независимое измерение.
01Что такое Qwen3.8-Flash-Next
Модель позиционируется как ранний предпросмотр архитектуры Qwen4. Внутри — гибридное внимание: три из четырёх слоёв работают на Gated DeltaNet (линейное внимание), четвёртый — на Qwen Sparse Attention с обработкой микро-блоками вместо отдельных токенов. Плюс Gated Residual и отдельная таблица n-gram-эмбеддингов на 20 млн записей, которая грузится как справочник и эффективно живёт в оперативной памяти.
Практический вывод из этой конструкции один: генерация токена задействует малую долю весов, поэтому пропускная способность памяти — а не вычислительная мощность — перестаёт быть узким местом. Именно поэтому по открытым весам модель сопоставима с облачными флагманами, но запускается там, где нет кластера GPU: на маке с большим объёмом unified memory, на рабочей станции или на NVIDIA DGX Spark.
Контекст262 144 токена, расширяется до 1 млн (YaRN)
Модальноститекст + изображения + видео на вход, текст на выход
ЛицензияQwen Community License 1.0 (не Apache 2.0)
Дата релиза26 августа 2026
Лицензия важнее размера
Веса Flash-Next опубликованы под Qwen Community License 1.0, а не под Apache 2.0, как у младшей Qwen3.8-27B. Если планируете коммерческое использование, читайте условия лицензии в репозитории весов до старта проекта.
02Бенчмарки: что заявляет Qwen
Ниже — числа из официальной карточки модели Qwen. Это данные производителя: они воспроизводимы по методологии из технического отчёта, но независимого аудита у них нет. Обратите внимание на колонку сравнения: в агентных задачах модель обходит Claude-Opus-4.6 (Max) по опубликованным им же числам, а на HLE и части reasoning-задач — уступает.
SWE-bench Pro: агентная разработкабаллы, данные Qwen, снято 06.10.2026
SWE-bench Pro измеряет, сколько реальных задач из репозиториев модель закрывает сама. Данные Qwen (официальная карточка модели).
Бенчмарк
Flash-Next
Qwen3.8-27B
Claude-Opus-4.6 (Max)
SWE-bench Pro (агентный код)
62,5
61,7
53,4
SWE-bench Multilingual
81,0
73,8
77,5
DeepSWE 1.1
58,7
42,2
—
LiveCodeBench v6
91,9
90,3
88,8
GPQA Diamond (наука)
91,7
89,2
91,3
HLE (сложное рассуждение)
35,9
30,8
40,0
Toolathlon Verified
73,5
67,1
—
Все значения — из официальной карточки модели Qwen. Прочерк означает, что показатель не публиковался.
Бенчмарки не заменяют тест на ваших задачах: прогоняйте модель на своих данных перед выбором.
Ключевые метрики в процентах
Данные Qwen. Разброс между строками честно показывает, где модель сильна, а где ещё отстаёт.
03Три варианта: Flash-Next, 27B и Max
Название «Qwen 3.8» — это семейство, а не одна модель. Пользователи путают три разные вещи: плотную Qwen3.8-27B (её и отдаёт команда ollama pull qwen3.8), экспериментальную Flash-Next на новой архитектуре и закрыто-облачную Max на 2,4 трлн параметров. Ниже — разница по фактам.
Вариант
Параметры
Лицензия
Как получить
Qwen3.8-27B (плотная)
27B
Apache 2.0
Ollama, HF, GGUF
Qwen3.8-Flash-Next (MoE)
125B / 6B активных
Community 1.0
HF + GGUF (llama.cpp)
Qwen3.8-Max (облако)
2,4 трлн / ~95B активных
Qwen3.8-Max License
облачный API, веса 2.4T-A95B
Для дома и небольшой команды практичны первые два варианта; Max — это история про серверный кластер или управляемый API.
Тарифы облачного API Qwen смотрите на официальном сайте Qwen Cloud — они меняются.
Популярность на Hugging Faceмесячные загрузки репозиториев, млн, снято 06.10.2026
Проверяемые цифры Hugging Face API: у Qwen3.8-27B — 6,76 млн загрузок и 17 056 лайков против 1,53 млн и 5 946 лайков у Flash-Next.
Младшая 27B обгоняет новинку по загрузкам не случайно: она под Apache 2.0, весит около 18 ГБ в готовом кванте и запускается даже на домашнем ноутбуке. Flash-Next интереснее по качеству агентных задач, но требует минимум 75 ГБ памяти — это уже другой класс железа.
04Сколько памяти нужно
Ключевая цифра для Flash-Next — необходимость 75 ГБ RAM или unified memory в минимальном 1-bit кванте. Здесь работает архитектурная особенность: инференс с системной памяти идёт близко по скорости к VRAM, поэтому Mac, DGX Spark и многопамятные рабочие станции подходят без компромисса. Подробные шаги запуска — в отдельном гайде по локальному запуску.
Требования к памяти по квантованиюГБ суммарно (RAM + VRAM или unified), данные Unsloth
Лёстница квантований Unsloth: чем агрессивнее сжатие, тем меньше памяти нужно. 1-bit на 75% меньше полной модели и, по данным Unsloth, сохраняет около 80% точности top-1.
Правило запаса
Для 1-bit кванта практично иметь 96 ГБ памяти, а не «ровно 75»: модели нужен запас под контекст и служебные структуры. Дополнительно слой n-gram-эмбеддингов можно вынести на SSD через mmap — это снижает требования к RAM.
05Плюсы и минусы
Плюсы
Агентные задачи уровня топовых облачных моделей по опубликованным бенчмаркам
Запускается без дискретной GPU — достаточно 75+ ГБ памяти
Контекст 262K, расширяемый до 1 млн токенов
Мультимодальность: текст, изображения и видео на входе
Открытые веса: можно крутить локально, без внешнего API
Минусы
Лицензия Community 1.0, а не Apache 2.0 — проверьте условия для коммерции
Минимум 75 ГБ памяти: обычный ноутбук на 16–32 ГБ не подходит
Слабее флагманов на HLE и части reasoning-задач
Экспериментальная архитектура Qwen4: совместимость рантаймов ещё догоняет
Качество бенчмарков — данные вендора, независимых замеров мало
Кому не подойдёт
Если у вас ноутбук с 16–32 ГБ памяти, берите плотную Qwen3.8-27B или другую модель под ваш объём. Flash-Next — вариант для рабочей станции, мака с большим unified memory или сервера; попытка запустить его на слабой машине закончится свопом и неприемлемой скоростью.
06Как получить доступ
Есть три пути: облачный API Qwen Cloud (когда не хочется железа), открытые веса на Hugging Face (когда хочется полного контроля) и готовые GGUF-сборки для llama.cpp и Ollama (самый быстрый локальный путь). Для отечественных пользователей важна именно вторая и третья опции: модель остаётся у вас, оплата зарубежного API не требуется.
Да. Это мультимодальная смесь экспертов: 125 млрд суммарных параметров, но лишь около 6 млрд активных на каждый токен, плюс отдельная таблица n-gram-эмбеддингов на 51 млрд и 4B-модуль MTP. Именно из-за малого числа активных параметров модель работает с системной памяти.
Можно ли запустить Qwen3.8-Flash-Next без видеокарты?
Да, в этом и её смысл. Минимальный 1-bit квант требует около 75 ГБ RAM или unified memory и не использует дискретную GPU. По данным Unsloth, разница между запуском на системной памяти и на VRAM для этой архитектуры невелика.
Какая лицензия у Qwen3.8-Flash-Next?
Qwen Community License 1.0 — это не Apache 2.0. Для коммерческого использования сверьтесь с текстом лицензии в репозитории весов: условия отличаются от более свободной Qwen3.8-27B.
Чем Flash-Next отличается от Qwen3.8-27B?
27B — плотная модель на 27 млрд параметров под Apache 2.0, весит около 18 ГБ и идёт на домашнем железе. Flash-Next — экспериментальная MoE на 125B/6B активных с контекстом 262K: сильнее в агентных задачах, но требует минимум 75 ГБ памяти.
Это лучше Claude или GPT?
В агентных задачах по опубликованным Qwen числам Flash-Next обходит Claude-Opus-4.6 (Max) на SWE-bench Pro и Multilingual, но уступает на HLE и части reasoning-тестов. Это данные производителя — проверяйте на своих задачах.
Облачная версия Flash с расширенным контекстом; тарифы уточняйте на сайте
Вердикт Qantcore
8,6/ 10
Qwen3.8-Flash-Next — редкий пример открытой модели, которая по агентным бенчмаркам играет в лиге облачных флагманов, но живёт на вашем железе при 75+ ГБ памяти. Главный минус — лицензия Community 1.0 и высокий порог по памяти; главный плюс — полный контроль и независимость от зарубежных API. Если у вас рабочая станция или мак с большим объёмом памяти, это один из самых интересных запусков 2026 года; если ноутбук на 16–32 ГБ — смотрите плотную Qwen3.8-27B.
Запустить Qwen3.8-Flash-Next у себя
Пошаговый гайд: кванты, llama.cpp, Ollama и подключение агента к локальному серверу.