ГАЙД 2026

Как запустить Qwen3.8-Flash-Next локально: пошаговый гайд 2026

Модель на 125 млрд параметров, которой хватает 75 ГБ оперативной памяти и не нужна дискретная видеокарта. Разбираем по шагам: сколько памяти под какой квант, как поднять сервер через llama.cpp, где тут Ollama и как подключить агента к локальному API.

ГайдЛокальный запуск2026
Уровень СреднийВремя 25–40 минутДанные сняты 06.10.2026

К концу гайда у вас будет локальный OpenAI-совместимый сервер с Qwen3.8-Flash-Next, к которому подключится редактор или агент. Ключевой вопрос здесь один — сколько у вас памяти: от этого зависит, какой квант брать и запустится ли модель вообще. Всё остальное — несколько команд.

Перед началом
Проверьте объём памяти вашей машины: на Linux — free -h, на macOS — «Об этом Mac» (столбец «Память»). Меньше 64 ГБ — этот гайд не про вашу конфигурацию: смотрите плотную Qwen3.8-27B через Ollama.

01Что понадобится

Qwen3.8-Flash-Next — мультимодальная MoE-модель на 125 млрд суммарных параметров при 6 млрд активных на токен. Из-за малого числа активных параметров генерация токена не упирается в вычислительную мощность, и модель работает с системной RAM или unified memory примерно так же, как с VRAM. Это делает её реальным кандидатом для Mac с большим объёмом памяти, рабочей станции и систем вроде NVIDIA DGX Spark.

Минимум для запуска
Памятьот 75 ГБ RAM / unified memory (1-bit квант)
Комфортный минимум96 ГБ — с запасом под контекст
GPUне обязательна (опционально ускоряет)
Дискот 80 ГБ под веса + место под кэш
ОСLinux, macOS, Windows
Рантаймllama.cpp, Unsloth Desktop, vLLM/SGLang
Почему именно 75 ГБ
Столько занимает минимальный 1-bit квант модели. Он крупнее привычных однобитных сборок, потому что таблица n-gram-эмбеддингов как справочник не сжимается так агрессивно, — зато это позволяет сохранить около 80% точности top-1 по данным Unsloth.

02Выбираем квант: лестница памяти

Первое решение — какой квант брать. Ориентируйтесь не на «покороче», а на реальный объём памяти: если взять квант под самую границу, модель будет свопиться под нагрузкой. Таблица ниже — ориентир по памяти суммарно (RAM + VRAM или unified).

КвантПамятьКому подходит
1-bit75 ГБМинимум; рабочая станция ровно в притык
2-bit79 ГБЧуть больше качества при том же классе железа
3-bit90 ГБРазумный компромисс для 96 ГБ машин
4-bit112 ГБЛучший баланс качества и памяти
5-bit163 ГБДля 192 ГБ рабочих станций
8-bit200 ГБПочти полное качество, дорого по памяти
BF16 (полная)355 ГБСерверный класс, для дома нереалистично
Данные Unsloth по квантованным сборкам модели. Размеры файлов в репозитории GGUF соответствуют этой лестнице.
Если памяти мало, слой n-gram-эмбеддингов можно вынести на SSD через mmap — это снижает требования к RAM ценой скорости.
Память по квантамГБ суммарно (RAM + VRAM или unified), данные Unsloth
0 ГБ200 ГБ400 ГБ1-bit75 ГБ2-bit79 ГБ3-bit90 ГБ4-bit112 ГБ5-bit163 ГБ8-bit200 ГБBF16355 ГБ
Визуально видно, почему 4-bit — самый популярный выбор: заметный прирост качества при относительно умеренном росте требований.
Не берите квант «в притык»
Модели нужен запас под контекстное окно, кэш и служебные структуры. Для 1-bit кванта практично иметь 96 ГБ, а не 75: иначе первый же длинный контекст уведёт систему в своп.

03Способ 1: llama.cpp (работает везде)

Это базовый путь: он не зависит от операционной системы и даёт полностью локальный OpenAI-совместимый эндпоинт. Сначала собираем llama.cpp (в репозитории ggml-org/llama.cpp — более 130 тысяч звёзд и активные релизы), затем качаем GGUF-веса Unsloth и поднимаем сервер.

Четыре шага
1
Соберите llama.cpp
Клонируйте репозиторий и соберите под свою платформу. Для Apple Silicon сборка идёт с поддержкой Metal автоматически.
terminalcopy
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release -j
2
Скачайте GGUF-веса
Берите квант по объёму памяти. Файлы разбиты на части — качайте все части выбранной папки.
terminalcopy
# пример для 4-bit кванта (папка UD-Q4_K_XL)
huggingface-cli download unsloth/Qwen3.8-Flash-Next-GGUF \
  --include "UD-Q4_K_XL/*"
3
Запустите сервер
Флаг --fit включает автоматическое распределение слоёв по доступной памяти. Контекст начните с 32K и увеличивайте после проверки.
terminalcopy
./build/bin/llama-server \
  -m ./Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf \
  --alias qwen3.8-flash-next \
  --host 0.0.0.0 --port 8080 \
  --ctx-size 32768 --jinja --fit on
4
Проверьте эндпоинт
Локальный API отвечает по адресу http://localhost:8080/v1 — тот же формат, что у OpenAI, поэтому подходят любые совместимые клиенты.
terminalcopy
curl http://localhost:8080/v1/models
Типовая ошибка
Ключ API выдумывать не нужно: локальному серверу он не валиден, но многие клиенты требуют непустое значение. Подставляйте любой непустой плейсхолдер, а порт не выставляйте наружу без авторизации.

04Способ 2: Ollama (для 27B) и Unsloth Desktop

Важный нюанс, на котором спотыкаются: ollama pull qwen3.8 отдаёт плотную Qwen3.8-27B, а не Flash-Next. Это отличный вариант для домашнего железа — около 18 ГБ и 256K контекста, — но если вам нужна именно MoE-новинка с 6B активных параметров, локальный путь один: GGUF через llama.cpp или Unsloth Desktop.

Тег OllamaРазмерКонтекст
qwen3.8:27b18 ГБ256K
qwen3.8:27b-mlx18 ГБ256K (Apple MLX)
qwen3.8:27b-mlx-bf1656 ГБ256K (полная точность)
qwen3.8:27b-mtp-q4_K_M18 ГБ256K
qwen3.8:27b-mtp-q8_030 ГБ256K
Теги страницы Ollama Library (снято 06.10.2026). Для Flash-Next тегов в Ollama нет — используйте GGUF и llama.cpp.
Список тегов обновляется: сверяйте актуальные размеры на странице модели в Ollama Library перед загрузкой.
Быстрый старт через Ollama
1
Установите Ollama
На macOS и Windows это приложение, на Linux — установочный скрипт с официального сайта.
terminalcopy
curl -fsSL https://ollama.com/install.sh | sh
2
Загрузите модель
Команда скачает подходящий квант под вашу память автоматически.
terminalcopy
ollama pull qwen3.8
3
Запустите
Ollama поднимает OpenAI-совместимый API на порту 11434.
terminalcopy
ollama run qwen3.8
# API: http://localhost:11434/v1
Unsloth Desktop
Официальный путь для Flash-Next от команды, выпустившей GGUF: приложение само определяет объём памяти, умеет выгружать слой эмбеддингов на диск и поддерживает multi-GPU. Это самый простой способ поднять именно Flash-Next.

05Параметры сэмплинга

Qwen3.8-Flash-Next — гибридная thinking-модель: у режима рассуждений и у обычного ответа разные настройки. Значения ниже — рекомендации из официальной документации модели; не полагайтесь на дефолты клиента, они дадут рваное качество.

ПараметрThinking (рассуждение)Instruct (ответ)
temperature1.00.7
top_p0.950.80
top_k2020
min_p0.00.0
presence_penalty0.01.5
repetition_penalty1.01.0
Рекомендации из документации модели. Для кода и агентных задач обычно берут режим рассуждений; для чата — короткий режим.
параметры запуска (пример)bash
# режим рассуждений (по умолчанию у Flash-Next)
--temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

# короткий режим для простых задач
--temp 0.7 --top-p 0.80 --top-k 20 --presence-penalty 1.5
Контекст
Нативная длина — 262 144 токена, при необходимости расширяется до 1 млн через YaRN. Начинайте с 32K: сначала убедитесь, что модель корректно вызывает инструменты, и только потом увеличивайте окно.

06Подключаем агента

Локальный сервер отдаёт OpenAI-совместимый API, поэтому к нему подключается любой агент или редактор с поддержкой смены базового адреса. Схема одинаковая независимо от рантайма.

От памяти до агента
1ЖелезоМашина с 75+ ГБ памяти, GPU опциональна2GGUF-весаКвант по объёму памяти из репозитория Unsloth3Рантаймllama.cpp или Ollama поднимает сервер на localhost4АгентРедактор и агент подключаются к /v1 — данные не покидают машинуОдин раз настроили эндпоинт — дальше им пользуются все инструменты
Из чего состоит локальный стек
Клиент: редактор, CLI или агентУказывает базовый адрес API на localhost — интерфейс не меняетсявы работаете тутАгентный слойПланирование, вызов инструментов, память проекта — работает поверх локального APIлогикаQwen3.8-Flash-NextМодель на 125B/6B активных параметров, запущенная из GGUF-квантамодель
Вся чувствительная часть остаётся у вас: ни веса, ни запросы не уходят на внешний сервис.
Что проверить после запуска
Модель отвечает на /v1/models100Корректно вызывает инструменты100Держит 32K контекста без свопа100Скорость приемлема для задачи80
Чек-лист приёмки: если хотя бы один пункт не выполняется, уменьшите квант или контекст.

Частые вопросы

Как запустить Qwen 3.8 локально без мощной видеокарты?
Используйте квантованные GGUF-веса через llama.cpp или Unsloth Desktop: минимальному 1-bit кванту нужно около 75 ГБ RAM или unified memory, дискретная GPU не требуется. Для плотной Qwen3.8-27B хватит и 18 ГБ в кванте Ollama.
Сколько оперативной памяти нужно?
От 75 ГБ на минимальный 1-bit квант Flash-Next и 18 ГБ на плотную Qwen3.8-27B. Комфортный минимум для Flash-Next — 96 ГБ, чтобы остался запас под контекст. Точные размеры квантов смотрите в репозитории GGUF.
Есть ли Qwen 3.8 в Ollama?
Да, но это плотная Qwen3.8-27B: команда ollama pull qwen3.8 отдаёт модель на 27 млрд параметров (~18 ГБ, 256K контекста). Flash-Next в Ollama Library на момент публикации нет — для неё нужен GGUF и llama.cpp.
Можно ли обойтись без интернета после загрузки?
Да. После скачивания весов и установки рантайма вся работа идёт локально: запросы уходят на localhost, наружу ничего не отправляется. Это главный сценарий для работы с закрытым кодом и документами.
Какие параметры сэмплинга ставить?
Режим рассуждений — temperature 1.0, top_p 0.95, top_k 20. Короткий режим — temperature 0.7, top_p 0.80, presence_penalty 1.5. Значения официальной документации модели; зафиксируйте их в конфиге клиента, а не полагайтесь на дефолты.

Источники и документация

Итог гайда
8,8/ 10
Запуск упирается в один ресурс — память. Есть 96+ ГБ — берите 3-bit или 4-bit квант Flash-Next и поднимайте llama.cpp; есть 18 ГБ — начните с плотной Qwen3.8-27B через Ollama. После первого успешного ответа /v1/models зафиксируйте параметры сэмплинга в конфиге и проверьте вызов инструментов — это два пункта, которые чаще всего нарушают при первой настройке.
Подобрать модель под ваше железо
Рейтинг локальных LLM: что реально запускается на домашней машине, а что требует рабочей станции.