Как запустить Qwen3.8-Flash-Next локально: пошаговый гайд 2026
Модель на 125 млрд параметров, которой хватает 75 ГБ оперативной памяти и не нужна дискретная видеокарта. Разбираем по шагам: сколько памяти под какой квант, как поднять сервер через llama.cpp, где тут Ollama и как подключить агента к локальному API.
ГайдЛокальный запуск2026
Уровень СреднийВремя 25–40 минутДанные сняты 06.10.2026
К концу гайда у вас будет локальный OpenAI-совместимый сервер с Qwen3.8-Flash-Next, к которому подключится редактор или агент. Ключевой вопрос здесь один — сколько у вас памяти: от этого зависит, какой квант брать и запустится ли модель вообще. Всё остальное — несколько команд.
Перед началом
Проверьте объём памяти вашей машины: на Linux — free -h, на macOS — «Об этом Mac» (столбец «Память»). Меньше 64 ГБ — этот гайд не про вашу конфигурацию: смотрите плотную Qwen3.8-27B через Ollama.
01Что понадобится
Qwen3.8-Flash-Next — мультимодальная MoE-модель на 125 млрд суммарных параметров при 6 млрд активных на токен. Из-за малого числа активных параметров генерация токена не упирается в вычислительную мощность, и модель работает с системной RAM или unified memory примерно так же, как с VRAM. Это делает её реальным кандидатом для Mac с большим объёмом памяти, рабочей станции и систем вроде NVIDIA DGX Spark.
Минимум для запуска
Памятьот 75 ГБ RAM / unified memory (1-bit квант)
Комфортный минимум96 ГБ — с запасом под контекст
GPUне обязательна (опционально ускоряет)
Дискот 80 ГБ под веса + место под кэш
ОСLinux, macOS, Windows
Рантаймllama.cpp, Unsloth Desktop, vLLM/SGLang
Почему именно 75 ГБ
Столько занимает минимальный 1-bit квант модели. Он крупнее привычных однобитных сборок, потому что таблица n-gram-эмбеддингов как справочник не сжимается так агрессивно, — зато это позволяет сохранить около 80% точности top-1 по данным Unsloth.
02Выбираем квант: лестница памяти
Первое решение — какой квант брать. Ориентируйтесь не на «покороче», а на реальный объём памяти: если взять квант под самую границу, модель будет свопиться под нагрузкой. Таблица ниже — ориентир по памяти суммарно (RAM + VRAM или unified).
Квант
Память
Кому подходит
1-bit
75 ГБ
Минимум; рабочая станция ровно в притык
2-bit
79 ГБ
Чуть больше качества при том же классе железа
3-bit
90 ГБ
Разумный компромисс для 96 ГБ машин
4-bit
112 ГБ
Лучший баланс качества и памяти
5-bit
163 ГБ
Для 192 ГБ рабочих станций
8-bit
200 ГБ
Почти полное качество, дорого по памяти
BF16 (полная)
355 ГБ
Серверный класс, для дома нереалистично
Данные Unsloth по квантованным сборкам модели. Размеры файлов в репозитории GGUF соответствуют этой лестнице.
Если памяти мало, слой n-gram-эмбеддингов можно вынести на SSD через mmap — это снижает требования к RAM ценой скорости.
Память по квантамГБ суммарно (RAM + VRAM или unified), данные Unsloth
Визуально видно, почему 4-bit — самый популярный выбор: заметный прирост качества при относительно умеренном росте требований.
Не берите квант «в притык»
Модели нужен запас под контекстное окно, кэш и служебные структуры. Для 1-bit кванта практично иметь 96 ГБ, а не 75: иначе первый же длинный контекст уведёт систему в своп.
03Способ 1: llama.cpp (работает везде)
Это базовый путь: он не зависит от операционной системы и даёт полностью локальный OpenAI-совместимый эндпоинт. Сначала собираем llama.cpp (в репозитории ggml-org/llama.cpp — более 130 тысяч звёзд и активные релизы), затем качаем GGUF-веса Unsloth и поднимаем сервер.
Четыре шага
1
Соберите llama.cpp
Клонируйте репозиторий и соберите под свою платформу. Для Apple Silicon сборка идёт с поддержкой Metal автоматически.
Локальный API отвечает по адресу http://localhost:8080/v1 — тот же формат, что у OpenAI, поэтому подходят любые совместимые клиенты.
terminalcopy
curl http://localhost:8080/v1/models
Типовая ошибка
Ключ API выдумывать не нужно: локальному серверу он не валиден, но многие клиенты требуют непустое значение. Подставляйте любой непустой плейсхолдер, а порт не выставляйте наружу без авторизации.
04Способ 2: Ollama (для 27B) и Unsloth Desktop
Важный нюанс, на котором спотыкаются: ollama pull qwen3.8 отдаёт плотную Qwen3.8-27B, а не Flash-Next. Это отличный вариант для домашнего железа — около 18 ГБ и 256K контекста, — но если вам нужна именно MoE-новинка с 6B активных параметров, локальный путь один: GGUF через llama.cpp или Unsloth Desktop.
Тег Ollama
Размер
Контекст
qwen3.8:27b
18 ГБ
256K
qwen3.8:27b-mlx
18 ГБ
256K (Apple MLX)
qwen3.8:27b-mlx-bf16
56 ГБ
256K (полная точность)
qwen3.8:27b-mtp-q4_K_M
18 ГБ
256K
qwen3.8:27b-mtp-q8_0
30 ГБ
256K
Теги страницы Ollama Library (снято 06.10.2026). Для Flash-Next тегов в Ollama нет — используйте GGUF и llama.cpp.
Список тегов обновляется: сверяйте актуальные размеры на странице модели в Ollama Library перед загрузкой.
Быстрый старт через Ollama
1
Установите Ollama
На macOS и Windows это приложение, на Linux — установочный скрипт с официального сайта.
terminalcopy
curl -fsSL https://ollama.com/install.sh | sh
2
Загрузите модель
Команда скачает подходящий квант под вашу память автоматически.
terminalcopy
ollama pull qwen3.8
3
Запустите
Ollama поднимает OpenAI-совместимый API на порту 11434.
terminalcopy
ollama run qwen3.8
# API: http://localhost:11434/v1
Unsloth Desktop
Официальный путь для Flash-Next от команды, выпустившей GGUF: приложение само определяет объём памяти, умеет выгружать слой эмбеддингов на диск и поддерживает multi-GPU. Это самый простой способ поднять именно Flash-Next.
05Параметры сэмплинга
Qwen3.8-Flash-Next — гибридная thinking-модель: у режима рассуждений и у обычного ответа разные настройки. Значения ниже — рекомендации из официальной документации модели; не полагайтесь на дефолты клиента, они дадут рваное качество.
Параметр
Thinking (рассуждение)
Instruct (ответ)
temperature
1.0
0.7
top_p
0.95
0.80
top_k
20
20
min_p
0.0
0.0
presence_penalty
0.0
1.5
repetition_penalty
1.0
1.0
Рекомендации из документации модели. Для кода и агентных задач обычно берут режим рассуждений; для чата — короткий режим.
параметры запуска (пример)bash
# режим рассуждений (по умолчанию у Flash-Next)
--temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
# короткий режим для простых задач
--temp 0.7 --top-p 0.80 --top-k 20 --presence-penalty 1.5
Контекст
Нативная длина — 262 144 токена, при необходимости расширяется до 1 млн через YaRN. Начинайте с 32K: сначала убедитесь, что модель корректно вызывает инструменты, и только потом увеличивайте окно.
06Подключаем агента
Локальный сервер отдаёт OpenAI-совместимый API, поэтому к нему подключается любой агент или редактор с поддержкой смены базового адреса. Схема одинаковая независимо от рантайма.
От памяти до агента
Из чего состоит локальный стек
Вся чувствительная часть остаётся у вас: ни веса, ни запросы не уходят на внешний сервис.
Что проверить после запуска
Чек-лист приёмки: если хотя бы один пункт не выполняется, уменьшите квант или контекст.
Частые вопросы
Как запустить Qwen 3.8 локально без мощной видеокарты?
Используйте квантованные GGUF-веса через llama.cpp или Unsloth Desktop: минимальному 1-bit кванту нужно около 75 ГБ RAM или unified memory, дискретная GPU не требуется. Для плотной Qwen3.8-27B хватит и 18 ГБ в кванте Ollama.
Сколько оперативной памяти нужно?
От 75 ГБ на минимальный 1-bit квант Flash-Next и 18 ГБ на плотную Qwen3.8-27B. Комфортный минимум для Flash-Next — 96 ГБ, чтобы остался запас под контекст. Точные размеры квантов смотрите в репозитории GGUF.
Есть ли Qwen 3.8 в Ollama?
Да, но это плотная Qwen3.8-27B: команда ollama pull qwen3.8 отдаёт модель на 27 млрд параметров (~18 ГБ, 256K контекста). Flash-Next в Ollama Library на момент публикации нет — для неё нужен GGUF и llama.cpp.
Можно ли обойтись без интернета после загрузки?
Да. После скачивания весов и установки рантайма вся работа идёт локально: запросы уходят на localhost, наружу ничего не отправляется. Это главный сценарий для работы с закрытым кодом и документами.
Какие параметры сэмплинга ставить?
Режим рассуждений — temperature 1.0, top_p 0.95, top_k 20. Короткий режим — temperature 0.7, top_p 0.80, presence_penalty 1.5. Значения официальной документации модели; зафиксируйте их в конфиге клиента, а не полагайтесь на дефолты.
Запуск упирается в один ресурс — память. Есть 96+ ГБ — берите 3-bit или 4-bit квант Flash-Next и поднимайте llama.cpp; есть 18 ГБ — начните с плотной Qwen3.8-27B через Ollama. После первого успешного ответа /v1/models зафиксируйте параметры сэмплинга в конфиге и проверьте вызов инструментов — это два пункта, которые чаще всего нарушают при первой настройке.
Подобрать модель под ваше железо
Рейтинг локальных LLM: что реально запускается на домашней машине, а что требует рабочей станции.