Qwen 3.8 Max

Qwen 3.8 Max

💸 Официальный сайт

Попробовать Qwen 3.8 Max

Переход на официальный сайт продукта.

Перейти →

Qwen 3.8 Max — open-source гигант

Крупнейшая модель под Apache 2.0: 2.5T параметров MoE, 256K контекст, мультимодальность. Свобода коммерческого использования без ограничений.

2.5T
параметров MoE
32B
активных на токен
92.1%
MMLU-Pro
4.5
рейтинг ★

Что такое Qwen 3.8 Max

Qwen 3.8 Max — крупнейшая open-source AI-модель от Alibaba Cloud, выпущенная в июле 2026 под лицензией Apache 2.0. Архитектура Mixture-of-Experts: 2.5 триллиона параметров, из которых 32 миллиарда активны на токен. Это ответ Alibaba на Llama 4 от Meta — и по всем ключевым бенчмаркам Qwen побеждает.

Контекстное окно 256K с нативной мультимодальностью (текст + изображения). Лицензия Apache 2.0 разрешает коммерческое использование, модификацию и деплой без ограничений. Доступна через Hugging Face, ModelScope, Alibaba Cloud API и партнёрские облака: Together AI, Groq, Fireworks AI, Replicate.

Архитектура MoE — 256 экспертов

Massive Mixture-of-Experts: 256 экспертных подсетей, 8 активны на токен. Load-balanced Top-K gating с auxiliary loss. Каждый эксперт — полноценный transformer block на 8B параметров.

Qwen Attention 3.0 (QA3): Multi-Query Attention с квантованным KV-кэшем (INT4). Снижает потребление VRAM на 65% по сравнению со стандартным MHA при контексте 256K.

Multimodal Fusion via Qwen-VL Bridge: изображения → SigLIP-2 энкодер (768M) → проекция в текстовое пространство. Модульный подход: vision отдельно, текст отдельно. Проще файнтюнинг — можно дообучать только текстовую часть.

Training Recipe: 18T токенов (40% англ, 30% кит, 30% остальные), SFT на 5M инструкций, DPO на 2M пар, RLHF с reward-моделью 70B.

Ключевые возможности

1. Apache 2.0 — полная свобода

Коммерческое использование, модификация, деплой где угодно. Никаких ограничений Llama Community License. Идеально для стартапов и enterprise.

2. Бенчмарки уровня проприетарных моделей

MMLU-Pro: 92.1%. HumanEval: 91.5%. MATH-500: 94.3%. Обходит Llama 4 на 8-12 п.п. и приближается к GPT 5.6 Sol.

3. Русский язык на отличном уровне

4% тренировочного корпуса — русский. Качество на уровне GPT 5.6 Sol, выше чем у Llama 4.

4. Мультимодальность (Qwen-VL)

Изображения: диаграммы, скриншоты, фото, документы. OCR, анализ графиков, описание визуального контента.

5. Эффективный деплой

AWQ 4-bit: 4×H100 (80GB), 25-35 токенов/сек. GGUF Q4_K_M для llama.cpp. vLLM с continuous batching.

6. Function Calling из коробки

OpenAI-совместимый API. Совместимость с LangChain, CrewAI, AutoGen.

Self-hosted vs API — сравнение стоимости

КонфигурацияVRAMТокенов/секКачествоСтоимость/мес
BF16 (8×H100)640 GB45-55100%$4,800
AWQ 4-bit (4×H100)320 GB25-3591%$2,400
GGUF Q4_K_M (4×A100)320 GB20-3090%$2,200
API Alibaba Cloud30-40100%$1.50/1M tok

Порог окупаемости self-hosted: >15M токенов/день. До этого объёма выгоднее API.

✅ Плюсы

  • Apache 2.0 — полная коммерческая свобода
  • 2.5T параметров — крупнейший open-source
  • Русский язык на высоком уровне
  • Широкая экосистема (HF, vLLM, llama.cpp)
  • Эффективный инференс (4-bit на 4×H100)
  • Доступный API от $0.50/1M токенов

❌ Минусы

  • 256K контекст vs 1-2M у конкурентов
  • Мультимодальность только картинки
  • Full-precision требует 8×H100
  • Документация частично на китайском

Вердикт Qantcore

★ 4.5 / 5

Qwen 3.8 Max — идеальный выбор для тех, кому нужна open-source модель без компромиссов. Apache 2.0 открывает дорогу в enterprise без vendor lock-in. Модель особенно хороша для русскоязычных проектов и файнтюнинга на своих данных. Компромисс — контекст «всего» 256K. Для сверхдлинных документов — GPT 5.6 Sol (2M). Для максимального reasoning — Claude Opus 8. Для всего остального — Qwen 3.8 Max даёт 90% качества флагманов за 0% лицензионных отчислений.