ГАЙД · ON-PREM

Запуск Altar-1 на 4× H200: железо, vLLM и стоимость

Altar-1 весит 328 ГБ и официально рассчитана на Hopper-класс. Ниже — что реально нужно по железу, какие флаги vLLM использует вендор, как проверить запуск и сколько стоит аренда ноды.

ГайдvLLM4× H200
Тип Пошаговый гайдМодель Altar-1 (Aikido Security)Веса 328.0 ГБ, W4A16Обновлено 26.09.2026

Altar-1 — open-weight security-модель на базе GLM-5.3, сжатая до 328 ГБ через REAP-прунинг и INT4-веса. Официальная конфигурация запуска — один узел из четырёх H200 и vLLM. В гайде — требования по железу, команды и честный расчёт стоимости аренды, потому что своих четырёх H200 почти ни у кого нет.

328.0 ГБ
Веса модели
загрузка с Hugging Face одной командой
4× H200
Минимум GPU
564 ГБ VRAM, Hopper обязателен
236.0 ГБ
Свободно под KV-кэш
контекст до 131 072 токенов
от 12 960 $/мес
Аренда ноды
4× H200 круглосуточно, ставки на 26.09.2026
Это не сценарий для VPS или домашней машины
328 ГБ весов и требование Hopper (H100/H200) означают, что развернуть Altar-1 на обычном сервере или одной видеокарте нельзя — модель просто не влезет и не запустится на не-Hopper архитектурах. Гайд написан для тех, кто арендует GPU-ноду или имеет свой кластер. Если нужен локальный ассистент для кода — смотрите модели меньшего размера.

01Железо: считаем VRAM до покупки

VRAM ноды против размера весов
0ГБ300ГБ600ГБ4× H200 (141 ГБ)564ГБВеса Altar-1328ГБ4× H100 80 ГБ320ГБ
Веса — 328,0 ГБ (карточка модели). 4× H100 по 80 ГБ дают 320 ГБ — этого меньше, чем размер весов.
КонфигурацияVRAMВлезает лиКомментарий
4× H200 141 ГБ564 ГБдаофициальная конфигурация вендора; остаётся 236.0 ГБ под KV-кэш и активации
4× H100 80 ГБ320 ГБнетменьше размера весов — нужны дополнительные карты или другой класс GPU
1× H200 / 1 GPU141 ГБнетвеса не помещаются на одну карту, нужен tensor-parallel
8× RTX PRO 6000 Blackwell768 ГБтехнически дана такой сборке делали сам прунинг, но это не официальный сервинг-конфиг
Altar-1 требует Hopper: H100/H200. Только роутируемые эксперты лежат в 4 битах, остальные слои — BF16.
Куда уходит память на 4× H200
58%42%564 ГБVRAM нодыВеса модели (W4A16)328 · 58%KV-кэш и активации236 · 42%
Расчёт: 564 ГБ VRAM минус 328.0 ГБ весов = 236.0 ГБ на KV-кэш, активации и параллельные сессии.

02Шаг 1. Готовим ноду

Базовая подготовка Hopper-ноды
1
Проверяем драйвер и CUDA
нужны свежие драйверы NVIDIA и доступ к четырём GPU в одной ноде
terminalcopy
nvidia-smi -L
nvidia-smi --query-gpu=name,memory.total --format=csv
2
Ставим vLLM
официально поддерживается последняя версия; удобнее в контейнере с CUDA
terminalcopy
pip install -U vllm
3
Готовим диск
под 328 ГБ весов с запасом на распаковку и кэш — берите NVMe от 500 ГБ
terminalcopy
df -h /models
Скачивание — самая долгая часть
328 ГБ нужно не только скачать, но и распаковать: планируйте отдельный том и время. Если нода в облаке, качайте веса в тот же регион, где стоит хранилище модели, — экономия на egress и часах аренды заметная.

03Шаг 2. Скачиваем веса

terminalbash
# вариант 1: HF CLI
hf download AikidoSec/altar-1 --local-dir /models/altar-1

# вариант 2: huggingface-cli (старое имя команды)
huggingface-cli download AikidoSec/altar-1 --local-dir /models/altar-1

# вариант 3: из кода Python
from huggingface_hub import snapshot_download
snapshot_download('AikidoSec/altar-1', local_dir='/models/altar-1')

Лицензия модели наследуется от GLM-5.3 и на Hugging Face помечена как «other» — перед коммерческим использованием прочитайте условия на страницах обеих моделей. Объём: 328 ГБ хранимых весов; часть слоёв (внимание, общий эксперт, плотные слои, голова) остаётся в BF16, 4-битными являются только веса роутируемых экспертов.

04Шаг 3. Запускаем vLLM с официальными флагами

Вендор даёт одну команду сервинга — она и есть эталон. Тензорный параллелизм равен четырём (по числу GPU), --trust-remote-code нужен из-за кастомной архитектуры MoE, --max-model-len 131072 поднимает контекст до 131 072 токенов. Ядро Marlin MoE vLLM выбирает автоматически.

serving.shbash
vllm serve AikidoSec/altar-1 \
  --tensor-parallel-size 4 \
  --trust-remote-code \
  --max-model-len 131072
Ваше приложение или агентзапросы к локальному HTTP-эндпоинту, ничего не уходит наружу4 репликиvLLM OpenAI-совместимый серверпорт 8000 по умолчанию, tensor-parallel-size 4HopperAltar-1 (W4A16, 168 экспертов)4-битные веса экспертов + BF16 на внимании и головеMarlin MoE4× H200564 ГБ VRAM: 328 ГБ весов и 236 ГБ под KV-кэшOpenAI API
Если VRAM в обрез
Единственный рычаг внутри зафиксированного железа — --max-model-len: снижение контекста уменьшает KV-кэш и позволяет поднять параллелизм (или наоборот). Если карт меньше четырёх или они не Hopper, модель не запустится — менять конфигурацию бесполезно.

05Шаг 4. Проверяем, что сервер отвечает

terminalbash
# список моделей на сервере
curl -s http://localhost:8000/v1/models

# простой чат-запрос
curl -s http://localhost:8000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{"model":"AikidoSec/altar-1","messages":[{"role":"user","content":"Привет"}]}'
  • Модель отвечает 200 и в логе видно, что выбран Marlin MoE — значит 4-битные эксперты подхватились.
  • Проверьте занятую VRAM через nvidia-smi: веса должны раскладываться по всем четырём картам.
  • Замерьте пропускную способность на своём реальном промпте: у агентных задач длинный контекст, и именно он, а не голый tok/s, определяет стоимость.
  • Логируйте запросы локально — весь смысл развёртывания в том, что исходный код не покидает контур.

06Стоимость аренды: что выбрать

оптимально
Nebius AI Cloud
$4,50за GPU-час, HGX H200
  • 4× H200: $18,00/час
  • ≈ 432 $ в сутки
  • ≈ 12 960 $ в месяц (30 дней)
  • С 01.10.2026 ставка $5,40 → ≈ 15 552 $/мес
RunPod, Community Cloud
$4,59за GPU-час, H200 141 ГБ
  • 4× H200: $18,36/час
  • ≈ 441 $ в сутки
  • ≈ 13 219 $ в месяц (30 дней)
  • Оплата по факту, без обязательств
Lambda (H100)
$3,99за GPU-час, H100 SXM 80 ГБ
  • 4× H100: $15,96/час
  • VRAM всего 320 ГБ — меньше весов
  • Нужно больше четырёх карт
  • B200 SXM6 — $6,69/час
Ставки — с официальных страниц провайдеров на 26.09.2026, для одного GPU; месяц = ставка × 4 GPU × 24 ч × 30 дней.

Вывод по деньгам простой: круглосуточная нода 4× H200 обходится примерно в 12 960–15 552 $ в месяц по официальным ставкам Nebius и RunPod на 26.09.2026. Это имеет смысл только при постоянной нагрузке: если вы гоняете пентест-агента несколько раз в неделю, посчитайте почасовую аренду с выключением, а не подписку на месяц. Дешевле H100 здесь не помогают — 4 карты по 80 ГБ дают 320 ГБ при 328.0 ГБ весов.

07Когда этот гайд вам не нужен

Altar-1 — нишевый инструмент под конкретный сценарий: он-прем анализ кода и пентест там, где данные не могут покидать периметр. Для большинства задач есть варианты дешевле и проще.

  • Нужен ассистент для кода — берите хостинг проверенных кодинг-моделей или локальные 7–70B: разница в железе на два порядка.
  • Нужен security-аудит без своего железа — те же продукты Aikido (AI Code Analysis, Deep PR Review, Aikido Attack) уже работают на Altar-1 как на сервисе.
  • Нужна модель общего назначения на-преме — 328 ГБ и 4× H200 не окупятся, смотрите меньшие open-weight модели.
  • Юридический риск критичен — сначала читайте лицензию GLM-5.3, она наследуется.

Частые вопросы

Сколько GPU реально нужно для Altar-1?
Официально — 4× H200 по 141 ГБ, то есть 564 ГБ VRAM на одну ноду. Веса занимают 328.0 ГБ, остальные 236.0 ГБ остаются под KV-кэш и активации. Четыре H100 по 80 ГБ дают 320 ГБ — меньше размера весов, такая конфигурация не подходит.
Можно ли уменьшить контекст, чтобы влезло на меньшее число GPU?
Контекст влияет на KV-кэш, но не на размер весов. 328 ГБ весов должны лежать в VRAM целиком (за вычетом тех слоёв, что остались в BF16), поэтому урезание контекста на четырёх H200 даёт запас, но не позволяет перейти на две карты.
Сколько идёт скачивание и подготовка?
Зависит от канала: 328 ГБ — это только веса. Планируйте объём хранилища от 500 ГБ на NVMe и отдельное время на загрузку и распаковку; в облаке качайте модель в том же регионе, чтобы не платить за egress и лишние часы аренды.
Какие флаги vLLM использует сам вендор?
Официальная команда в карточке модели: vllm serve AikidoSec/altar-1 с флагами --tensor-parallel-size 4, --trust-remote-code и --max-model-len 131072. Ядро Marlin MoE для 4-битных экспертов vLLM выбирает автоматически, отдельный флаг не нужен.
Есть ли альтернатива, если своё железо не вытягивает?
Да: продукты Aikido (Aikido Attack, AI Code Analysis, Deep PR Review) уже работают на Altar-1 как облачный сервис, а для своих задач можно взять заведомо меньшую open-weight модель. Развёртывание на 4× H200 оправдано только требованием «данные не уходят из контура».

Источники и официальные ссылки

  • AikidoSec/altar-1 — карточка моделиhuggingface.co/AikidoSec/altar-1
    Официальная команда vLLM-сервинга, требования Hopper, состав квантования, лицензия.
  • Документация vLLMdocs.vllm.ai/en/latest/
    Установка, флаги tensor-parallel, квантованные MoE и ядро Marlin.
  • Aikido Security — анонс Altarwww.aikido.dev/blog/aikido-altar-open-weight-ai-sovereign-security
    Почему модель сделали, как считали сжатие и чем мерили качество.
  • Cerebras Research — REAP (arXiv:2510.13999)arxiv.org/abs/2510.13999
    Авторы метода прунинга экспертов, использованного в Altar-1.
  • Цены GPU-арендыwww.runpod.io/pricing
    Официальные часовые ставки; альтернативы — Nebius (nebius.com/prices) и Lambda (lambda.ai/pricing).
Нужен локальный стек с AI-агентом?
В гайдах — настройка агентов и моделей в своём контуре: шаги, конфиги и подводные камни.