Запуск Altar-1 на 4× H200: железо, vLLM и стоимость
Altar-1 весит 328 ГБ и официально рассчитана на Hopper-класс. Ниже — что реально нужно по железу, какие флаги vLLM использует вендор, как проверить запуск и сколько стоит аренда ноды.
ГайдvLLM4× H200
Тип Пошаговый гайдМодель Altar-1 (Aikido Security)Веса 328.0 ГБ, W4A16Обновлено 26.09.2026
Altar-1 — open-weight security-модель на базе GLM-5.3, сжатая до 328 ГБ через REAP-прунинг и INT4-веса. Официальная конфигурация запуска — один узел из четырёх H200 и vLLM. В гайде — требования по железу, команды и честный расчёт стоимости аренды, потому что своих четырёх H200 почти ни у кого нет.
328.0 ГБ
Веса модели
загрузка с Hugging Face одной командой
4× H200
Минимум GPU
564 ГБ VRAM, Hopper обязателен
236.0 ГБ
Свободно под KV-кэш
контекст до 131 072 токенов
от 12 960 $/мес
Аренда ноды
4× H200 круглосуточно, ставки на 26.09.2026
Это не сценарий для VPS или домашней машины
328 ГБ весов и требование Hopper (H100/H200) означают, что развернуть Altar-1 на обычном сервере или одной видеокарте нельзя — модель просто не влезет и не запустится на не-Hopper архитектурах. Гайд написан для тех, кто арендует GPU-ноду или имеет свой кластер. Если нужен локальный ассистент для кода — смотрите модели меньшего размера.
01Железо: считаем VRAM до покупки
VRAM ноды против размера весов
Веса — 328,0 ГБ (карточка модели). 4× H100 по 80 ГБ дают 320 ГБ — этого меньше, чем размер весов.
Конфигурация
VRAM
Влезает ли
Комментарий
4× H200 141 ГБ
564 ГБ
да
официальная конфигурация вендора; остаётся 236.0 ГБ под KV-кэш и активации
4× H100 80 ГБ
320 ГБ
нет
меньше размера весов — нужны дополнительные карты или другой класс GPU
1× H200 / 1 GPU
141 ГБ
нет
веса не помещаются на одну карту, нужен tensor-parallel
8× RTX PRO 6000 Blackwell
768 ГБ
технически да
на такой сборке делали сам прунинг, но это не официальный сервинг-конфиг
Altar-1 требует Hopper: H100/H200. Только роутируемые эксперты лежат в 4 битах, остальные слои — BF16.
Куда уходит память на 4× H200
Расчёт: 564 ГБ VRAM минус 328.0 ГБ весов = 236.0 ГБ на KV-кэш, активации и параллельные сессии.
02Шаг 1. Готовим ноду
Базовая подготовка Hopper-ноды
1
Проверяем драйвер и CUDA
нужны свежие драйверы NVIDIA и доступ к четырём GPU в одной ноде
официально поддерживается последняя версия; удобнее в контейнере с CUDA
terminalcopy
pip install -U vllm
3
Готовим диск
под 328 ГБ весов с запасом на распаковку и кэш — берите NVMe от 500 ГБ
terminalcopy
df -h /models
Скачивание — самая долгая часть
328 ГБ нужно не только скачать, но и распаковать: планируйте отдельный том и время. Если нода в облаке, качайте веса в тот же регион, где стоит хранилище модели, — экономия на egress и часах аренды заметная.
03Шаг 2. Скачиваем веса
terminalbash
# вариант 1: HF CLI
hf download AikidoSec/altar-1 --local-dir /models/altar-1
# вариант 2: huggingface-cli (старое имя команды)
huggingface-cli download AikidoSec/altar-1 --local-dir /models/altar-1
# вариант 3: из кода Python
from huggingface_hub import snapshot_download
snapshot_download('AikidoSec/altar-1', local_dir='/models/altar-1')
Лицензия модели наследуется от GLM-5.3 и на Hugging Face помечена как «other» — перед коммерческим использованием прочитайте условия на страницах обеих моделей. Объём: 328 ГБ хранимых весов; часть слоёв (внимание, общий эксперт, плотные слои, голова) остаётся в BF16, 4-битными являются только веса роутируемых экспертов.
04Шаг 3. Запускаем vLLM с официальными флагами
Вендор даёт одну команду сервинга — она и есть эталон. Тензорный параллелизм равен четырём (по числу GPU), --trust-remote-code нужен из-за кастомной архитектуры MoE, --max-model-len 131072 поднимает контекст до 131 072 токенов. Ядро Marlin MoE vLLM выбирает автоматически.
Единственный рычаг внутри зафиксированного железа — --max-model-len: снижение контекста уменьшает KV-кэш и позволяет поднять параллелизм (или наоборот). Если карт меньше четырёх или они не Hopper, модель не запустится — менять конфигурацию бесполезно.
05Шаг 4. Проверяем, что сервер отвечает
terminalbash
# список моделей на сервере
curl -s http://localhost:8000/v1/models
# простой чат-запрос
curl -s http://localhost:8000/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"model":"AikidoSec/altar-1","messages":[{"role":"user","content":"Привет"}]}'
Модель отвечает 200 и в логе видно, что выбран Marlin MoE — значит 4-битные эксперты подхватились.
Проверьте занятую VRAM через nvidia-smi: веса должны раскладываться по всем четырём картам.
Замерьте пропускную способность на своём реальном промпте: у агентных задач длинный контекст, и именно он, а не голый tok/s, определяет стоимость.
Логируйте запросы локально — весь смысл развёртывания в том, что исходный код не покидает контур.
06Стоимость аренды: что выбрать
оптимально
Nebius AI Cloud
$4,50за GPU-час, HGX H200
4× H200: $18,00/час
≈ 432 $ в сутки
≈ 12 960 $ в месяц (30 дней)
С 01.10.2026 ставка $5,40 → ≈ 15 552 $/мес
RunPod, Community Cloud
$4,59за GPU-час, H200 141 ГБ
4× H200: $18,36/час
≈ 441 $ в сутки
≈ 13 219 $ в месяц (30 дней)
Оплата по факту, без обязательств
Lambda (H100)
$3,99за GPU-час, H100 SXM 80 ГБ
4× H100: $15,96/час
VRAM всего 320 ГБ — меньше весов
Нужно больше четырёх карт
B200 SXM6 — $6,69/час
Ставки — с официальных страниц провайдеров на 26.09.2026, для одного GPU; месяц = ставка × 4 GPU × 24 ч × 30 дней.
Вывод по деньгам простой: круглосуточная нода 4× H200 обходится примерно в 12 960–15 552 $ в месяц по официальным ставкам Nebius и RunPod на 26.09.2026. Это имеет смысл только при постоянной нагрузке: если вы гоняете пентест-агента несколько раз в неделю, посчитайте почасовую аренду с выключением, а не подписку на месяц. Дешевле H100 здесь не помогают — 4 карты по 80 ГБ дают 320 ГБ при 328.0 ГБ весов.
07Когда этот гайд вам не нужен
Altar-1 — нишевый инструмент под конкретный сценарий: он-прем анализ кода и пентест там, где данные не могут покидать периметр. Для большинства задач есть варианты дешевле и проще.
Нужен ассистент для кода — берите хостинг проверенных кодинг-моделей или локальные 7–70B: разница в железе на два порядка.
Нужен security-аудит без своего железа — те же продукты Aikido (AI Code Analysis, Deep PR Review, Aikido Attack) уже работают на Altar-1 как на сервисе.
Нужна модель общего назначения на-преме — 328 ГБ и 4× H200 не окупятся, смотрите меньшие open-weight модели.
Юридический риск критичен — сначала читайте лицензию GLM-5.3, она наследуется.
Частые вопросы
Сколько GPU реально нужно для Altar-1?
Официально — 4× H200 по 141 ГБ, то есть 564 ГБ VRAM на одну ноду. Веса занимают 328.0 ГБ, остальные 236.0 ГБ остаются под KV-кэш и активации. Четыре H100 по 80 ГБ дают 320 ГБ — меньше размера весов, такая конфигурация не подходит.
Можно ли уменьшить контекст, чтобы влезло на меньшее число GPU?
Контекст влияет на KV-кэш, но не на размер весов. 328 ГБ весов должны лежать в VRAM целиком (за вычетом тех слоёв, что остались в BF16), поэтому урезание контекста на четырёх H200 даёт запас, но не позволяет перейти на две карты.
Сколько идёт скачивание и подготовка?
Зависит от канала: 328 ГБ — это только веса. Планируйте объём хранилища от 500 ГБ на NVMe и отдельное время на загрузку и распаковку; в облаке качайте модель в том же регионе, чтобы не платить за egress и лишние часы аренды.
Какие флаги vLLM использует сам вендор?
Официальная команда в карточке модели: vllm serve AikidoSec/altar-1 с флагами --tensor-parallel-size 4, --trust-remote-code и --max-model-len 131072. Ядро Marlin MoE для 4-битных экспертов vLLM выбирает автоматически, отдельный флаг не нужен.
Есть ли альтернатива, если своё железо не вытягивает?
Да: продукты Aikido (Aikido Attack, AI Code Analysis, Deep PR Review) уже работают на Altar-1 как облачный сервис, а для своих задач можно взять заведомо меньшую open-weight модель. Развёртывание на 4× H200 оправдано только требованием «данные не уходят из контура».