ОБЗОР 2026

Altar-1 — open-weight модель Aikido для кибербезопасности (2026)

Altar-1 — это не новая фронтирная модель, а инженерный ответ на простой вопрос: как увезти security-модель уровня GLM-5.3 внутрь своего периметра. Aikido срезала 34% экспертов и 4 бита точности — и получила 328 ГБ весов на одной ноде из четырёх H200.

Security-моделиOpen-weightGLM-5.3
Категория Open-weight security-модельБазовая модель GLM-5.3 (Z.AI)Разработчик Aikido SecurityОбновлено 26.09.2026

Aikido Security выложила Altar-1 — свою первую открытую модель весов, предназначенную для defensive security: анализа кода, поиска уязвимостей и автономного пентеста. В основе — GLM-5.3 от Z.AI, из которой удалили 88 экспертов из 256 и оставили 4-битные веса. Результат: 328 ГБ вместо 1,51 ТБ и запуск на одном узле из четырёх H200 вместо серверной стойки.

504 млрд
Параметров
по карточке модели; safetensors-индекс — 500,8 млрд
328 ГБ
Весов на диске
W4A16 после прунинга (−78.2% к BF16)
168 из 256
Экспертов сохранено
удалено 88 (34.4%)
4× H200
Железо для сервинга
Hopper, vLLM, контекст до 131 072 токенов

01Что такое Altar-1

Altar-1 — специализированная модель для кибербезопасности, а не универсальный чат-ассистент. Aikido позиционирует её как «мозг» для Aikido Machine — автономного пентест-апплаенса, который целиком живёт в инфраструктуре заказчика, включая полностью изолированные (air-gapped) контуры. Смысл в том, чтобы исходный код, внутренняя документация и нераскрытые находки не покидали сеть организации: для банка с требованием data residency, клиники с жёсткими правилами обработки данных или промышленного оператора без маршрута в интернет это не компромисс, который им разрешено делать.

Модель калибровали на трейсах собственного пентест-харнесса — это код, вызовы инструментов и ответы агентов, которые отрабатывают полный пентест. Данные клиентов при этом не использовались. Дополнительно в калибровку добавили многоязычные тексты (Wikipedia), чтобы прунинг не отнял у модели способность читать документацию и бизнес-правила на французском, нидерландском и других языках.

Прунинг выполнил 0xSero на восьми RTX PRO 6000 Blackwell, базой послужил уже квантованный чекпойнт cyankiwi/GLM-5.3-AWQ-INT4. Лицензия наследуется от GLM-5.3, то есть это «other», а не Apache/MIT — перед промышленным использованием условия надо прочитать. По состоянию на 26.09.2026 карточка модели собрала 176 реакций и 1 536 скачиваний.

Кому это интересно
Тем, кто оценивает «суверенный AI» для безопасности: модель можно скачать, положить в свой контур и не отправлять контекст в чужой inference. Если же нужен просто API для ревью кода, дешевле взять хостинг у вендора — 328 ГБ весов на своих картах почти никогда не окупаются.

02Сжатие в три шага: 1,51 ТБ → 488 ГБ → 328 ГБ

Размер весов на диске
0ГБ1 000ГБ2 000ГБGLM-5.3, BF16 (16 бит)1 506,7ГБGLM-5.3, AWQ INT4488,2ГБAltar-1, pruned W4A16328ГБ
Источник: анонс Aikido Security (21.09.2026). Указан объём хранимых весов, а не требуемая VRAM.
ЧекпойнтВесаЧто сделалиКто
GLM-5.3, BF161506.7 ГБисходная модель Z.AI, 8 экспертов из 256 на токенZ.AI
GLM-5.3, AWQ INT4488.2 ГБквантование весов экспертов до 4 бит (активации 16 бит)cyankiwi
Altar-1, W4A16328.0 ГБудалено 88 из 256 экспертов (REAP), без дообучения0xSero × Aikido
Прунинг снял ещё 160.2 ГБ к уже квантованному родителю — это 32.8%.

Важная деталь: сначала квантование, потом прунинг. Базой был AWQ INT4-чекпойнт, а не полная BF16-модель. 4-битными стали только веса роутируемых экспертов; внимание, общий (shared) эксперт, плотные слои и голова остались в BF16. Роутер при этом не тронут: он по-прежнему выбирает 8 экспертов на токен, только из банка в 168, а не в 256 — активных параметров на токен остаётся около 40 млрд, столько же, сколько у непруненного родителя.

03Почему REAP, а не просто «выкинем редких экспертов»

Техника называется REAP (Router-weighted Expert Activation Pruning), её предложили исследователи Cerebras. Идея в том, что «частота выбора» эксперта — плохой критерий: эксперт-специалист по редкому языку или по структурированному выводу выбирается редко, но именно он отвечает за свой класс задач. REAP оценивает вклад эксперта как произведение веса роутера и нормы его активаций — то есть считает, сколько эксперт реально приносит на репрезентативных входах, а не как часто его дёргают.

1Калибровка на трейсахпентеставнутренний харнесс Aikidoпрогоняет полный пентест: код,вызовы инструментов, ответы…2Оценка вклада каждогоэкспертаREAP считает вес роутера × нормуактивации и агрегирует оценки подоменам, а не по среднему3Удаление 88 экспертов из256модель остаётся с 168 экспертамина слой, дообучения нет — толькопересборка чекпойнтаУдаление весов — механическая операция; вся сложность в том, каких экспертов оставить.

В карточке модели Aikido отдельно подчёркивает агрегацию по доменам: эксперты оцениваются по наибольшей доле в работе конкретного домена (код, редкие языки, структурированный вывод), а не по глобальной средней частоте. Иначе специалисты редких доменов вылетают первыми. Публичная fidelity-студия на датасете 0xSero/glm-5.3-reap-fidelity-study показывает, что модели с одинаковым числом оставленных экспертов могут заметно отличаться по близости к родителю — size сам по себе ничего не решает.

Метрика близости — KL-дивергенция к полной BF16-модели: 0,506 нат (панель из 25 промптов, полный словарь 154 тыс. токенов). Для сравнения, EXL3-сборка того же среза экспертов даёт 0,511 — при такой битности формат квантования почти не влияет на результат.

04Что модель потеряла: внутренний CVE-бенчмарк

Aikido прогнала Altar-1 через свой внутренний бенчмарк: 32 известные уязвимости в 30 репозиториях, три прогона на кейс. Метрика — recall, то есть доля найденных уязвимостей за один прогон, плюс покрытие: сколько уязвимостей модель нашла хотя бы в одном из трёх прогонов.

Средний recall на CVE-бенчмарке Aikido
0%40%80%Altar-1 (328 ГБ)60,4%GLM-5.3 AWQ INT4 (488 ГБ)61,5%GLM-5.3 BF16 (1 506,7 ГБ)65,6%
32 уязвимости, 30 репозиториев, 3 прогона на кейс. Данные вендора (анонс от 21.09.2026).
МодельВесаСредний recallПокрытие (из 32)Железо
Altar-1328.0 ГБ60.4%23 уязвимостей4× H200
GLM-5.3, AWQ INT4488.2 ГБ61.5%23 уязвимостибольше карт
GLM-5.3, BF161506.7 ГБ65.6%25 уязвимостейстойка GPU
Altar-1 отстаёт от родителя на 5.2 п.п. среднего recall, но сохраняет 92% его покрытия при 32.8% меньшем размере.

Относительно уже квантованного родителя (AWQ INT4) потеря почти незаметна: 60,4% против 61,5% среднего recall, и то же покрытие в 23 уязвимости. Основную цену модель заплатила не за прунинг, а за само 4-битное квантование: полная BF16-модель вытягивает 65,6% и 25 из 32.

Границы бенчмарка
Речь про целевой поиск известных CVE внутри пайплайна, где окружающие этапы выполняют другие модели. Это не «слепой» аудит произвольной кодовой базы, не эксплуатация найденного и не оценка этапа предложения патча. Никаких сторонних независимых замеров Altar-1 на 26.09.2026 нет — все цифры в этом разделе принадлежат вендору.
Проверка на продакшене
Aikido сообщает, что сразу после оценок выкатила Altar-1 на свой парк Aikido Machine, и модель нашла валидную уязвимость критической severity во время клиентского пентеста продуктивной системы.

05Где это работает: агенты, на-преме, air-gap

Смысл прунинга в security-контексте — не только диск. Агентные задачи держат в памяти модель и растущий контекст расследования: чем длиннее сессия и чем больше параллельных агентов, тем сильнее они конкурируют за одно и то же место на GPU. Меньший чекпойнт — это свободное место под KV-кэш и под самих агентов.

Aikido Machine / внутренние продуктыавтономный пентест, Code Security Audit, Deep PR Review4× H200Altar-1 (W4A16, REAP-прунинг)168 из 256 экспертов, 8 на токен, ~40 млрд активных параметровvLLMvLLM + Marlin MoEтензорный параллелизм 4, контекст до 131 072 токенов328 ГБЖелезо заказчикаодин узел 4× H200, Hopper; возможен полностью изолированный контур168 экспертов
  • On-prem аудит кода — исходники и находки не уходят третьей стороне: ключевое требование для банков, медтеха и госсектора.
  • Air-gapped пентест — модель можно привезти на носителе в контур без маршрута в интернет.
  • Длинные агентные расследования — экономия памяти даёт запас под контекст и параллельные сессии.
  • Не подходит — как локальная модель «на каждый день» на одной-двух GPU: 328 ГБ весов и требование Hopper делают это бессмысленным.

06Сколько стоит inference на 4× H200

Своих четырёх H200 у большинства команд нет, поэтому считаем аренду. Ниже — официальные часовые ставки провайдеров на 26.09.2026 для одного GPU; умножаем на четыре и на 24 часа. Цены меняются (у Nebius с 1 октября 2026 — $5,40/час), поэтому перед расчётом сверяйтесь с сайтом провайдера.

ПровайдерGPU$/GPU-час4× GPU, $/час≈ $/месяц (30 дней)
RunPod, Community CloudH200 141 ГБ4,5918,3613 219
Nebius AI CloudHGX H2004,5018,0012 960
Nebius AI Cloud (с 01.10.2026)HGX H2005,4021,6015 552
LambdaH100 SXM 80 ГБ3,9915,96не влезает: 320 ГБ < 328 ГБ
Расчёт линейный: ставка × 4 GPU × 24 ч × 30 дней. Резерв и скидки за обязательства провайдеры считают отдельно.

Итого круглосуточная нода из 4× H200 — примерно 12 960–15 552 в месяц в зависимости от провайдера и даты. Для сравнения: столько же стоит аренда четырёх H100 ($15,96/час), но 4× H100 по 80 ГБ дают всего 320 ГБ VRAM — меньше, чем 328.0 ГБ весов, поэтому конфигурация из четырёх таких карт модель не обслуживает. По официальной карточке нужен именно Hopper-класс с 141 ГБ на карту: 564 ГБ суммарно, из них 236.0 ГБ остаются под KV-кэш и активации.

07Плюсы и минусы

Сильные стороны
  • Открытые веса: модель можно запустить в своём контуре, включая полностью изолированный
  • 78.2% меньше весов, чем у родителя в BF16, при сохранении 92% покрытия уязвимостей
  • Специализация под security: калибровка на реальных трейсах пентеста, а не на общем корпусе
  • Сервится на одной ноде 4× H200 через стандартный vLLM, Marlin MoE выбирается автоматически
  • Честно опубликованные границы бенчмарка и отдельная fidelity-студия по прунингу
Ограничения
  • Лицензия наследуется от GLM-5.3 («other») — не Apache-подобная, читать условия перед внедрением
  • 4× H200 и 328 ГБ весов: аренда от 13 тыс. $ в месяц, домашний или обычный VPS-сценарий исключён
  • Все метрики качества — внутренние, от самого вендора; независимых замеров нет
  • Модель заточена под defensive security: как универсальный ассистент она смысла не имеет
  • Это не новый фронтир, а сжатие чужой модели — потолок качества ограничен GLM-5.3

Частые вопросы

Что такое Altar-1 простыми словами?
Это открытая модель весов от Aikido Security для задач кибербезопасности: анализ кода, поиск уязвимостей, автономный пентест. Технически — GLM-5.3 от Z.AI, у которой удалили 34% MoE-экспертов и оставили 4-битные веса. Результат весит 328 ГБ вместо 1,51 ТБ и запускается на одном узле из четырёх H200.
Можно ли запустить Altar-1 на обычной машине или VPS?
Нет. Нужны веса в 328 ГБ и Hopper-класс GPU: официальная конфигурация — 4× H200 по 141 ГБ суммарно 564 ГБ VRAM. Четыре H100 по 80 ГБ дают 320 ГБ, то есть меньше размера весов. Для персональных сценариев имеет смысл смотреть квантованные модели поменьше или API.
Altar-1 сильно хуже исходной GLM-5.3?
По внутреннему бенчмарку Aikido — на 5,2 п.п. среднего recall (60,4% против 65,6%) при сохранении 92% покрытия уязвимостей. Относительно же 4-битного родителя разрыв минимален: 60,4% против 61,5%, покрытие идентичное. То есть основная потеря идёт от квантования, а не от прунинга экспертов.
REAP — это дообучение?
Нет. REAP (Router-weighted Expert Activation Pruning) только выбирает, каких экспертов удалить: он оценивает вклад эксперта как вес роутера × норму активации на калибровочных данных. Дообучения и новых навыков нет — модель пересобирается из уже квантованного чекпойнта без обучения.
Сколько стоит держать Altar-1 в проде?
Считайте по аренде GPU: 4× H200 — это примерно $18,00–$21,60 в час в зависимости от провайдера и даты, то есть от 12 960 до 15 552 $ в месяц при круглосуточной работе по официальным ставкам Nebius и RunPod на 26.09.2026. Плюс диск под 328 ГБ весов и время на скачивание.

Источники и официальные ссылки

Вердикт Qantcore
8/ 10
Altar-1 — редкий пример честной инженерной публикации: вендор показал не только выигрыш в размере (328 ГБ против 1,51 ТБ), но и цену этого выигрыша — 5,2 п.п. recall на собственном бенчмарке и полный отказ от независимых замеров. Как продукт это не «модель для всех»: 328 ГБ весов, 4× H200 и лицензия от GLM-5.3 делают её осмысленной там, где исходный код и находки обязаны оставаться внутри периметра. Если ваша задача — on-prem security-агент, это готовый референс и, вероятно, лучший открытый вариант на рынке; если нужен просто ассистент для ревью кода, дешевле и проще взять API.
Планируете свой контур для AI?
Смотрите гайды по локальному запуску моделей и агентов: железо, шаги, флаги и стоимость аренды GPU.