СРАВНЕНИЕ АГЕНТОВ 2026

Agent Arena 2026: восемь AI-агентов на одной методике

Сравниваем восемь AI-агентов по одной методике с фиксированными весами: проверенные метрики репозиториев, официальные тарифы, шесть осей оценки и итоговый балл, посчитанный кодом.

Сравнение8 агентов2026
Агентов 8Осей оценки 6Обновлено 26.09.2026

Восемь AI-агентов — Hermes Agent, OpenClaw, Goose, SemaClaw, OpenHands, Codex CLI, Amp и Grok Build — прогнаны по одной и той же методике из шести осей: research, кодинг, автономность, память, MCP-расширения и восстановление после ошибок. Никаких «на глазок»: язык, лицензия и звёзды взяты из GitHub API 26.09.2026, тарифы и возможности — с официальных страниц вендоров, веса осей зафиксированы, а средневзвешенный итог посчитан кодом. Каждый участник дополнительно разобран в отдельном обзоре на сайте.

Как читать оценку
Оценки — редакционные, по шкале 0–10, по состоянию на 26.09.2026. Итог = средневзвешенная шести осей (веса в таблице ниже), а не среднее арифметическое. Собственных бенчмарк-прогонов мы не делаем: оцениваем архитектуру и подтверждённые возможности, а числа из исследований вендоров приводим с прямой пометкой авторства.

01Методика: шесть осей и веса

Сравнивать агентов по маркетинговым страницам бессмысленно: почти все умеют «работать с кодом» и «подключать MCP». Поэтому оси разведены так, чтобы одна и та же команда оценивала разные типы задач, а веса отражали реальную нагрузку: кодинг весит четверть, потому что именно под него покупают большинство агентов, а память — вдвое меньше, хотя именно она отличает ассистента общего назначения от умной консольной команды.

ОсьЧто проверяемВес
Researchдоступ к вебу и документации, сбор источников, ответы со ссылками15%
Кодингправки в репозитории, тесты, многофайловые задачи, ревью диффов25%
Автономностьфоновый и удалённый запуск, пробуждение по событиям, планирование20%
Памятьмежсессионный контекст, устойчивая персона, база знаний10%
MCP и расширенияMCP-серверы, плагины, скиллы, интеграции с внешними системами15%
Восстановлениеповторы и обработка ошибок, sandbox и права, наблюдаемость15%
Веса фиксированы и одинаковы для всех восьми агентов — иначе сравнение превращается в подгонку.
Как получен итог
1Сбор фактовРепозиторий, лицензия, язык, звёзды, официальная документация, тарифы2Оценка шести осейПо чек-листу: что реально подтверждено документацией и кодом3Средневзвешенный итогУмножаем каждую ось на вес и складываем — считает скрипт, не человек4СверкаЧисла перепроверяются, расхождения с индивидуальным разбором устраняютсяЧетыре шага, одинаковые для каждого участника
Что мы не сравниваем
Скорость и качество моделей на собственных задачах. Разные агенты используют разные модели, а производители меняют их чаще, чем мы успеваем публиковать замеры. Поэтому итог арены — про инженерные свойства обвязки: сколько задач агент доводит сам, что помнит, чем расширяется и как ведёт себя при ошибке.

02Восемь участников

Ниже — краткая характеристика каждого агента с проверенными метриками. Ссылки на полный разбор по каждому — в конце страницы.

Hermes Agent (Nous Research, Python, MIT, 249,1 тыс. ★) — агент общего назначения: долговременная память между сессиями, библиотека навыков, набор инструментов, планировщик задач и шлюз в мессенджеры. В арене он лидирует по оси памяти и силён в автономности: задачи можно ставить по расписанию и получать результат в канал, а не в открытую вкладку терминала. Слабое место — кодинг: правки в крупном репозитории агент делает уверенно, но уступает специализированным терминальным инструментам по работе с диффами и тестами.

OpenClaw (TypeScript, 390,5 тыс. ★ — самый популярный проект подборки) — персональный ассистент, который задуман как постоянно живущий рядом агент: локальный рантайм, подключение календарей, почты, мессенджеров и файловой системы. Лицензия в репозитории не распознаётся GitHub как стандартная SPDX — перед коммерческим внедрением её нужно читать в первоисточнике. По совокупности осей он в лидерах, но требует заметной инженерной работы: настройка каналов, прав и изоляции ложится на владельца.

Goose (Agentic AI Foundation, Rust, Apache-2.0, 54,7 тыс. ★ на GitHub при «45k+» на официальном сайте) — самый «расширяемый» участник: 70+ MCP-расширений, 15+ провайдеров моделей, работа через подписки (ACP), рецепты воркфлоу в YAML, субагенты и приложения MCP с интерфейсом внутри desktop. Это лучший выбор, когда задача — не «починить код», а собрать повторяемый процесс: рецепт описывается один раз и запускается командой или в CI. Автономность ниже: постоянный фоновый режим не его профиль.

SemaClaw (MIT, TypeScript, 84 ★; рантайм sema-code-core — 133 ★) — самый молодой проект подборки и единственный, у которого есть научная статья (arXiv 2604.11548) с описанием архитектуры: DAG Teams, PermissionBridge, трёхслойная память (рабочий контекст, внешняя память, персона в SOUL.md) и Agentic Wiki. Оценка памяти здесь высокая не из-за популярности, а из-за проработанной модели контекста; по кодингу — самая низкая в арене: инструмент строится как обвязка, а не как кодовый агент. Авторы заявляют рост Terminal Bench 2.0 с 52,8% до 66,5% за счёт изменений в harness — это их собственные данные.

OpenHands (ранее OpenDevin, MIT, TypeScript, 89,2 тыс. ★) — платформа, в которой агент работает в изолированном Docker-контейнере: терминал, файлы, браузер. Это самая «закрытая от вашей машины» схема: агент не трогает локальное окружение, а результаты приходят в виде изменений и pull-request. Память и персона — слабая ось: фокус сделан на выполнении задачи в песочнице, а не на длительных отношениях с пользователем.

Codex CLI (OpenAI, Rust, Apache-2.0, 126,6 тыс. ★) — самый сильный участник по оси кодинга: агент проектировался под работу в репозитории с полным доступом к терминалу, запуском тестов и многофайловыми правками, у него же один из лучших показателей восстановления после ошибок. Модели подключаются через аккаунт OpenAI, поэтому стоимость зависит от тарифа и лимитов, а не от цены за подписку агента. Память и персона — минимальные: контекст живёт в проекте и правилах репозитория.

Amp (Sourcegraph) — единственный полностью коммерческий участник: публичного репозитория нет, ставить нужно CLI @ampcode/cli. Каждый поток получает собственный «орб» — удалённую машину, где агент работает без вашего ноутбука, умеет просыпаться по событиям (новая задача в трекере, упавший CI, расписание) и показывает изменения через порталы. Итог 8,0 — за зрелость продукта, а не за открытость: исходников нет, а цена выражена в минутах орбов.

Grok Build (xAI, Rust, Apache-2.0, 27,1 тыс. ★) — терминальный агент с полноэкранным интерфейсом: Plan Mode, субагенты в отдельных worktree, sandbox и права, MCP, хуки, headless-режим для CI, ACP для редакторов и подмена моделей через ~/.grok/config.toml (любой OpenAI-совместимый эндпоинт). Проект молодой: экосистема плагинов и наработки сообщества пока заметно тоньше, чем у Goose или OpenClaw, отсюда просадка по восстановлению и памяти.

Три класса агентов в арене
Терминальные coding-агентыCodex CLI, Grok Build, Amp, OpenHands: живут вокруг репозитория и CIрепозиторийПерсональные агенты-ассистентыHermes Agent, OpenClaw, Goose: работают с календарём, файлами и мессенджерамиваши сервисыКаркасы для своего агентаSemaClaw и рецепты Goose: вы строите поведение сами, на своём рантаймеваш код

03Сводная таблица и графики

АгентЯзыкЛицензия★ GitHub 26.09.2026Профиль
Hermes AgentPythonMIT249 100универсальный агент с памятью, навыками, расписаниями и каналами
OpenClawTypeScriptвне списка SPDX390 548персональный ассистент с локальным рантаймом
GooseRustApache-2.054 664general-purpose агент AAIF: desktop, CLI и API
SemaClawTypeScriptMIT84каркас для сборки персонального мульти-агентного ассистента
OpenHandsTypeScriptMIT89 197автономная разработка в песочнице
Codex CLIRustApache-2.0126 556терминальный coding-агент OpenAI
Amp— (закрытый код)проприетарная—облачные «орбы» + единый клиент для всех устройств
Grok BuildRustApache-2.027 113терминальный harness и TUI от xAI
Звёзды GitHub — сигнал принятия, а не качества: у молодого каркаса их десятки, у зрелого ассистента — сотни тысяч.
Лицензия OpenClaw в репозитории не определяется GitHub как стандартная SPDX — проверяйте текст лицензии в первоисточнике.
Кодинг против автономностиоценка Qantcore, 0–10
02,557,510Hermes AgentOpenClawGooseSemaClawOpenHandsCodex CLIAmpGrok BuildКодингАвтономность
Разрыв между осями показывает назначение агента: у Codex CLI перевес в кодинге, у SemaClaw и Hermes — в автономности.
Итоговая оценка восьми агентовединая методика, 0–10
0510Hermes Agent8,4Codex CLI8,4OpenClaw8,4Goose8,2Amp8,0OpenHands7,9Grok Build7,8SemaClaw7,6
Веса осей одинаковы для всех: 25% кодинг, 20% автономность, по 15% research, MCP и восстановление, 10% память.
Четыре лидера по шести осям
ResearchКодингАвтономностьПамятьMCP и расширенияВосстановлениеHermes Agentсредний балл 8,5 / 10Codex CLIсредний балл 8,2 / 10OpenClawсредний балл 8,4 / 10Gooseсредний балл 8,3 / 10
Профили показывают, что «лучший агент» — понятие относительное: сильные оси у лидеров разные.

04Разбор по осям

Research. Лучший результат — у Amp (8,6): агент изначально делается как «работать из любого клиента», включая телефон, и рассчитан на сбор контекста с внешних систем. Практически рядом Hermes Agent (8,5) и Goose (8,4) — у обоих сильные веб-инструменты и доступ к документации. Ниже всех SemaClaw (7,2): он строится как локальная обвязка, и поиск в интернете — не его сильная сторона.

Ось Research: доступ к внешним даннымоценка Qantcore, 0–10
0510Amp8,6Hermes Agent8,5Goose8,4OpenClaw8Codex CLI7,6Grok Build7,6OpenHands7,5SemaClaw7,2
Ось отвечает на вопрос «может ли агент сам найти недостающий контекст».

Кодинг. Здесь побеждает Codex CLI (9,2) — терминальный агент OpenAI изначально про репозиторий, тесты и многофайловые правки. Следом идут OpenClaw (8,2), OpenHands и Amp (по 8,2), Grok Build (8,0) и Goose (8,0). Замыкает SemaClaw (6,8): фреймворк строится как универсальная обвязка, кодовые задачи в нём решаются сторонним рантаймом.

Ось «Кодинг»: работа с репозиториемоценка Qantcore, 0–10
0510Codex CLI9,2OpenClaw8,2OpenHands8,2Amp8,2Goose8Grok Build8Hermes Agent7,8SemaClaw6,8
Учитывались правки в репозитории, запуск тестов, разбор диффов и работа в CI.

Автономность. Максимум — у Hermes Agent (8,8): задачи ставятся по расписанию, выполняются в фоне и возвращаются в канал. OpenClaw (8,6) и Codex CLI (8,6) делят второе место, у OpenHands (8,4) и Amp (8,4) — сильная изоляция и удалённые машины, у Amp дополнительно пробуждение по событиям: новая задача в трекере, упавший CI или собственное расписание. У Goose автономность скромнее (7,5): его модель — запуск по команде или рецепту, а не постоянно живущий в фоне процесс.

Память. Ось, которая разводит участников сильнее всего. Hermes Agent (9,5) и SemaClaw (9,0) проектировались вокруг долговременного контекста: у первого — память между сессиями и навыки, у второго — три слоя контекста и персона в отдельном файле. OpenClaw (8,8) и Goose (8,4) помнят проектные правила и внешние знания через расширения, а у Codex CLI, Amp и Grok Build память привязана к репозиторию или профилю конфигурации — для длительных отношений «агент и пользователь» этого мало.

Ось «MCP и расширения»
Goose9,5Hermes Agent8,5OpenClaw8,5Codex CLI8Grok Build8SemaClaw7,8OpenHands7,8Amp7,6
Goose с 70+ MCP-расширениями и приложениями внутри desktop — лидер; Amp и SemaClaw замыкают список, но причина разная: у Amp расширения живут в его среде, у SemaClaw экосистема только формируется.

Восстановление. Ось про поведение при сбое: повторы, лимиты, права, sandbox, наблюдаемость. Codex CLI (8,4) и OpenClaw (8,2) обрабатывают ошибки и ограничения лучше остальных; OpenHands (8,0) выигрывает за счёт Docker-изоляции — агенту попросту нечем навредить. У Grok Build (7,4) и Amp (7,4) механики есть (sandbox, права, хуки), но публичных практик эксплуатации меньше.

ОсьЛидерАутсайдерКому это критично
ResearchAmp (8,6)SemaClaw (7,2)аналитика, сбор данных, конкурентная разведка
КодингCodex CLI (9,2)SemaClaw (6,8)разработчики и команды с большим репозиторием
АвтономностьHermes Agent (8,8)Goose (7,5)задачи вне рабочего стола, регулярные отчёты
ПамятьHermes Agent (9,5)OpenHands (7,0)личный ассистент, долгие проекты
MCP и расширенияGoose (9,5)Amp (7,6)интеграции с внутренними системами
ВосстановлениеCodex CLI (8,4)Amp и Grok Build (7,4)продовые сценарии и CI
Разброс внутри оси невелик — это следствие единой методики: крайние значения отличаются на 1–2 балла, но их хватает, чтобы выбрать инструмент под задачу.

05Что выбрать под задачу

ЗадачаКого братьПочему
Личный ассистент с памятью и каналамиHermes Agentмежсессионная память, навыки, расписания, доставка в мессенджер
Автоматизация рабочего стола и сервисовOpenClawсамое большое сообщество, постоянный локальный рантайм
Повторяемые воркфлоу с MCPGooseрецепты в YAML, 70+ расширений, desktop + CLI + API
Свой мульти-агентный ассистентSemaClawDAG Teams, PermissionBridge, трёхслойная память, MIT
Автономная разработка без риска для машиныOpenHandsDocker-песочница, изоляция кода и браузера
Ежедневный кодинг в терминалеCodex CLIлучший кодинг и восстановление, работа с репозиторием и тестами
Задачи без ноутбука, всё в облакеAmpорбы живут без вашей машины, пробуждаются по событиям
Терминал + CI + свои моделиGrok Buildopen-source harness, конфиг с любым OpenAI-совместимым эндпоинтом
Таблица — короткий путь: если задача описывается одной строкой, дальше можно не сравнивать.
Кому доверяют открытый код и облако
88%12%8агентовОткрытый код, self-host7 · 88%Только облако (проприетарный)1 · 12%
Семь из восьми участников можно развернуть на своей машине или в своём облаке: закрытый — только Amp.

06Деньги: подписка против токенов

Главная ошибка при выборе — сравнивать «цену агента» вместо полной стоимости месяца. У семи открытых участников платформа бесплатна, а платите вы за токены модели: ключ провайдера или локальная модель. Amp — единственный, кто продаёт подписку на среду: у него тариф считается в минутах работы «орбов». Ниже — структура тарифов по официальной странице цен на 26.09.2026.

Open source
0 ₽за платформу
  • Hermes Agent, OpenClaw, Goose, SemaClaw, OpenHands, Codex CLI, Grok Build
  • Платите только за модель: API-ключ или локальный рантайм
  • Свой сервер, свои данные, свои лимиты
оптимально
Amp Hobby
$0с оплатой по факту
  • Все возможности продукта
  • Оплата по факту для орбов или свои раннеры бесплатно
  • BYOK: ключи и подписки можно приносить свои
  • Нет наценки и лимитов Amp на токены
Amp Individual
$20в месяц
  • 45 000 минут работы орбов
  • Свои ключи и подписки, в том числе ChatGPT
  • Неограниченное число публичных и приватных репозиториев
  • Свои домены для порталов
Amp Teams / Enterprise
без доплаты / по запросуна команду
  • Участники на разных тарифах, общие потоки и мультиплеер
  • Общие порталы, плагины и навыки, SSO
  • Enterprise: SCIM, аудит-логи, лимиты расходов
Цены и лимиты меняются — перед оплатой сверяйте официальную страницу тарифов (ссылка в источниках).
У открытых агентов итоговая стоимость месяца определяется моделью и объёмом задач, а не подпиской на агента.
Что меняется с ростом нагрузкидоля затрат, %
0%20%40%60%80%1 задача/день5 задач/день15 задач/день40 задач/день22416379Токены моделейПодписка/инфраструктура
Оценка по структуре тарифов: у открытых агентов доля токенов растёт с нагрузкой быстрее подписки агента.

07Итоги арены

Первое место делят три агента с итогом 8,4 — Hermes Agent (память и автономность), OpenClaw (зрелость и охват сценариев) и Codex CLI (кодинг и восстановление). Это не «ничья по слабости»: профили у них разные, и в реальной работе выбор определяется тем, что вы делаете большую часть дня. Отдельно стоит Goose (8,2) — лучший инструмент для повторяемых процессов и MCP-интеграций, и Amp (8,0) — единственный вариант, когда нужна работа без локальной машины и без возни с инфраструктурой.

8,4
Лидеры арены
Hermes Agent, OpenClaw, Codex CLI
8
Участников
все разобраны отдельно
6
Осей оценки
веса зафиксированы
Паспорт арены
Методика6 осей, фиксированные веса
ИсточникиGitHub API, npm, официальные доки и прайсы
Дата данных26.09.2026
Собственные бенчмаркине проводились — оцениваем обвязку
Форматгайд со сравнением, обновляется при значимых релизах

Частые вопросы

Это результаты бенчмарков?
Нет. Оценки редакционные: шесть осей, фиксированные веса, подтверждённые возможности из документации и кода. Единственные бенчмарк-числа на странице — из статьи о SemaClaw, и они подписаны как данные авторов (Terminal Bench 2.0: 52,8% → 66,5%).
Почему у SemaClaw 84 звезды, но высокая оценка памяти?
Потому что ось памяти оценивает архитектуру, а не популярность: у SemaClaw это трёхслойный контекст, per-agent персона в SOUL.md и Agentic Wiki, собирающая личную базу знаний. Звёзды мы показываем, но как сигнал принятия сообществом, а не как оценку качества.
Можно ли пользоваться всеми восьмью бесплатно?
Семью — да, если считать саму платформу: открытый код ставится на свою машину, а расходы ограничиваются токенами модели или локальным рантаймом. Amp — коммерческий продукт: есть бесплатный тариф Hobby с оплатой по факту и платный Individual за $20 в месяц.
Чем OpenClaw отличается от SemaClaw, если оба «персональные»?
Зрелостью: OpenClaw — массовый ассистент с сотнями тысяч звёзд и готовыми сценариями, SemaClaw — молодой MIT-каркас с описанной в статье архитектурой (DAG Teams, PermissionBridge), который надо собирать под себя. Хотите «поставил и работает» — первый; хотите свой рантайм — второй.
Что делать команде из пяти человек?
Разделить роли: Codex CLI или OpenHands — на разработку, Goose — на повторяемые процессы и интеграции, Hermes Agent — на память, отчёты и каналы. Один агент на все задачи в 2026 году проигрывает связке из двух-трёх.
Когда страница обновится?
Мы перепроверяем метрики репозиториев и тарифы при значимых релизах участников: дата данных всегда указана в паспорте арены, а сами участники разобраны в отдельных обзорах, которые обновляются чаще.

Источники и документация

Вердикт Qantcore
8,4/ 10
Универсального победителя в арене нет: 8,4 получают Hermes Agent (память и автономность), OpenClaw (зрелость) и Codex CLI (кодинг) — выбирать стоит по своей ежедневной задаче, а не по итоговому баллу. Если задача одна и узкая, берите специалиста: Goose — для повторяемых процессов, OpenHands — для автономной разработки в изоляции, Amp — чтобы работать без локальной машины, Grok Build — для терминала и CI.
Сравнить агентов в одной таблице
Каталог обзоров с единой методикой оценки: фильтры по типу, лицензии и цене.