Qdrant 2026: обзор векторной базы для RAG и памяти агентов
Qdrant — открытая векторная база на Rust: строгие фильтры по метаданным, гибридный поиск и квантование, которое сокращает память в разы. Разбираем, что она даёт в RAG и памяти агентов, сколько стоит Cloud и когда базу брать не стоит.
Векторные БДRAGOpen source2026
Категория Векторная база для RAGЯзык ядра RustЛицензия Apache-2.0Релиз v1.19.1 · 04.09.2026Обновлено 05.10.2026
Qdrant — векторный поисковый движок и база данных, написанная на Rust. Он хранит векторы вместе с payload (метаданными), ищет ближайших соседей по HNSW-индексу и — что важнее всего на практике — умеет фильтровать выдачу по метаданным до и во время поиска, а не после него. Именно на этом ломается большинство RAG-пайплайнов: «найдите похожее, но только документы клиента X за последний месяц» — типовой запрос, который чистый ANN-индекс без фильтров не вытягивает.
8,6
Оценка Qantcore
из 10 по методологии
34,9 тыс.
Звёзды GitHub
снято 05.10.2026
v1.19.1
Последний релиз
04.09.2026
Apache-2.0
Лицензия
открытое ядро
01Кратко: что это и для кого
Qdrant относится к классу «векторных баз с данными»: помимо вектора он держит сам объект и его метаданные (payload), поэтому фильтры по атрибутам — status = active, tenant_id = 42, date > 2026-01-01 — комбинируются с векторной близостью в одном запросе. Индекс строится по алгоритму HNSW: граф «маленького мира», по которому поиск идёт с логарифмической сложностью на миллионах точек.
Ядро написано на Rust и распространяется под Apache-2.0, официальные клиенты есть для Python, TypeScript/JavaScript, Go, Rust, Java и .NET, а API доступен по REST и gRPC. Есть встроенный Web UI, FastEmbed для локальных эмбеддингов и отдельный MCP-сервер — это делает базу удобной не только для RAG, но и как память агента, к которой агент обращается через инструменты.
Python-клиентqdrant-client 1.19.1 (PyPI, требует Python 3.10+)
Ключевые фичиHNSW-индекс, фильтры по payload, гибридный поиск (dense + sparse), квантование, мультитенантность, шардинг и репликация
ОблакоQdrant Cloud: бесплатный тариф, Standard по факту расхода, Premium от минимального спенда
Как проверялись данные
Собственный бенчмарк мы не запускали. Все числа на странице — из первичных источников: GitHub API (звёзды, форки, даты релизов), PyPI (версии клиентов) и официальные страницы qdrant.tech. Цифры сняты 05.10.2026; тарифы и лимиты вендоры меняют — актуальные значения смотрите по ссылкам в блоке источников.
02Как устроен поиск: индекс, фильтр, выдача
Путь запроса в Qdrant предсказуем, и его стоит понимать до того, как считать деньги за память. Приложение отправляет вектор и условие фильтра; движок идёт по HNSW-графу, на каждом шаге отсекая точки, которые не проходят по payload; затем возвращает ближайших соседей — уже с исходными данными объекта, если попросить with_payload=True.
Путь запроса в Qdrant
Слои системы
Редакционные оценки Qdrant по осям (из 10)
Веса и баллы — редакционные: это наш разбор по документации и практике эксплуатации, а не результат независимого теста. Единственные внешние числа в этом обзоре — из GitHub API и PyPI.
Отдельно стоит упомянуть Qdrant Edge — встраиваемый движок для процессов, где нет сети: роботы, киоски, мобильные приложения. Он запускается внутри приложения, без фонового сервиса, и работает офлайн. Это ответ на запрос «векторный поиск там, где облако недоступно», и он закрывает нишу, из которой раньше Qdrant выпадал в пользу встроенных библиотек.
03Векторы, фильтры и квантование
Главный расход в любой векторной базе — не диск, а память: миллион векторов размерности 1536 в float32 занимает около 6 ГБ. Qdrant решает это квантованием — сжатием вектора в более компактное представление. Официальная документация описывает три режима, и выбирать их нужно по задаче, а не по принципу «чем сильнее сжать, тем лучше».
Режим
Суть
Что даёт
Когда брать
Скалярное (scalar)
Каждая координата → 8 бит
Сжатие примерно в 4 раза, небольшой проигрыш в точности
Рабочий вариант по умолчанию для большинства RAG-нагрузок
Продуктовое (product)
Вектор разбивается на подпространства
Сильное сжатие, больше потерь точности
Когда данных много, а память жёстко ограничена
Бинарное (binary)
Каждая координата → 1 бит
Сжатие до 32 раз, самая быстрая грубая фильтрация
Первый проход-кандидат, затем уточнение исходными векторами
Описание режимов — по официальной документации Qdrant (раздел Quantization). Точные коэффициенты качества зависят от датасета: проверяйте на своих данных.
Квантование можно включать и выключать на коллекцию: сначала измерьте recall на своём датасете, потом включайте.
Фильтры по payload работают и как «жёсткое» условие (must), и как «мягкое» (should, must_not) — это позволяет в одном запросе выразить «похоже на X и точно от клиента A».
Гибридный поиск комбинирует dense-векторы с sparse-векторами: семантика ловит смысл, sparse — точные термины, артикулы и коды, которые dense-модель промахивает.
Мультитенантность: данные арендаторов живут в одной коллекции, но изолированы, что дешевле, чем коллекция на каждого клиента.
Шардинг и репликация — встроенные: при росте данных коллекция делится на шарды, реплики держат доступность при отказе узла.
Практическое правило
Начинайте с одной коллекции и скалярного квантования, включите реплики только когда появится SLA. Преждевременный шардинг усложняет эксплуатацию сильнее, чем экономит ресурсы.
04Сколько стоит: self-hosted и Qdrant Cloud
Открытое ядро бесплатно: Qdrant под Apache-2.0 можно поднять в Docker или Kubernetes и не платить вендору ничего — расходы уходят вашему облаку или железу. Управляемый Qdrant Cloud — это та же база, но с операционными задачами на стороне вендора: обновления, масштабирование, шардинг, бэкапы.
Self-hosted (OSS)
бесплатнолицензия Apache-2.0
Полное ядро и клиенты
Квантование и гибридный поиск
Свои бэкапы и мониторинг
Платите только за железо/облако
оптимально
Cloud Free
бесплатноfree forever, для прототипов
Однонодовый кластер
0,5 vCPU / 1 ГБ RAM / 4 ГБ диска
Бесплатный cloud inference на отдельных моделях
Cloud Standard
по факту расходадля продакшена
Выделенные ресурсы
Вертикальное и горизонтальное масштабирование
HA-конфигурации, бэкапы и disaster recovery
SLA 99,5%
Cloud Premium
от минимального спендадля энтерпрайза
SSO
Private VPC Links
SLA 99,9%
Расширенная поддержка
Тарифы Qdrant Cloud по официальной странице qdrant.tech/pricing на 05.10.2026. Стоимость Standard — usage-based и зависит от конфигурации: считайте в калькуляторе на сайте.
Конкретные суммы спенда и цены за ресурсы вендор меняет — в тексте мы их не фиксируем, актуальные значения смотрите на официальной странице тарифов.
Звёзды GitHub у открытых векторных базтыс. звёзд, снято 05.10.2026
Источник: GitHub API (repos//, поле stargazers_count). Звёзды — мера популярности проекта, а не качества поиска; для оценки движка смотрите документацию и тестируйте на своих данных.
Звёзды и форки: сколько людей не только смотрят, но и форкают
GitHub API, 05.10.2026. Соотношение форков к звёздам показывает, насколько проект реально разворачивают у себя, а не только добавляют в закладки.
Про оплату из России
Qdrant — открытый проект: self-hosted вариант не требует карты вообще, и это главный аргумент для команд, которым нужен векторный поиск, но не нужен зарубежный платёж. К Qdrant Cloud применимы общие ограничения зарубежных сервисов — способы оплаты AI-инфраструктуры из РФ разобраны в нашем обзоре сервисов оплаты.
05Сравнение с Weaviate, ChromaDB и LanceDB
Все четыре базы открыты и решают одну задачу, но расходятся в режиме работы. Qdrant и Weaviate — серверные базы для больших объёмов; ChromaDB стартует как встроенная библиотека; LanceDB хранит данные в файловом формате Lance и не требует сервиса. Выбор определяется не звёздами, а тем, где будет жить индекс.
Критерий
Qdrant
Weaviate
ChromaDB
LanceDB
Язык ядра
Rust
Go
Rust
Rust
Лицензия
Apache-2.0
BSD-3-Clause (часть кода под своей лицензией)
Apache-2.0
Apache-2.0
Режим
Сервер (+ Qdrant Edge встроенно)
Сервер
Встроенно и клиент-сервер
Встроенно, без сервиса
Фильтры по метаданным
да, в одном запросе
да
да
да
Гибридный поиск (dense + sparse)
да
да, BM25 + векторы
да
частично
Управляемое облако
Qdrant Cloud
Weaviate Cloud
Chroma Cloud
LanceDB Cloud
Релиз на 05.10.2026
v1.19.1 (04.09.2026)
по данным репозитория
1.5.9 (05.05.2026)
по данным репозитория
Сводка по официальной документации проектов и GitHub API. Для LanceDB и Weaviate номера релизов меняются чаще, чем мы успеваем их фиксировать, — сверяйтесь с репозиториями по ссылкам ниже.
Короткий вывод: если нужен предсказуемый сервер с фильтрами и квантованием под большой объём — Qdrant. Если критична встроенность в приложение и минимум инфраструктуры — смотрите ChromaDB или LanceDB. Если нужны модули векторизации и реранкинга внутри базы — Weaviate.
06Плюсы, минусы и кому подходит
Плюс: фильтрация по метаданным внутри векторного поиска — самый частый практический запрос в RAG.
Плюс: квантование реально снижает требования к памяти, а не только в маркетинге.
Плюс: открытая лицензия Apache-2.0 и self-hosted без платежей — критично для команд из РФ.
Плюс: зрелая экосистема клиентов и MCP-сервер для агентов.
Минус: это отдельный сервис: появляется эксплуатация, бэкапы и мониторинг.
Минус: для «трёх документов в ноутбуке» он избыточен — встроенные библиотеки проще.
Минус: часть продвинутых возможностей Cloud (SSO, приватные каналы) доступна только на Premium.
Вердикт Qantcore
8,6/ 10
Qdrant — самый предсказуемый выбор, когда векторный поиск должен работать с фильтрами и расти по объёму: открытая лицензия, Rust-ядро, квантование и полноценный Cloud. Оценка 8,6 — редакционная: это наш разбор по документации и практике, внешние числа (звёзды, релизы) взяты из GitHub API и PyPI.
07Быстрый старт за пять минут
Минимальный запуск — один контейнер. Дальше создаётся коллекция, загружаются точки и выполняется поиск с фильтром. Ниже — команда из официального quickstart; версию образа фиксируйте тегом, а не latest, чтобы обновление не сломало прод случайно.
from qdrant_client import QdrantClient
from qdrant_client.models import Distance, VectorParams
client = QdrantClient(host="localhost", port=6333)
client.create_collection(
collection_name="docs",
vectors_config=VectorParams(size=1536, distance=Distance.COSINE),
)
Типовая ошибка
Не храните в payload то, что не нужно фильтровать: каждый лишний атрибут индексируется и ест память. Держите в метаданных только поля для фильтров и ссылки на внешние записи.
Это база данных для векторов: она хранит эмбеддинги вместе с метаданными и умеет за миллисекунды находить похожие записи с фильтром по атрибутам. Нужна там, где поиск должен работать «по смыслу», а не по точным словам.
Qdrant бесплатный или платный?
Открытое ядро под лицензией Apache-2.0 — бесплатно, включая self-hosted в своём облаке. Управляемый Qdrant Cloud начинается с бесплатного тарифа (однонодовый кластер, 0,5 vCPU / 1 ГБ RAM / 4 ГБ диска), дальше — usage-based Standard и Premium от минимального спенда.
Чем Qdrant отличается от Pinecone?
Лицензией и моделью поставки: Qdrant можно развернуть у себя бесплатно, Pinecone — управляемый проприетарный сервис. Для команд, у которых нет возможности платить зарубежному вендору картой, self-hosted Qdrant — рабочий вариант.
Нужен ли отдельный сервер для Qdrant?
Для продакшена — как правило да, это отдельный сервис с бэкапами и мониторингом. Для прототипов есть встроенный режим и Qdrant Edge; для «пары тысяч заметок» обычно достаточно встроенных библиотек, которые не требуют сервера.
Как Qdrant экономит память?
Квантованием: скалярное сжатие уменьшает вектор примерно вчетверо, продуктовое и бинарное — сильнее, за счёт точности. Включать его нужно после проверки recall на своих данных, иначе можно потерять релевантную выдачу.