Open-source RAG-движок с глубоким пониманием документов и agentic RAG
RagFlow (от компании InfiniFlow) — это open-source RAG-движок с глубоким пониманием документов и agentic RAG. Он извлекает таблицы, изображения и сложную вёрстку из PDF, Word, Excel и PPT, а затем отвечает на вопросы поверх вашей базы знаний точнее, чем обычные векторные поисковики.
RagFlow — это open-source движок retrieval-augmented generation (RAG), который превращает ваши документы в базу знаний, по которой языковая модель отвечает на вопросы с точными ссылками на источники. Проект разрабатывается компанией InfiniFlow и распространяется под лицензией Apache 2.0, то есть его можно свободно использовать, дорабатывать и разворачивать у себя — даже в коммерческих продуктах.
Главное отличие RagFlow от «простых» RAG-решений — это глубокое понимание документов. Традиционные инструменты режут текст на куски почти вслепую, теряя таблицы, колонки, подписи к изображениям и иерархию заголовков. RagFlow использует собственную технологию DeepDoc, которая распознаёт layout документа, извлекает таблицы и изображения, строит граф знаний и только потом делит контент на осмысленные чанки. На практике это означает заметно более точные ответы на сложных документах: финансовых отчётах, договорах, технической документации и презентациях.
Ключевая концепция «ragflow что это» сводится к следующему: это не чат-бот и не фреймворк в чистом виде, а готовая платформа, которую можно поднять одной командой в Docker Compose и получить полноценный веб-интерфейс, REST API и Python SDK. Она закрывает весь цикл: загрузка документов → парсинг → чанкинг → эмбеддинги → индексация → гибридный поиск → генерация ответа с цитированием.
| Возможность | Описание | Оценка |
|---|---|---|
| 🔍 Глубокое понимание документов | Технология DeepDoc распознаёт вёрстку, таблицы, изображения и заголовки в PDF, Word, Excel, PPT и HTML. Контент не «слепливается» в сплошной текст, а сохраняет структуру — это радикально повышает качество ответов. | ★★★★★ |
| 🔀 Гибридный поиск | Одновременно использует векторный поиск (по смыслу) и полнотекстовый (по точному совпадению слов), комбинируя результаты. Поддерживает переранжирование (rerank) для лучшей релевантности. | ★★★★★ |
| 🤖 Agentic RAG | Встроенные агенты сами планируют поиск: разбивают сложный вопрос на подзадачи, обращаются к разным источникам и инструментам, а затем собирают итоговый ответ с цитатами. | ★★★★★ |
| ✂️ Умный чанкинг | Шаблонная разбивка на чанки по типу документа (книга, договор, отчёт, презентация) вместо «тупого» деления по N символов. Можно задать свои правила и границы. | ★★★★★ |
| 🕸️ Граф знаний (GraphRAG) | Автоматически извлекает сущности и связи между ними, строит граф знаний, что позволяет отвечать на вопросы, требующие рассуждений по нескольким документам. | ★★★★☆ |
| 🔌 Широкие интеграции | Работает с Ollama, OpenAI, DeepSeek, Qwen, Moonshot, ZhipuAI и любыми OpenAI-совместимыми LLM. Поддержка множества embedding-моделей (BGE, Jina, OpenAI и др.). | ★★★★★ |
| 🖥️ Веб-консоль + API | Удобный веб-интерфейс для управления базами знаний и чатами, плюс REST API и Python SDK для встраивания в свои приложения. | ★★★★☆ |
| 👥 Управление доступом | Мультитенантность: команды, роли, права на базы знаний. Подходит для корпоративного развёртывания с разделением данных между отделами. | ★★★★☆ |
Самый простой и рекомендуемый способ запустить RagFlow — Docker Compose. Проект поднимает несколько контейнеров: веб-сервер, Elasticsearch (поиск), MySQL (метаданные), Redis (очереди и кэш) и MinIO (хранилище объектов). Всё управляется из одного файла.
🚀 Клонирование и запуск
⚠️ Требования: Docker 24+ и Docker Compose v2, минимум 16 ГБ ОЗУ (рекомендуется 32 ГБ),
несколько ГБ диска для Elasticsearch и моделей. После запуска веб-интерфейс доступен на
http://localhost:80, а API — на http://localhost:9380.
Одно из сильнейших мест RagFlow — гибкость в выборе языковых и embedding-моделей. Вы не привязаны к одному провайдеру: можно комбинировать облачные API и локальные модели, подключая собственные LLM через OpenAI-совместимый интерфейс.
| Провайдер | Тип | Особенности |
|---|---|---|
| OpenAI | Облачный API | GPT-4o / GPT-4.1 и др. Высокое качество, платно по факту использования. |
| DeepSeek | Облачный API | Отличное соотношение цена/качество, хорошо работает с русским языком. |
| Qwen | Облачный API | Мультиязычная линейка Alibaba Cloud, сильна в задачах на китайском и английском. |
| Ollama | Локально | Запуск open-source моделей (Llama, Qwen, Mistral) на своём железе — данные не покидают сервер. |
| Moonshot / ZhipuAI | Облачный API | Популярные азиатские провайдеры LLM, поддерживаются из коробки. |
| Собственный LLM | Любой | Любой сервер с OpenAI-совместимым API (vLLM, LM Studio, TGI и т.д.). |
Для эмбеддингов доступны BGE, Jina, OpenAI и другие модели, а также возможность переранжирования через reranker-модели. Такая свобода означает, что RagFlow можно развернуть полностью автономно — без отправки единого байта во внешние облака, что критично для компаний с чувствительными данными.
RagFlow предоставляет официальный Python SDK ragflow-sdk, с помощью которого
можно автоматизировать загрузку документов, создание баз знаний и ассистентов-чатов.
Вот типичный сценарий:
💡 Помимо SDK доступен полноценный REST API (документация Swagger на
/api/v1), так что RagFlow легко встраивается в любые приложения на любом языке.
На рынке RAG-инструментов в 2026 году есть несколько сильных игроков. Вот как RagFlow выглядит на фоне AnythingLLM, Dify и LlamaIndex:
| Критерий | RagFlow | AnythingLLM | Dify | LlamaIndex |
|---|---|---|---|---|
| Тип продукта | RAG-платформа | Персональный AI-ассистент | Low-code платформа LLM-приложений | Python-фреймворк |
| Лицензия | ✅ Apache 2.0 | ✅ MIT | ✅ Apache 2.0 | ✅ MIT |
| Глубокое понимание документов | ✅ DeepDoc (таблицы, layout, изображения) | ❌ Базовый парсинг текста | ⚡ Зависит от загрузчиков | ⚡ Через reader-модули |
| Гибридный поиск | ✅ Vector + full-text + rerank | ⚡ В основном векторный | ✅ Да | ⚡ Настраивается вручную |
| Agentic RAG | ✅ Встроенные агенты | ❌ Нет | ✅ Агенты и workflow | ✅ Агенты через код |
| Графический интерфейс | ✅ Веб-консоль | ✅ Да | ✅ Да | ❌ Только код |
| Парсинг Excel / PPT | ✅ Нативно | ❌ Ограниченно | ⚡ Через загрузчики | ⚡ Через загрузчики |
| Развёртывание | ✅ Docker Compose | ✅ Docker / десктоп | ✅ Docker Compose | ✅ pip install |
| Порог входа | ⚡ Средний (нужен сервер) | ✅ Низкий | ⚡ Средний | ❌ Высокий (код) |
| Для кого | Enterprise RAG, корпоративные базы знаний | Индивидуальный ассистент | Команды и продуктовые AI-приложения | Разработчики, кастомные пайплайны |
✅ = Полноценная поддержка ⚡ = Частичная/ограниченная ❌ = Отсутствует
ℹ️ Метрики сообщества (звёзды, форки) приведены по состоянию на август 2026 года и являются ориентировочными — они меняются ежедневно.
Self-hosted версия полностью бесплатна — это открытый код под Apache 2.0. Вы платите только за собственное железо (или VPS) и, при желании, за API-ключи облачных LLM вроде OpenAI или DeepSeek. Для многих компаний это самый привлекательный вариант: никакой абонентской платы и полный контроль над данными.
Помимо этого InfiniFlow предлагает RagFlow Cloud — управляемый облачный сервис, где не нужно администрировать серверы. На момент написания обзора (август 2026) в облаке есть бесплатный стартовый тариф для знакомства и платные планы, начинающиеся ориентировочно от $25–30 в месяц за команду. Точные цены зависят от объёма документов, количества пользователей и выбранных моделей, поэтому перед покупкой стоит проверить актуальный прайс на официальном сайте — тарифы могут меняться.
Итоговая стоимость self-hosted инсталляции складывается из трёх компонентов: сервер (рекомендуется от 4 vCPU / 16 ГБ RAM), API облачной LLM (от нескольких долларов в месяц при умеренном трафике) или, при использовании Ollama, только из электричества и железа.
RagFlow — это, на наш взгляд, сильнейший open-source RAG-движок 2026 года для тех, кому важна точность на сложных документах. Его ключевое преимущество — технология DeepDoc — решает главную проблему классического RAG: потерю структуры документа при чанкинге. Если ваша база знаний состоит из PDF-отчётов с таблицами, договоров, Excel-прайсов и презентаций, RagFlow даст заметно более качественные ответы, чем AnythingLLM или наивный LlamaIndex-пайплайн.
Платой за это становится требовательность к ресурсам: полноценная инсталляция хочет 16–32 ГБ RAM и несколько контейнеров. Для инженера это не проблема, а вот для человека, который хочет «просто загрузить файлы и спросить», более лёгкий AnythingLLM может оказаться удобнее. Dify выигрывает там, где нужен визуальный конструктор многошаговых приложений, а LlamaIndex — когда хочется собрать пайплайн руками на чистом Python.
Если ваш приоритет — корпоративная база знаний, полный контроль над данными и точность поверх документов со сложной вёрсткой, RagFlow обязателен к рассмотрению. Self-hosted бесплатен, разворачивается одной командой и закрывает весь RAG-цикл «из коробки».
🏅 Награда Qantcore «Лучший open-source RAG-движок» — за глубокое понимание документов и agentic RAG, август 2026.
| Профиль пользователя | Насколько подходит | Почему |
|---|---|---|
| 🏢 Корпоративная база знаний | ★★★★★ | Глубокий парсинг сложных документов, управление доступом, self-hosted без утечки данных. |
| 📊 Аналитик / юрист / финансист | ★★★★★ | Точное извлечение таблиц и цифр из PDF/Excel, цитирование источников — критично для отчётности. |
| 🧑💻 Разработчик RAG-приложений | ★★★★★ | Python SDK и REST API позволяют встроить RagFlow как готовый бэкенд поиска по документам. |
| 🔐 Компания с чувствительными данными | ★★★★★ | Полностью локальное развёртывание, включая локальные LLM через Ollama. |
| 🎓 Исследователь / студент | ★★★★☆ | Шаблон «paper» отлично работает с научными статьями, но нужен сервер с достаточной памятью. |
| 💬 Хочет «просто чат с файлами» | ★★★☆☆ | Возможности есть, но инфраструктура тяжеловата — для простых задач проще взять AnythingLLM. |
RagFlow был создан компанией InfiniFlow — командой, в которую вошли инженеры с опытом работы в крупных технологических компаниях и академических исследованиях в области поиска и обработки естественного языка. Проект стартовал в 2024 году и сразу привлёк внимание сообщества благодаря свежему подходу: вместо очередного «обёрточного» RAG-фреймворка авторы сфокусировались на самой сложной части — точном извлечении смысла из неструктурированных документов.
Сегодня RagFlow — один из самых быстрорастущих RAG-проектов на GitHub с десятками тысяч звёзд и активным сообществом контрибьюторов. Релизы выходят регулярно, а инфраструктура уже используется в проде компаниями разного масштаба. Благодаря лицензии Apache 2.0 проект можно свободно встраивать в коммерческие продукты без раскрытия собственного кода.