Обзор LiteLLM 2026: единый AI-шлюз для 100+ LLM-провайдеров
Открытый LLM Gateway, ставший де-факто стандартом: один OpenAI-совместимый эндпоинт, виртуальные ключи, бюджеты по командам, fallback и роутинг по стоимости. Одна строка кода — и вы больше не привязаны к провайдеру.
LiteLLM решает проблему, с которой сталкивается каждая команда, вышедшая за пределы одного LLM-провайдера: менять модель — значит менять код. OpenAI говорит по-своему, Anthropic — по-своему, Gemini и Bedrock — совсем иначе. LiteLLM убирает эту связку: вы пишете один вызов completion() против OpenAI-схемы, а шлюз сам переводит запрос в формат нужного вендора и переводит ответ обратно.
К 2026 году это превратилось в настоящий стандарт Python-разработки: ~53,6 тыс. звезд на GitHub и ~96 млн PyPI-загрузок в месяц, а продакшен на LiteLLM держат команды Netflix, Lemonade и Rocket Money. Если вы уже видели DSPy, CrewAI или LangChain в действии — вероятно, LiteLLM был у них роутинг-слоем.
LiteLLM поставляется в двух формах, которые можно использовать отдельно или вместе — это принципиально разные зоны ответственности.
| Режим | Что это | Кому подходит |
|---|---|---|
| Python SDK | Библиотека, встраиваемая прямо в код: один completion() для 100+ провайдеров. | Сольные разработчики, прототипы, приложения на Python. |
| Proxy Server | Самодостаточный HTTP-сервер (FastAPI) — корпоративный AI-шлюз, к которому подключаются любые клиенты OpenAI-API. | Команды, Cursor / Claude Code backend, централизованные ключи и бюджеты. |
Сильная сторона Proxy — централизованное управление доступами. Приложения получают не реальные ключи провайдеров, а виртуальные ключи, выпущенные шлюзом. Если ключ утёк — отзываете его в панели, не ротируя креды в каждом сервисе.
Поверх виртуальных ключей LiteLLM умеет вести пер-командные бюджеты, rate limiting и автоматический подсчёт стоимости каждого вызова. Это превращает кучу разных счетов от разных провайдеров в единую картину расходов с учётом по командам и проектам — как раз то, чего не хватает, когда стек растёт.
| Функция | Что даёт |
|---|---|
| Виртуальные ключи | Отдельные ключи для каждого сервиса/разработчика; отзыв без смены провайдерских кредов. |
| Бюджеты и лимиты | Пер-командные лимиты, rate limiting, стоп при превышении. |
| Fallback-цепочки | При падении одного провайдера запрос автоматически уходит к резервному. |
| Роутинг | Распределение по латентности, стоимости или весу; least-busy, simple-shuffle. |
| Кэш и guardrails | Семантический кэш, модерация («грабли») на уровне шлюза. |
| Наблюдаемость | OpenTelemetry, интеграция с Langfuse / MLflow / Helicone в одну строку. |
В production Proxy обычно разворачивают в Docker/Docker Compose вместе с Redis (кэш, rate limiting). Клиенты — Claude Code, Cursor, OpenAI SDK, LangChain, Vercel AI SDK — просто указывают api_base на ваш шлюз, и код можно не трогать.
Полный пример конфигурации с провайдерами и fallback — на официальной документации LiteLLM.
Универсальный шлюз — не единственная опция. Сравниваем с ближайшими коммерческими конкурентами, чтобы была видна цена «open-source-пути».
| Критерий | LiteLLM | Portkey | Cloudflare AI Gateway |
|---|---|---|---|
| Модель | Open-source (MIT, open-core) | SaaS | SaaS-платформа |
| Цена | Бесплатно, вы хостите сами | от $49/мес (Hobby) / $199 (Growth) | +$0.20 за млн gateway-запросов |
| Установка | pip + свой сервер | из коробки | на вашем Cloudflare-аккаунте |
| Операционная нагрузка | Вы отвечаете за аптайм и обновления | низкая | низкая |
| Лучше для | команд с собственной K8s/ops | тех, кто не хочет хостить | уже живущих в Cloudflare |
LiteLLM закрывает «роутинг-слой» стека. По соседству с ним:
LiteLLM — это не «ещё одна библиотека», а тот самый невидимый слой, который де-факто уже держит на себе значительную часть LLM-приложений в Python. Особенно он незаменим там, где команда перестала выбирать «одну модель навсегда» и начала микстовать провайдеров по цене и скорости.
Практический вывод: начинайте с Python SDK, а с ростом числа разработчиков и сервисов поднимайте Proxy — виртуальные ключи и бюджеты окупят затраты на хостинг уже на второй-третьей команде. Для тех, кто не хочет хостить вовсе, рядом есть SaaS-аналоги (включая OpenRouter), но именно LiteLLM даёт максимум контроля без подписки.