От теории к практике: как работает архитектура Sol, Memory-Augmented Retrieval, Adaptive Compute Budget и Code Sandbox Native.
До Sol мультимодальные модели работали по принципу «разделяй и переключай»: отдельный vision-энкодер, reasoning-модуль, code-generator, orchestrator. Каждое переключение — latency и потеря контекста.
Архитектура Sol: единый transformer, единое латентное пространство, единый forward pass. Текст, изображения и код → общее 8192-мерное пространство через один tokenizer с модальными префиксами. Токены <vision>, <code>, <tool_call> активируют подсети внутри одного transformer'а.
🔬 Что это даёт:
Стандартный attention при 2M токенов требует ~320GB VRAM под KV-кэш. MAR решает это через внешнюю семантическую память.
# Как работает MAR: # 1. Контекст → блоки по 512 токенов # 2. Каждый блок → семантический эмбеддинг (lightweight encoder) # 3. Эмбеддинги → learnable key-value store (FAISS-подобный) # При attention модель: # а) Держит последние 32K токенов в KV-кэше (полное внимание) # б) Для остального: извлекает топ-64 релевантных блока # из MAR по семантической близости # в) Добавляет их как дополнительные key-value пары # Результат: 2M токенов → 80GB VRAM # Точность NIAH: 97.1% (потеря 2.9% vs полный attention, экономия 4× VRAM)
Важно: MAR семантический, не позиционный. Модель находит «цену продукта X» на странице 200 по СМЫСЛУ, а не по позиции.
Модель сама решает, сколько вычислений потратить. Нет overthinking на простых вопросах и underthinking на сложных.
| Тип запроса | ACB решение | Время | Токены |
|---|---|---|---|
| Простой факт | 1 forward pass | 50ms | ~50 |
| Объяснение концепции | 4-8 итераций + self-верификация | 500ms | ~500 |
| Архитектурный дизайн | 16-32 итерации + tree-of-thought | 2-5 сек | ~4000 |
Управление через API: параметр reasoning_effort — "auto", "low", "medium", "high". "high" для математики и формальной верификации.
Раньше: «напиши код → скопируй → запусти в терминале → прочитай ошибку → вернись к модели». Теперь — один вызов API.
import openai
client = openai.OpenAI()
response = client.chat.completions.create(
model="gpt-5.6-sol",
messages=[{"role": "user", "content": """
Напиши Python-скрипт, который:
1. Парсит CSV с логами (100K строк)
2. Находит топ-10 медленных эндпоинтов (p95 latency)
3. Строит гистограмму распределения
4. Сохраняет график в PNG
Запусти код. Если ошибки — исправь и перезапусти.
Выдай график и таблицу топ-10.
"""}],
tools=[{"type": "code_interpreter"}]
)
# Модель: напишет → запустит → увидит ошибки →
# исправит → перезапустит → вернёт результат
# ВСЁ в одном вызове
⚠️ Sandbox: Python 3.12, pandas/numpy/matplotlib предустановлены. Нет сети (air-gapped). Сессия 10 мин.
response = client.chat.completions.create(
model="gpt-5.6-sol",
messages=[{"role": "user", "content": """
## ЗАДАЧА: ежеквартальный отчёт по безопасности
## ДАННЫЕ
{CSV с 50K строк — логи файрвола Q3}
{compliance-policy.md}
## ПЛАН
1. Найти все блокированные IP
2. Сверить с threat intelligence feed (API)
3. Аномалии: всплески трафика, необычные порты
4. Сверить политики с compliance — найти несоответствия
5. Сгенерировать PDF-отчёт с графиками
Автономно. Время: до 60 минут.
"""}],
autonomy={"enabled": True, "max_duration_minutes": 60}
)
| Критерий | GPT 5.6 Sol | Claude Opus 8 | Kimi K3 |
|---|---|---|---|
| Контекст | 2M | 500K | 1M |
| Скорость | 50ms-5s | 5-30s | 15-30s |
| Мультимодальность | Текст+изобр | Текст+изобр | +Аудио+Видео |
| Desktop Control | Нет | CU 2.0 | Нет |
| Цена | $25/мес | $30-100 | $20 |