Adaptive Parallel Reasoning: LLM, решающие когда мультизадачить
LLM отлично рассуждают — но медленно. Цепочка мыслей (chain-of-thought) проходит шаг за шагом. Проблема: с ростом цепочки растет латентность и «коррупция контекста».
Adaptive parallel reasoning позволяет LLM автономно решать, когда разделить задачу на подзадачи, сколько запускать параллельно и как координировать результаты.
Проблема последовательного рассуждения
- Латентность накапливается — 50 шагов × 200ms = 10 секунд
- Коррупция контекста — модель дрейфует от исходного намерения
- Исследование дорого — 5 ветвей на шаге 3 требуют последовательного прохода
Что такое адаптивное параллельное рассуждение?
Модель автономно отвечает на три вопроса:
- Нужно ли разделить задачу?
- Сколько параллельных потоков?
- Как объединить результаты?
Реализации: ThreadWeaver и Multiverse.
ThreadWeaver: модель пишет «план распараллеливания» перед генерацией. Если задача требует исследования нескольких гипотез, ThreadWeaver создает N потоков, каждый со своей копией контекста.
Multiverse: подход «мультивселенной» — модель генерирует несколько путей рассуждения одновременно, затем выбирает лучший.
Результаты
| Задача | Sequential | Adaptive Parallel | Ускорение |
|---|---|---|---|
| Multi-file code review | 45s | 12s | 3.75× |
| Math proof verification | 60s | 18s | 3.3× |
| Branching logic analysis | 30s | 8s | 3.75× |
Ключевой инсайт: модель, решающая когда распараллеливать, значительно эффективнее ручных стратегий.