Проблема: пайплайны ломаются при масштабировании
Каждая команда, которая строит AI-продукт, рано или поздно сталкивается с одним и тем же: агентный пайплайн, написанный вручную, хорошо работает на тестах и начинает давать сбои в production. Причина проста — реальные пользователи задают разные вопросы, и статическая маршрутизация не справляется с разнородным потоком запросов.
Добавьте к этому другую проблему: разные LLM хороши в разном. Одна модель лучше рассуждает, другая пишет код, третья сильна в структурированных ответах. Вручную подобрать и зафиксировать идеальную комбинацию для каждого типа запроса — задача без решения.
Решение: модель-оркестратор, обученная через RL
Sakana AI обучила небольшую языковую модель (7B параметров) через reinforcement learning управлять пулом более мощных LLM. Модель получила название RL Conductor.
Prinцип работы прямолинеен:
- Анализирует входящий запрос и разбивает его на подзадачи
- Формирует инструкцию для каждого шага на естественном языке
- Назначает агента из пула — конкретную LLM под конкретную подзадачу
- Управляет контекстом — определяет, какие прошлые ответы видит каждый агент
Топология динамическая: система строит линейные цепочки, параллельные структуры или рекурсивные циклы в зависимости от задачи. Никакого hardcode.
Обучение происходит через пробы и ошибки: модель получает задачу, пул агентов и сигнал вознаграждения — правильность ответа плюс корректность формата. Через итерации она сама обнаруживает, какие комбинации работают для каких классов задач.
Результат: выше качество, ниже затраты
Conductor в тестах превосходит отдельные фронтирные модели и ручные мультиагентные пайплайны на бенчмарках по рассуждению и генерации кода. При этом система делает меньше API-вызовов и обходится дешевле конкурирующих подходов.
Для бизнеса это три конкретных следствия:
- Меньше инженерного времени на поддержку агентной логики
- Адаптивность к реальным данным без переписывания пайплайна
- Оптимизация стоимости за счёт умной маршрутизации к нужной модели
Что это меняет в архитектуре AI-систем
Conductor показывает, что оркестрация — это не конфигурация, а навык. Модель можно обучить принимать решения о маршрутизации лучше, чем это делает человек-разработчик, потому что она оптимизируется на реальных данных, а не на предположениях.
Архитектурный вывод для команд: разделяйте слой оркестрации и слой исполнения с самого начала. Это позволяет улучшать каждый независимо и не переписывать всё при добавлении новой модели в пул.
Hardcoded пайплайны — это не плохо как стартовая точка. Плохо — принимать их за финальное решение.