RL Conductor: как обучить модель управлять другими моделями

2026-06-15

Как Sakana AI обучила 7B-модель управлять GPT-5, Claude и Gemini: архитектура, принцип работы и выводы для AI-разработки.

Проблема: пайплайны ломаются при масштабировании

Каждая команда, которая строит AI-продукт, рано или поздно сталкивается с одним и тем же: агентный пайплайн, написанный вручную, хорошо работает на тестах и начинает давать сбои в production. Причина проста — реальные пользователи задают разные вопросы, и статическая маршрутизация не справляется с разнородным потоком запросов.

Добавьте к этому другую проблему: разные LLM хороши в разном. Одна модель лучше рассуждает, другая пишет код, третья сильна в структурированных ответах. Вручную подобрать и зафиксировать идеальную комбинацию для каждого типа запроса — задача без решения.

Решение: модель-оркестратор, обученная через RL

Sakana AI обучила небольшую языковую модель (7B параметров) через reinforcement learning управлять пулом более мощных LLM. Модель получила название RL Conductor.

Prinцип работы прямолинеен:

Топология динамическая: система строит линейные цепочки, параллельные структуры или рекурсивные циклы в зависимости от задачи. Никакого hardcode.

Обучение происходит через пробы и ошибки: модель получает задачу, пул агентов и сигнал вознаграждения — правильность ответа плюс корректность формата. Через итерации она сама обнаруживает, какие комбинации работают для каких классов задач.

Результат: выше качество, ниже затраты

Conductor в тестах превосходит отдельные фронтирные модели и ручные мультиагентные пайплайны на бенчмарках по рассуждению и генерации кода. При этом система делает меньше API-вызовов и обходится дешевле конкурирующих подходов.

Для бизнеса это три конкретных следствия:

  1. Меньше инженерного времени на поддержку агентной логики
  2. Адаптивность к реальным данным без переписывания пайплайна
  3. Оптимизация стоимости за счёт умной маршрутизации к нужной модели

Что это меняет в архитектуре AI-систем

Conductor показывает, что оркестрация — это не конфигурация, а навык. Модель можно обучить принимать решения о маршрутизации лучше, чем это делает человек-разработчик, потому что она оптимизируется на реальных данных, а не на предположениях.

Архитектурный вывод для команд: разделяйте слой оркестрации и слой исполнения с самого начала. Это позволяет улучшать каждый независимо и не переписывать всё при добавлении новой модели в пул.

Hardcoded пайплайны — это не плохо как стартовая точка. Плохо — принимать их за финальное решение.

Опубликовано на ContentRun, внедрение ИИ в маркетинг и продажи. Что мы делаем.