Проблема: текстовое узкое горло
Многоагентные системы стали стандартом для решения сложных задач — от генерации кода до анализа медицинских данных. Но у них есть структурный изъян, который усиливается с масштабом: агенты общаются через текст.
Каждый агент ждёт, пока предыдущий сгенерирует ответ. Промежуточные рассуждения записываются в токены только для того, чтобы следующая модель их «прочитала». Результат — очереди, задержки и раздутые затраты на токены, которые растут вместе с числом агентов.
Для бизнеса это означает: больше агентов не всегда равно лучше. После определённой точки система становится медленнее и дороже, не давая пропорционального прироста качества.
Решение: латентная коммуникация
RecursiveMAS — фреймворк, разработанный исследователями из Иллинойса и Стэнфорда, который меняет протокол взаимодействия агентов. Вместо текста агенты передают друг другу непрерывные латентные представления — векторы из внутреннего пространства модели.
Архитектура работает по принципу рекурсивных языковых моделей: каждый агент выступает как «слой», который обрабатывает скрытое состояние и передаёт его дальше. Никакой промежуточной текстовой генерации — только финальный ответ на выходе системы.
Ключевое отличие от классических подходов: вся система обучается как единое целое. Не каждый агент отдельно, а сквозная оптимизация от входа до финального результата.
Результаты
Экспериментальные данные показывают:
- Скорость инференса выросла в 2,4 раза
- Использование токенов сократилось на 75%
- Точность улучшилась на задачах генерации кода, медицинского рассуждения и поиска
- Стоимость обучения ниже, чем у стандартного fine-tuning и LoRA
Для бизнеса, который строит агентные системы в продакшне, это меняет экономику: та же или лучшая точность при кратно меньших затратах на вычисления.
Что это значит для практики
RecursiveMAS пока исследовательский проект, но он задаёт вектор развития агентных фреймворков. Текстовая коммуникация между агентами — это не стандарт, а временное решение, которое будет вытесняться.
Уже сейчас при проектировании агентных пайплайнов стоит:
- Минимизировать промежуточные текстовые ответы между агентами
- Использовать структурированные форматы передачи данных вместо натурального языка
- Оценивать качество системы как целого, а не по отдельным агентам
- Закладывать совместное обучение в архитектуру с самого начала
Те, кто начнёт думать об агентных системах как о едином обучаемом организме, а не наборе отдельных моделей, окажутся в выигрышной позиции по мере появления production-версий таких фреймворков.