Проблема: агенты забывают
Агент по анализу данных заново загружает уже обработанный контекст. Ассистент по коду теряет нить отладки на третьем шаге. Каждый такой сбой — это задержка, лишние токены и нестабильный рабочий процесс.
Стандартные решения известны: расширить контекстное окно или добавить RAG. Оба подхода работают — до определённого предела. Контекстное окно несёт квадратичные вычислительные затраты и страдает от «контекстного гниения»: модель теряет важные детали под давлением объёма информации, даже если технически поддерживает миллион токенов. RAG решает задачу поиска, но не задачу памяти — он каждый раз заново находит и вставляет, а не сохраняет непрерывность.
Решение: компактная динамическая матрица памяти
Исследователи предложили технику delta-mem — модуль, который сжимает историю взаимодействий агента в динамически обновляемую матрицу фиксированного размера. Базовая модель остаётся нетронутой; модуль добавляет лишь 0,12% параметров — против 76,40% у ведущей альтернативы.
Принцип работы: вместо того чтобы хранить историю как текст или искать её во внешней базе, агент несёт компактное «онлайн-состояние ассоциативной памяти» (OSAM). Матрица обновляется на каждом шаге взаимодействия — без роста контекста, без внешних запросов.
Что это меняет для конкретных задач:
- Агент разработки кода помнит архитектурные решения, шаги отладки и предпочтения пользователя на протяжении всей сессии
- Агент анализа данных сохраняет предположения и промежуточные наблюдения между вызовами инструментов
- Любой многошаговый агент перестаёт «начинать с нуля» при каждом новом запросе
Результат: другой класс надёжности
Na бенчмарках с интенсивным использованием памяти delta-mem превосходит методы, требующие в сотни раз больше дополнительных параметров. Это не просто экономия ресурсов — это принципиально другое поведение агента.
RAG останется важным инструментом для доступа к внешним знаниям. Но для поведенческой непрерывности внутри рабочего сеанса нужна другая архитектура. Delta-mem показывает, в каком направлении она развивается: компактный модуль памяти, который обновляется в реальном времени и не требует переобучения модели.
Для команд, строящих агентные пайплайны сегодня, ключевой вывод простой: разделите задачу поиска знаний и задачу поддержания состояния. Это разные проблемы, и они требуют разных решений.