Delta-mem: рабочая память для ИИ-агентов без RAG и раздутых контекстов

2026-06-12

Как дополнение в 0,12% параметров даёт ИИ-агентам непрерывную память — без расширения контекста и сложных RAG-систем. Разбор для бизнеса.

Проблема: агенты забывают

Агент по анализу данных заново загружает уже обработанный контекст. Ассистент по коду теряет нить отладки на третьем шаге. Каждый такой сбой — это задержка, лишние токены и нестабильный рабочий процесс.

Стандартные решения известны: расширить контекстное окно или добавить RAG. Оба подхода работают — до определённого предела. Контекстное окно несёт квадратичные вычислительные затраты и страдает от «контекстного гниения»: модель теряет важные детали под давлением объёма информации, даже если технически поддерживает миллион токенов. RAG решает задачу поиска, но не задачу памяти — он каждый раз заново находит и вставляет, а не сохраняет непрерывность.

Решение: компактная динамическая матрица памяти

Исследователи предложили технику delta-mem — модуль, который сжимает историю взаимодействий агента в динамически обновляемую матрицу фиксированного размера. Базовая модель остаётся нетронутой; модуль добавляет лишь 0,12% параметров — против 76,40% у ведущей альтернативы.

Принцип работы: вместо того чтобы хранить историю как текст или искать её во внешней базе, агент несёт компактное «онлайн-состояние ассоциативной памяти» (OSAM). Матрица обновляется на каждом шаге взаимодействия — без роста контекста, без внешних запросов.

Что это меняет для конкретных задач:

Результат: другой класс надёжности

Na бенчмарках с интенсивным использованием памяти delta-mem превосходит методы, требующие в сотни раз больше дополнительных параметров. Это не просто экономия ресурсов — это принципиально другое поведение агента.

RAG останется важным инструментом для доступа к внешним знаниям. Но для поведенческой непрерывности внутри рабочего сеанса нужна другая архитектура. Delta-mem показывает, в каком направлении она развивается: компактный модуль памяти, который обновляется в реальном времени и не требует переобучения модели.

Для команд, строящих агентные пайплайны сегодня, ключевой вывод простой: разделите задачу поиска знаний и задачу поддержания состояния. Это разные проблемы, и они требуют разных решений.

Опубликовано на ContentRun, внедрение ИИ в маркетинг и продажи. Что мы делаем.