В современном мире оценки долгосрочной памяти для агентов на основе больших языковых моделей (LLM) традиционно фокусируются на бенчмарках разговорного отзыва, таких как LoCoMo и LongMemEval. Эти методы измеряют способность агента отвечать на вопросы, основываясь на истории диалога, но не дают представления о том, как запомненные факты фактически влияют на действия агента, использующего инструменты. Для решения этой проблемы было представлено новое исследование под названием MERIT (Memory Evaluation for Realistic Instrumented Tasks). MERIT представляет собой бенчмарк и инструментарий, который оценивает предельную полезность памяти для агентов, выполняющих задачи, с явным учётом затрат. Это позволяет понять, как память влияет на принятие решений и действия агентов в реальных сценариях.

Методология и структура MERIT

MERIT включает в себя эпизодические задачи по использованию инструментов в трёх различных областях. Зависимость этих задач от фактов из предыдущих эпизодов тщательно проверяется с помощью автоматизированной проверки на утечки данных. Бенчмарк также включает «лестницу сложности», которая завершается отзывом обновлённых фактов, а также контролируемое повреждение памяти. Важной особенностью MERIT является полный учёт токенов и долларовых затрат для каждой операции с памятью, что позволяет точно оценить экономическую эффективность различных подходов к управлению памятью.

В рамках пилотного исследования было проведено 23 440 эпизодов, общая стоимость которых составила 42,57 доллара. В нём участвовали модели gpt-4.1-mini двух поколений. Затем было проведено предварительно зарегистрированное исследование с использованием сетки 3 модели x 3 сида (GPT-4.1, Claude Haiku 4.5), при этом сторона памяти оставалась фиксированной. Результаты показали, что память повышает успешность выполнения зависимых задач с проверенного на утечки базового уровня 0,00 до 0,55-1,00.

Проблемы с обновлёнными фактами и эффективность различных подходов к памяти

При работе с обновлёнными фактами извлечение встраиваний показало непредсказуемые результаты, варьируясь от 0,30 до 0,95 между моделями, с максимальным разрывом между сидами в 0,45. Агенты действовали на основе правильно извлечённого значения только в 55% случаев. В то же время, хранилища с обновлением при записи (структурированное хранилище фактов и, в частности, суммаризация LLM) сохраняли эффективность на уровне 0,70-1,00. Гибридный подход оказался хуже, чем использование только хранилища фактов.

Недавняя выборочная проверка с использованием Claude Sonnet 5 (с контролем чистого полного воспроизведения) подтвердила выявленные закономерности. Замена реализации памяти может изменить успешность выполнения задачи до 60 пунктов. Полное воспроизведение никогда не оказывается экономически выгодным: лучшие условия для каждой области обеспечивают в 2,7-3,9 раза большую предельную полезность на доллар. Исследователи опубликовали бенчмарк, инструментарий и все трассировки, что позволит другим исследователям воспроизводить и развивать эти результаты.

Источник: cs.AI updates on arXiv.org