R2.4:Tasks4 - Готовим объяснение из руководства R2. Моделирование как основа коммуникации и лидерства

Тема исследования

Какой должна быть эффективная архитектура памяти ИИ-агента?

Найдите 2-3 гипотезы (варианты объяснения)

  1. Похожей на человеческую: делится на кратковременную и долговременную, при вспоминании “переупаковывается”, со временем деградирует. Природа (условный создатель) уже потратила достаточно усилий на создание именно такой памяти, и её можно просто переиспользовать на том основании, что это уже проверенное решение.
  2. Не похожей на человеческую, но использующей сильные стороны современных технологических достижений: помнит всё в мелочах, не деградирует со временем, обогащается автоматически выявляемыми связями, переиспользуется между индивидами (ИИ-агентами) при наличии доступа. Современные технологии вполне позволяют хранить всю информацию о важных объектах внимания без потерь, и нет смысла идти на компромисс, жертвуя точностью для экономии ресурсов. Оптимизировать память можно исходя из потребностей ИИ-агента, а не его когнитивной мощности.
  3. Если озадачить передового кодинг-агента спроектировать и реализовать архитектуру памяти для ИИ-агента под сценарии использования агента с оптимизацией метрик (использования GPU, CPU, RAM и HDD), то можно получить оптимальное решение, которое на данном этапе даже сложно вообразить.

Начните доэкспериментальную аргументацию - выявите допущения, начните искать причинно-следственные связи, важные для вашего объяснения в контексте выдвинутых гипотез

  1. Кратковременная память ограничена временем (1-3 дня), и хотя она включает в себя все “сырые” факты и события без обработки, её размер ограничен и не растёт бесконтрольно. Поэтому технически это реализуемо без проблем.

  2. Во время простоя (ночью) происходит отложенная переработка кратковременной памяти, лишние (неважные) факты и события удаляются, а важные обогащаются связями с релевантными объектами, упаковываются компактно и добавляются к долговременной памяти. Поэтому плотность записи долговременной памяти значительно выше, так что это тоже реализуемо без проблем.

  3. При вспоминании фактов происходит извлечение их из памяти и переупаковка, похожая на п.2, в ходе которой неважное удаляется, а важное обогащается актуальными связями и пересохраняется.

  4. При переупаковке памяти, а такэе при извлечении данных из неё для поиска релевантных объектов (помимо явно связанных в том же контексте) будет достаточно технологий семантического сходства (по косинусному расстоянию векторов) и BM25, потому что они сейчас считаются лучшими в своей области.

  5. Память лучше хранить в текстовом виде, потому что с ним понятно как работать и как проверять контент.

  6. Память лучше хранить в виде образов, потому что именно так она хранится у человека в голове (или не в голове, но сейчас это не важно). Однако непонятно, какова структура образа и как его сохранять, так что потребуется сперва понять, как с ним работать.

  7. Поскольку эта тема довольно актуальная, то возможно, что лучшее решение уже существует, и можно просто найти его на гитхабе и переиспользовать вместо того чтобы тратить на разработку своё время.

Подготовьте совместно отчёт о начатом исследовании и разместите его в клубе МИМ

Проведено исследование актуального состояния архитектур памяти ИИ-агентов. На основе анализа существующих решений (Mem0, Letta, Zep, ReMe) и научных публикаций выдвинуты дополнительные гипотезы, касающиеся гибридных подходов, механизмов забывания, мультиагентной памяти и формата хранения. Систематизированы аргументы за и против различных подходов к проектированию памяти.

Дополнительные гипотезы

Гипотеза 4: Гибридная архитектура памяти

Современные исследования показывают, что оптимальная архитектура памяти ИИ-агента должна комбинировать несколько подходов: векторное хранилище для семантического поиска, графовую базу данных для связей между сущностями, и файловую систему для структурированных данных. Исследование “Vector Databases vs. Graph RAG for Agent Memory” (MachineLearningMastery, 2025) демонстрирует, что векторные базы данных лучше подходят для поиска по сходству и работы с неструктурированными данными, в то время как Graph RAG эффективен при ограниченных контекстных окнах и необходимости многоходовых связей.

Пример: Mem0 использует векторное хранилище как основу, но предлагает расширение с графовой памятью для представления сложных реляционных структур. Согласно бенчмаркам на LOCOMO, Mem0 с графовой памятью показывает ~2% улучшение общего скора по сравнению с базовой конфигурацией.

Гипотеза 5: Механизм «интеллектуального забывания» обязателен

Ряд исследований указывает на то, что память без механизма забывания деградирует со временем. Статья “The Forgetting Problem: When Unbounded Agent Memory Degrades Performance” (Tian Pan, 2026) выделяет четыре механизма отказа систем памяти:

  1. Накопление шума (система захламляется нерелевантной информацией)
  2. Конфликт фактов (устаревшие данные противоречат актуальным)
  3. Рост латентности (чем больше память, тем медленнее поиск)
  4. Рост стоимости (увеличение токенов для RAG)

Исследование FadeMem (Huang et al.) предлагает математическую модель забывания на основе «удивления» (surprise metric), аналогичную подходу Google Titans. Система SCM (Sleep-Consolidated Memory) реализует пятикомпонентную архитектуру, вдохновлённую нейронаукой: рабочая память ограниченной ёмкости, многомерная оценка важности, консолидация офлайн (NREM/REM фазы), преднамеренное забывание на основе ценности.

Гипотеза 6: Архитектура памяти должна учитывать сценарий использования

Не существует универсальной архитектуры памяти. Для разных сценариев оптимальны разные подходы:

  • Персональные ассистенты: акцент на персонализации и долговременной памяти о пользователе
  • Кодинг-агенты: процедурная память (запоминание паттернов кода, инструментов)
  • Мультиагентные системы: общая/распределённая память
  • Интерактивные агенты: эпизодическая память (контекст диалогов)

Исследование “The 5 Types of AI Agent Memory Every Developer Needs to Know” выделяет: working memory, episodic memory, semantic memory, procedural memory.

Гипотеза 7: Периодическая консолидация (аналог «сна»)

Концепция консолидации памяти во время простоя (аналог человеческого сна) поддерживается несколькими исследованиями. Система autoDream (TheClaw Tips) реализует 4-фазный пайплайн:

  1. Оценка важности событий за день
  2. Выявление конфликтов между воспоминаниями
  3. Консолидация (объединение, удаление, обновление)
  4. Переупаковка в компактную форму

Google’s Titans использует «метрику удивления» для принятия решения о долгосрочном хранении. По умолчанию консолидация запускается каждые 30 минут или при накоплении порогового количества новых событий.

Гипотеза 8: Разделяемая память для мультиагентных систем

Статья “Multi-Agent Memory from a Computer Architecture Perspective” (Yu & Zhao, ASPLOS 2026) предлагает рассматривать память мультиагентных систем через призму компьютерной архитектуры:

  • Трёхуровневая иерархия: I/O (контекстное окно), cache (кратковременная память), memory (долговременная память)
  • Две критические проблемы: shared cache между агентами и structured memory access control
  • Ключевой вызов: multi-agent memory consistency

Для мультиагентных систем рекомендуется:

  • Shared memory: централизованное хранилище для общей информации
  • Distributed memory: локальная память каждого агента с механизмом синхронизации

Гипотеза 9: Текстовый формат не оптимален, но достаточен

Хотя текстовый формат удобен для отладки и интерпретации, исследования показывают преимущества структурированных форматов:

  • Graphiti (Neo4j- backed) использует временные графы знаний
  • ReMe поддерживает файловую и векторную память
  • O-Mem (Omni Memory System) предлагает структурированную память с самоэволюцией

Однако текстовый формат остаётся стандартом де-факто благодаря совместимости с LLM и простоте реализации.

Аргументы за и против

Аргументы по Гипотезе 1 (похожая на человеческую)

За:

  • Биологическая эволюция уже протестировала эту модель
  • Человеческая память адаптирована к ограниченным когнитивным ресурсам
  • Механизмы забывания предотвращают захламление
  • Переупаковка (консолидация) повышает эффективность

Против:

  • Ограничения человеческой памяти — результат биологических ограничений, не применимых к ИИ
  • LLM могут обрабатывать значительно большие объёмы данных
  • Деградация памяти может приводить к потере важной информации
  • Человеческая память подвержена искажениям и ложным воспоминаниям

Аргументы по Гипотезе 2 (непохожая на человеческую)

За:

  • Технологии позволяют хранить практически неограниченные объёмы информации
  • Отсутствие деградации обеспечивает полную точность
  • Автоматическое выявление связей (Graph RAG)
  • Возможность переиспользования памяти между агентами

Против:

  • Рост объёма памяти увеличивает латентность и стоимость
  • Информационный шум снижает качество ответов
  • Сложность определения релевантности без механизма приоритизации
  • Проблема устаревших данных (факты могут становиться неверными)

Аргументы по Гипотезе 3 (оптимизация под метрики)

За:

  • Промышленный подход, ориентированный на production
  • Возможность точной настройки под аппаратные ограничения
  • Измеримые результаты (время отклика, использование ресурсов)

Против:

  • Оптимизация под метрики может ухудшить пользовательский опыт
  • Сложность предсказания всех сценариев использования
  • Риск преждевременной оптимизации

Аргументы по Гипотезе 4 (гибридная архитектура)

За:

  • Комбинирует сильные стороны разных подходов
  • Гибкость для разных сценариев
  • Лучшие результаты на бенчмарках (Mem0 + Graph)

Против:

  • Повышенная сложность реализации
  • Большие требования к ресурсам
  • Сложность поддержки и отладки

Аргументы по Гипотезе 5 (механизм забывания)

За:

  • Предотвращает накопление шума
  • Снижает стоимость и латентность
  • Имитирует успешную биологическую модель
  • Исследование показывает 90.9% снижение шума памяти (SCM)

Против:

  • Риск удаления важной информации
  • Сложность определения порога «важности»
  • Требует дополнительных вычислительных ресурсов

Существующие решения для реализации

Решение Тип Лицензия Ключевые особенности
Mem0 Векторное + Графовое Apache 2.0 Лидер по бенчмаркам (LoCoMo, LongMemEval), SOC 2, HIPAA
Letta (MemGPT) Эпизодическое MIT Self-editing memory, page-in/page-out
Zep Векторное Proprietary Долговременная память с автоматической категоризацией
ReMe Гибридное Apache 2.0 Файловое и векторное, SOTA на LoCoMo и HaluMem
Graphiti Графовое Proprietary Временные графы знаний
LangMem Векторное MIT Интеграция с LangChain

Ключевые бенчмарки

  • LoCoMo: Оценка долговременной контекстной памяти
  • LongMemEval: Оценка долговременной памяти
  • BEAM: Оценка памяти и контекста
  • HaluMem: Оценка эпизодической памяти

Выводы по бенчмаркам

  1. Гибридная архитектура (векторная + графовая) показывает лучшие результаты
  2. Механизм «интеллектуального забывания» необходим для production-систем
  3. Периодическая консолидация (аналог «сна») повышает качество памяти
  4. Для мультиагентных систем требуется специализированная архитектура с учётом консистентности
  5. Текстовый формат остаётся стандартом, но графовые структуры дают преимущества для сложных связей

Вывод

На основе проведённого исследования можно сделать следующие выводы:

  1. Гибридный подход наиболее перспективен: Комбинация векторного поиска (для семантического сходства) и графового представления (для связей между сущностями) показывает лучшие результаты на современных бенчмарках.

  2. Механизм забывания обязателен: Системы с неограниченной памятью деградируют. Необходим механизм оценки важности, консолидации и удаления нерелевантной информации.

  3. Периодическая консолидация эффективна: Аналог «сна» с консолидацией воспоминаний повышает качество долговременной памяти и снижает информационный шум.

  4. Архитектура зависит от сценария: Универсального решения не существует — для разных задач оптимальны разные подходы (персональные ассистенты, кодинг-агенты, мультиагентные системы).

  5. Для мультиагентных систем требуется специальная архитектура: Необходимо учитывать проблемы консистентности, синхронизации и разделяемой памяти.

  6. Рекомендуется использовать существующие решения: Mem0, Letta, Zep и другие фреймворки предоставляют готовые реализации, проверенные на бенчмарках. Создание собственного решения оправдано только при наличии специфических требований.

  7. Гипотеза пользователя о том, что «природа уже потратила достаточно усилий» — частично подтверждается: Биологические принципы (забывание, консолидация, иерархия) действительно эффективны, но современные технологии позволяют расширить возможности за счёт полного хранения данных и автоматического выявления связей.

Источники

Основной вопрос к самой теме исследования: что такое тут “эффективная”, “оптимальная”? Кажется, что исследование отвечало на другой вопрос - “какой могла бы быть память?”.

“эффективная” = дающая требуемый уровень качества при минимальном потреблении ресурсов.

Согласен, что стоит более узко обозначить рамки использования. Предполагал два варианта:

  1. Личный ИИ-ассистент, даже скорее напарник.
  2. Сообщество корпоративных ИИ-агентов.

Позже укажу, какой вариант тут рассматриваю. Скорее первый.

даже в информатике (навскидку) у вас есть 2 фундаментальных ресурса:

  • вычисления
  • память

или у вас много памяти, но медленные вычисления - тогда вы делаете ленивые, отложенные вычисления, занимаетесь кешированием и мемоизацией.
или у вас мало памяти но быстрые вычисления - тогда вы генерируете не лету все, минимально используя память (демосцена 64k).

случаи конечно искусственные и крайние, но они для демонстрации что даже на 2-х ресурсах вам надо уже выбирать направление и способы оптимизации решения.
или вспомнил - на спутнике (не помню как называется) который уже далеко отлетел от земли инженеры код чинили чтобы вернуть управление. так там они сильно ограничены по памяти, процессору и скорости связи. и вроде даже получилось починить. история по новостям проходила (по ощущениям) не более 5 лет назад.

Да, всё так. Я именно эти ресурсы имел в виду. В посте не расписывал, чтобы не рассеивать внимание.

Так что тему этого исследования (“Какой должна быть эффективная архитектура памяти ИИ-агента?”) можно более подробно сформулировать так:

Какой должна быть архитектура памяти ИИ-агента, выступающего в роли персонального ассистента-напарника, чтобы при уровне способностей, сравнимым с человеческим, для работы этой памяти в течение ~года требовались минимально возможные ресурсы (cpu, mem, БД, LLM и другие модели), выраженные в деньгах?

Ну там же рассуждения при нескольких шкалах и силах, которые тянут в разные стороны, должны быть про Парето-фронт и доминирование. FPF это отличненько поддерживает, надо только спросить - это же NQD OEE (техноэволюция памяти).

1 лайк

Всё так.

Исследование на шаге 3 (дополнительные гипотезы, сравнение и выводы) сделаны совместно с ИИ-агентом, действующим по FPF (правда, несколькомесячной давности). Подробности остались за кулисами, тут только результат.
Выводы не очень конкретные, потому что проблема обозначена довольно широко.

В целом использование не просто LLM/ИИ-агента, а его же с модуляцией через FPF - это уже типичный workflow для меня. Причём варианты использования FPF - разные в зависимости от ситуации:

  1. Карманный ИИ-агент-исследователь со встроенным скиллом FPF, как в этом посте
  2. Кодинг-агент (OpenCode, Cursor, etc) со скиллом FPF на базе более свежей спецификации FPF
  3. Кодинг-агент со скиллами Haft на основе FPF
  4. Кодинг-агент с поиском по свежему файлу оригинальной спецификации FPF (в меру способностей агента)
  5. (в разработке) Персональный ИИ-агент-решала проблем на основе свежей оригинальной спецификации FPF с работой по трём вложенным циклам с динамическим выбором применимых паттернов в зависимости от текущего шага мышления: