Процедурная память снижает затраты и сложность агентов ИИ
Новая методика, разработанная Чжэцзянским университетом и Alibaba Group, наделяет агентов с большой языковой моделью (LLM) динамической памятью, что повышает их эффективность и результативность при решении сложных задач. Этот подход, получивший название Memp, обеспечивает агентов "процедурной памятью", которая постоянно обновляется по мере накопления опыта, зеркально отражая то, как человек учится в процессе многократной практики.
Memp создает систему непрерывного обучения, в которой агентам больше не нужно начинать с нуля при выполнении каждой новой задачи. По мере того как они сталкиваются с новыми сценариями в реальных условиях, они неуклонно совершенствуются и становятся более эффективными, что очень важно для надежной автоматизации предприятий.
Важность процедурной памяти в агентах ИИ
Агенты LLM демонстрируют огромный потенциал для автоматизации сложных, многоэтапных бизнес-операций. Однако на практике такие расширенные задачи могут быть подвержены сбоям. Исследователи подчеркивают, что неожиданные проблемы, такие как перебои в работе сети, обновление пользовательского интерфейса или изменение формата данных, могут нарушить весь рабочий процесс. В настоящее время это часто заставляет агентов каждый раз начинать все с начала, что приводит к задержкам и увеличению расходов.
В то же время многие сложные задачи, хотя и кажутся разными на первый взгляд, имеют общие структурные особенности. Как подчеркивают исследователи, вместо того чтобы каждый раз заново изучать эти шаблоны, агент должен уметь использовать свой прошлый опыт - как успешный, так и неудачный. Для этого необходима специализированная "процедурная память", подобная человеческой долговременной памяти на такие навыки, как печатание на машинке или езда на велосипеде, которые становятся второй натурой при многократном повторении.

Начать с нуля (вверху) и использовать процедурную память (внизу) (источник: arXiv) Большинство современных агентных систем лишены этой функциональности. Их процедурные знания обычно программируются разработчиками вручную, хранятся в негибких шаблонах подсказок или встроены в параметры модели, которые дорого и медленно модифицировать. Даже существующие фреймворки с улучшенной памятью предлагают лишь широкие абстракции и не учитывают должным образом то, как навыки должны развиваться, индексироваться, уточняться и управляться на протяжении всего жизненного цикла агента.
Как утверждают исследователи в своей статье, "не существует принципиального способа количественно оценить, насколько эффективно агент развивает свой процедурный репертуар, или гарантировать, что новый опыт улучшает, а не снижает производительность".
Как работает Memp
Memp - это система, не зависящая от задач, которая рассматривает процедурную память как фундаментальный, оптимизируемый компонент. Она работает через три основных этапа, которые образуют непрерывный цикл: создание, извлечение и обновление памяти.
Воспоминания формируются на основе прошлого опыта агента, или "траектории". Команда исследовала возможность хранения этих воспоминаний в двух формах: либо в виде точных, пошаговых действий, либо путем обобщения этих действий в виде абстракций более высокого уровня, похожих на сценарии. При получении новой задачи агент ищет в памяти наиболее релевантный предыдущий опыт. Исследователи протестировали различные методы, включая векторный поиск для согласования описания новой задачи с прошлыми запросами или извлечение ключевых слов для поиска наиболее близкого соответствия.
Механизм обновления - самый важный элемент. В Memp реализовано несколько стратегий, обеспечивающих развитие памяти агента. По мере того как агент выполняет все новые задачи, его память может обновляться путем добавления нового опыта, фильтрации только успешных результатов или - что наиболее эффективно - путем анализа неудач для исправления и улучшения первоначальной памяти.

Фреймворк Memp (источник: arXiv) Этот акцент на динамической, адаптируемой памяти вписывает Memp в растущую область исследований, направленных на повышение надежности ИИ-агентов при выполнении долгосрочных заданий. Этот проект совпадает с другими инициативами, такими как Mem0, который извлекает важную информацию из длинных разговоров и организует ее в структурированные факты и графы знаний для поддержания последовательности. Аналогичным образом, A-MEM позволяет агентам автономно генерировать и соединять "заметки памяти" из своих взаимодействий, создавая со временем сложную сеть знаний.
Тем не менее, соавтор Руннан Фанг указывает на важное отличие Memp от аналогичных фреймворков.
"Mem0 и A-MEM - отличные работы... но они сосредоточены на запоминании значимого контента в рамках одной траектории или разговора, - пояснил Фанг в интервью VentureBeat. По сути, они помогают агенту вспомнить, "что" произошло. "Memp, напротив, нацелена на межтраекторную процедурную память". Она концентрируется на знаниях "как сделать", которые могут применяться для решения сопоставимых задач, избавляя агента от необходимости снова и снова начинать с нуля.
"Перерабатывая прошлые успешные рабочие процессы в многократно используемые процедурные предыстории, Memp повышает процент успеха и сокращает количество шагов", - продолжает Фанг. "Важно отметить, что мы также внедрили механизм обновления, чтобы эта процедурная память постоянно совершенствовалась - в конце концов, практика делает агентов совершенными".
Преодоление проблемы холодного старта
Хотя обучение на прошлом опыте - это мощная концепция, она ставит перед нами практическую задачу: как агенту развить свою первоначальную память, если нет безупречных примеров? Исследовательская группа решает эту проблему "холодного старта" с помощью практического решения.
Фанг рассказал, как разработчики могут начать с определения надежной метрики оценки вместо того, чтобы с самого начала требовать идеальной "золотой" траектории. Эта метрика, которая может быть основана на правилах или на другом LLM, оценивает качество работы агента. "Как только эта метрика создана, мы позволяем современным моделям исследовать рабочий процесс агента и сохраняем траектории, получившие наивысшие оценки", - говорит Фанг. Этот метод быстро собирает начальную коллекцию ценных воспоминаний, позволяя новому агенту стать опытным без длительного ручного кодирования".
Memp в действии
Чтобы оценить фреймворк, команда интегрировала Memp с ведущими LLM, такими как GPT-4o, Claude 3.5 Sonnet и Qwen2.5, протестировав их на таких сложных задачах, как работа по дому в бенчмарке ALFWorld и сбор информации в TravelPlanner. Результаты показали, что благодаря формированию процедурной памяти и доступу к ней агент может эффективно обобщать и повторно использовать свой предыдущий опыт.
В ходе тестирования агенты, использующие Memp, не только достигли более высоких показателей успешности, но и работали гораздо эффективнее. Они отказались от непродуктивных поисков и догадок, значительно сократив количество шагов и расход маркеров, необходимых для выполнения задачи.

Использование процедурной памяти (справа) позволяет агентам выполнять задания за меньшее количество шагов и сократить использование токенов (источник: arXiv). Особенно примечательным открытием для использования в бизнесе является то, что процедурную память можно передавать. В одном из тестов процедурная память, созданная мощным GPT-4o, была передана гораздо меньшей модели, Qwen2.5-14B. Производительность меньшей модели заметно улучшилась, увеличился процент успеха и сократилось количество шагов, необходимых для выполнения задач.
По мнению Фанга, это стало возможным потому, что маленькие модели обычно хорошо справляются с простыми одношаговыми действиями, но испытывают трудности с долгосрочным планированием и рассуждениями. Процедурная память более крупной модели эффективно преодолевает этот разрыв. Это означает, что знания могут быть накоплены с помощью модели высшего уровня, а затем применены к меньшим, более бюджетным моделям без ущерба для преимуществ накопленного опыта.
Продвижение к полностью автономным агентам
Благодаря интеграции функций обновления памяти фреймворк Memp позволяет агентам постоянно развивать и совершенствовать свои процедурные знания в процессе работы в реальных условиях. Исследователи заметили, что это дает агенту "непрерывное, почти линейное освоение задачи".
Однако достижение полной автономии сталкивается с еще одним препятствием: многие реальные задачи, такие как создание отчета об исследовании, не имеют четкого индикатора успеха. Чтобы продолжать совершенствоваться, агент должен знать, насколько удовлетворительной была его работа. Фанг считает, что решение проблемы кроется в использовании LLM в качестве оценщиков.
"Сегодня мы часто сочетаем мощные модели с правилами, составленными вручную, чтобы вычислить баллы за завершение работы", - замечает он. "Это работает, но написанные вручную правила негибки и трудно обобщаются".
LLM, выступающий в роли судьи, мог бы предложить подробную, контролирующую обратную связь, необходимую агенту для самокоррекции при выполнении сложных, субъективных заданий. Это сделает весь процесс обучения более масштабируемым и устойчивым, что станет важным шагом на пути к созданию долговечных, гибких и по-настоящему автономных работников ИИ, необходимых для передовой автоматизации предприятий.
Связанная статья
Base44 представляет собственную модель искусственного интеллекта для усиления защищенности платформы для кодинга в стиле «vibe».
Base44, платформа для «вайб-кодинга», приобретённая Wix за 80 миллионов долларов всего год назад — когда ей было всего шесть месяцев и в команде состояло восемь человек, — начала развертывание собственной модели искусственного интеллекта, чтобы помоч
Компания «Байер» использует технологию Iambic AI для ускорения разработки лекарственных препаратов
Доктор Юрген Экхардт занимает должность руководителя отдела развития бизнеса и лицензирования в компании «Байер Фарма».Компания «Байер» использует возможности компании Iambic Therapeutics для внедрени
Multiverse Computing запускает бесплатную сжатую генеративную модель искусственного интеллекта
Крупные языковые модели сталкиваются с серьезной проблемой: их огромный размер. Испанский стартап Multiverse Computing решает эту проблему, создавая сжатые модели, призванные преодолеть разрыв между в
Рекомендации по связанным специальным темам
Комментарии (2)
Interesting approach! Giving LLMs a memory system could be a game-changer for automating complex workflows. I wonder how the cost savings compare to other optimization methods out there. The collaboration between academia and industry on this is promising. 🧠
Новая методика, разработанная Чжэцзянским университетом и Alibaba Group, наделяет агентов с большой языковой моделью (LLM) динамической памятью, что повышает их эффективность и результативность при решении сложных задач. Этот подход, получивший название Memp, обеспечивает агентов "процедурной памятью", которая постоянно обновляется по мере накопления опыта, зеркально отражая то, как человек учится в процессе многократной практики.
Memp создает систему непрерывного обучения, в которой агентам больше не нужно начинать с нуля при выполнении каждой новой задачи. По мере того как они сталкиваются с новыми сценариями в реальных условиях, они неуклонно совершенствуются и становятся более эффективными, что очень важно для надежной автоматизации предприятий.
Важность процедурной памяти в агентах ИИ
Агенты LLM демонстрируют огромный потенциал для автоматизации сложных, многоэтапных бизнес-операций. Однако на практике такие расширенные задачи могут быть подвержены сбоям. Исследователи подчеркивают, что неожиданные проблемы, такие как перебои в работе сети, обновление пользовательского интерфейса или изменение формата данных, могут нарушить весь рабочий процесс. В настоящее время это часто заставляет агентов каждый раз начинать все с начала, что приводит к задержкам и увеличению расходов.
В то же время многие сложные задачи, хотя и кажутся разными на первый взгляд, имеют общие структурные особенности. Как подчеркивают исследователи, вместо того чтобы каждый раз заново изучать эти шаблоны, агент должен уметь использовать свой прошлый опыт - как успешный, так и неудачный. Для этого необходима специализированная "процедурная память", подобная человеческой долговременной памяти на такие навыки, как печатание на машинке или езда на велосипеде, которые становятся второй натурой при многократном повторении.

Большинство современных агентных систем лишены этой функциональности. Их процедурные знания обычно программируются разработчиками вручную, хранятся в негибких шаблонах подсказок или встроены в параметры модели, которые дорого и медленно модифицировать. Даже существующие фреймворки с улучшенной памятью предлагают лишь широкие абстракции и не учитывают должным образом то, как навыки должны развиваться, индексироваться, уточняться и управляться на протяжении всего жизненного цикла агента.
Как утверждают исследователи в своей статье, "не существует принципиального способа количественно оценить, насколько эффективно агент развивает свой процедурный репертуар, или гарантировать, что новый опыт улучшает, а не снижает производительность".
Как работает Memp
Memp - это система, не зависящая от задач, которая рассматривает процедурную память как фундаментальный, оптимизируемый компонент. Она работает через три основных этапа, которые образуют непрерывный цикл: создание, извлечение и обновление памяти.
Воспоминания формируются на основе прошлого опыта агента, или "траектории". Команда исследовала возможность хранения этих воспоминаний в двух формах: либо в виде точных, пошаговых действий, либо путем обобщения этих действий в виде абстракций более высокого уровня, похожих на сценарии. При получении новой задачи агент ищет в памяти наиболее релевантный предыдущий опыт. Исследователи протестировали различные методы, включая векторный поиск для согласования описания новой задачи с прошлыми запросами или извлечение ключевых слов для поиска наиболее близкого соответствия.
Механизм обновления - самый важный элемент. В Memp реализовано несколько стратегий, обеспечивающих развитие памяти агента. По мере того как агент выполняет все новые задачи, его память может обновляться путем добавления нового опыта, фильтрации только успешных результатов или - что наиболее эффективно - путем анализа неудач для исправления и улучшения первоначальной памяти.

Этот акцент на динамической, адаптируемой памяти вписывает Memp в растущую область исследований, направленных на повышение надежности ИИ-агентов при выполнении долгосрочных заданий. Этот проект совпадает с другими инициативами, такими как Mem0, который извлекает важную информацию из длинных разговоров и организует ее в структурированные факты и графы знаний для поддержания последовательности. Аналогичным образом, A-MEM позволяет агентам автономно генерировать и соединять "заметки памяти" из своих взаимодействий, создавая со временем сложную сеть знаний.
Тем не менее, соавтор Руннан Фанг указывает на важное отличие Memp от аналогичных фреймворков.
"Mem0 и A-MEM - отличные работы... но они сосредоточены на запоминании значимого контента в рамках одной траектории или разговора, - пояснил Фанг в интервью VentureBeat. По сути, они помогают агенту вспомнить, "что" произошло. "Memp, напротив, нацелена на межтраекторную процедурную память". Она концентрируется на знаниях "как сделать", которые могут применяться для решения сопоставимых задач, избавляя агента от необходимости снова и снова начинать с нуля.
"Перерабатывая прошлые успешные рабочие процессы в многократно используемые процедурные предыстории, Memp повышает процент успеха и сокращает количество шагов", - продолжает Фанг. "Важно отметить, что мы также внедрили механизм обновления, чтобы эта процедурная память постоянно совершенствовалась - в конце концов, практика делает агентов совершенными".
Преодоление проблемы холодного старта
Хотя обучение на прошлом опыте - это мощная концепция, она ставит перед нами практическую задачу: как агенту развить свою первоначальную память, если нет безупречных примеров? Исследовательская группа решает эту проблему "холодного старта" с помощью практического решения.
Фанг рассказал, как разработчики могут начать с определения надежной метрики оценки вместо того, чтобы с самого начала требовать идеальной "золотой" траектории. Эта метрика, которая может быть основана на правилах или на другом LLM, оценивает качество работы агента. "Как только эта метрика создана, мы позволяем современным моделям исследовать рабочий процесс агента и сохраняем траектории, получившие наивысшие оценки", - говорит Фанг. Этот метод быстро собирает начальную коллекцию ценных воспоминаний, позволяя новому агенту стать опытным без длительного ручного кодирования".
Memp в действии
Чтобы оценить фреймворк, команда интегрировала Memp с ведущими LLM, такими как GPT-4o, Claude 3.5 Sonnet и Qwen2.5, протестировав их на таких сложных задачах, как работа по дому в бенчмарке ALFWorld и сбор информации в TravelPlanner. Результаты показали, что благодаря формированию процедурной памяти и доступу к ней агент может эффективно обобщать и повторно использовать свой предыдущий опыт.
В ходе тестирования агенты, использующие Memp, не только достигли более высоких показателей успешности, но и работали гораздо эффективнее. Они отказались от непродуктивных поисков и догадок, значительно сократив количество шагов и расход маркеров, необходимых для выполнения задачи.

Особенно примечательным открытием для использования в бизнесе является то, что процедурную память можно передавать. В одном из тестов процедурная память, созданная мощным GPT-4o, была передана гораздо меньшей модели, Qwen2.5-14B. Производительность меньшей модели заметно улучшилась, увеличился процент успеха и сократилось количество шагов, необходимых для выполнения задач.
По мнению Фанга, это стало возможным потому, что маленькие модели обычно хорошо справляются с простыми одношаговыми действиями, но испытывают трудности с долгосрочным планированием и рассуждениями. Процедурная память более крупной модели эффективно преодолевает этот разрыв. Это означает, что знания могут быть накоплены с помощью модели высшего уровня, а затем применены к меньшим, более бюджетным моделям без ущерба для преимуществ накопленного опыта.
Продвижение к полностью автономным агентам
Благодаря интеграции функций обновления памяти фреймворк Memp позволяет агентам постоянно развивать и совершенствовать свои процедурные знания в процессе работы в реальных условиях. Исследователи заметили, что это дает агенту "непрерывное, почти линейное освоение задачи".
Однако достижение полной автономии сталкивается с еще одним препятствием: многие реальные задачи, такие как создание отчета об исследовании, не имеют четкого индикатора успеха. Чтобы продолжать совершенствоваться, агент должен знать, насколько удовлетворительной была его работа. Фанг считает, что решение проблемы кроется в использовании LLM в качестве оценщиков.
"Сегодня мы часто сочетаем мощные модели с правилами, составленными вручную, чтобы вычислить баллы за завершение работы", - замечает он. "Это работает, но написанные вручную правила негибки и трудно обобщаются".
LLM, выступающий в роли судьи, мог бы предложить подробную, контролирующую обратную связь, необходимую агенту для самокоррекции при выполнении сложных, субъективных заданий. Это сделает весь процесс обучения более масштабируемым и устойчивым, что станет важным шагом на пути к созданию долговечных, гибких и по-настоящему автономных работников ИИ, необходимых для передовой автоматизации предприятий.
Base44 представляет собственную модель искусственного интеллекта для усиления защищенности платформы для кодинга в стиле «vibe».
Base44, платформа для «вайб-кодинга», приобретённая Wix за 80 миллионов долларов всего год назад — когда ей было всего шесть месяцев и в команде состояло восемь человек, — начала развертывание собственной модели искусственного интеллекта, чтобы помоч
Компания «Байер» использует технологию Iambic AI для ускорения разработки лекарственных препаратов
Доктор Юрген Экхардт занимает должность руководителя отдела развития бизнеса и лицензирования в компании «Байер Фарма».Компания «Байер» использует возможности компании Iambic Therapeutics для внедрени
Multiverse Computing запускает бесплатную сжатую генеративную модель искусственного интеллекта
Крупные языковые модели сталкиваются с серьезной проблемой: их огромный размер. Испанский стартап Multiverse Computing решает эту проблему, создавая сжатые модели, призванные преодолеть разрыв между в
Interesting approach! Giving LLMs a memory system could be a game-changer for automating complex workflows. I wonder how the cost savings compare to other optimization methods out there. The collaboration between academia and industry on this is promising. 🧠





Дом






