La memoria procedimental reduce los costes y la complejidad de los agentes de IA
Una nueva técnica desarrollada por la Universidad de Zhejiang y Alibaba Group dota a los agentes de grandes modelos lingüísticos (LLM) de memoria dinámica, lo que aumenta su eficiencia y eficacia a la hora de manejar tareas complejas. Con el nombre de Memp, este método dota a los agentes de una "memoria procedimental" que se actualiza continuamente a medida que acumulan experiencia, reflejando la forma en que los humanos aprenden mediante la práctica repetida.
Memp establece un sistema de aprendizaje permanente en el que los agentes ya no necesitan empezar de cero en cada nueva tarea. A medida que se enfrentan a nuevos escenarios en entornos reales, mejoran constantemente y se vuelven más eficientes, una característica crítica para la automatización fiable de las empresas.
La importancia de la memoria procedimental en los agentes de IA
Los agentes LLM muestran un gran potencial para automatizar intrincadas operaciones empresariales de múltiples pasos. Sin embargo, en la práctica, estas tareas extensas pueden ser propensas al fracaso. Los investigadores destacan que problemas inesperados -como interrupciones de la red, actualizaciones de la interfaz de usuario o cambios en el formato de los datos- pueden interrumpir todo el flujo de trabajo. En la actualidad, esto suele obligar a los agentes a reiniciar desde el principio cada vez, lo que provoca retrasos y mayores costes.
Al mismo tiempo, muchas tareas complejas, aunque parecen diferentes en apariencia, comparten similitudes estructurales subyacentes. En lugar de volver a aprender estos patrones cada vez, un agente debería ser capaz de aprovechar y reutilizar sus experiencias pasadas -tanto los éxitos como los fracasos-, como subrayan los investigadores. Para ello se necesita una "memoria procedimental" especializada, similar a la memoria humana a largo plazo para habilidades como mecanografía o ciclismo, que se convierten en algo natural con la repetición.

Empezar desde cero (arriba) frente a utilizar la memoria procedimental (abajo) (fuente: arXiv) La mayoría de los sistemas de agentes actuales carecen de esta funcionalidad. Sus conocimientos procedimentales suelen ser programados manualmente por los desarrolladores, almacenados en plantillas inflexibles o integrados en los parámetros del modelo, que son costosos y lentos de modificar. Incluso los marcos existentes con mejoras de la memoria ofrecen sólo abstracciones generales y no abordan adecuadamente cómo deben desarrollarse, indexarse, refinarse y gestionarse las habilidades a lo largo del ciclo de vida de un agente.
Como afirman los investigadores en su artículo, "no existe una forma basada en principios de cuantificar la eficacia con la que un agente evoluciona su repertorio de procedimientos ni de garantizar que las nuevas experiencias mejoren el rendimiento en lugar de erosionarlo".
Cómo funciona Memp
Memp es un marco de trabajo independiente de las tareas que trata la memoria procedimental como un componente fundamental y optimizable. Funciona a través de tres etapas fundamentales que forman un ciclo continuo: construcción, recuperación y actualización de la memoria.
Los recuerdos se construyen a partir de las experiencias pasadas de un agente, o "trayectorias". El equipo investigó dos formas de almacenar estos recuerdos: como acciones exactas, paso a paso, o resumiendo esas acciones en abstracciones de nivel superior, similares a guiones. Cuando se le presenta una nueva tarea, el agente busca en su memoria la experiencia previa más relevante. Los investigadores probaron varios métodos, como la búsqueda vectorial, para alinear la descripción de la nueva tarea con consultas anteriores, o la extracción de palabras clave para encontrar la coincidencia más cercana.
El mecanismo de actualización es el elemento más vital. Memp incorpora varias estrategias para garantizar la evolución de la memoria del agente. A medida que un agente termina más tareas, su memoria puede actualizarse añadiendo la nueva experiencia, filtrando sólo los resultados satisfactorios o, lo que es más eficaz, analizando los fallos para corregir y mejorar la memoria original.

Marco de trabajo de Memp (fuente: arXiv) Este énfasis en la memoria dinámica y adaptable sitúa a Memp dentro de un creciente campo de investigación centrado en mejorar la fiabilidad de los agentes de IA para tareas a largo plazo. El proyecto se alinea con otras iniciativas, como Mem0, que extrae información esencial de largas conversaciones y la organiza en hechos estructurados y gráficos de conocimiento para mantener la coherencia. Del mismo modo, A-MEM permite a los agentes generar y conectar de forma autónoma "notas de memoria" a partir de sus interacciones, construyendo con el tiempo una sofisticada red de conocimientos.
Sin embargo, Runnan Fang, coautor del proyecto, señala una diferencia crucial entre Memp y otros marcos similares.
"Mem0 y A-MEM son trabajos excelentes... pero se centran en recordar contenidos destacados dentro de una única trayectoria o conversación", explica Fang a VentureBeat. Esencialmente, ayudan a un agente a recordar "qué" ocurrió. "Memp, en cambio, se centra en la memoria procedimental de trayectorias cruzadas". Se centra en los conocimientos prácticos que pueden aplicarse a tareas comparables, eliminando la necesidad de que el agente empiece desde cero una y otra vez.
"Al destilar flujos de trabajo anteriores que han tenido éxito y convertirlos en conocimientos procedimentales reutilizables, Memp aumenta las tasas de éxito y acorta los pasos", prosigue Fang. "Y lo que es más importante, también introducimos un mecanismo de actualización para que esta memoria procedimental siga mejorando: al fin y al cabo, la práctica también perfecciona a los agentes".
Superar el reto del arranque en frío
Aunque aprender de experiencias pasadas es un concepto poderoso, plantea un reto práctico: ¿cómo desarrolla un agente su memoria inicial cuando no dispone de ejemplos impecables? El equipo de investigación aborda este problema de "arranque en frío" con una solución práctica.
Fang describió cómo los desarrolladores pueden empezar por definir una métrica de evaluación robusta en lugar de necesitar una trayectoria "dorada" perfecta desde el principio. Esta métrica, que puede basarse en reglas o estar impulsada por otro LLM, evalúa la calidad del rendimiento de un agente. "Una vez establecida esa métrica, dejamos que los modelos de vanguardia exploren dentro del flujo de trabajo del agente y retenemos las trayectorias que obtienen las puntuaciones más altas", explica Fang. Este método reúne rápidamente una colección inicial de valiosas memorias, lo que permite a un nuevo agente adquirir destreza sin necesidad de una extensa codificación manual.
Memp en acción
Para evaluar el marco, el equipo integró Memp con los principales LLM, como GPT-4o, Claude 3.5 Sonnet y Qwen2.5, y los puso a prueba en tareas tan exigentes como las tareas domésticas en la prueba de referencia ALFWorld y la recopilación de información en TravelPlanner. Los resultados revelaron que, construyendo y accediendo a la memoria procedimental, un agente podía resumir y reutilizar eficazmente su experiencia previa.
En las pruebas, los agentes que utilizaban Memp no sólo alcanzaban mayores porcentajes de éxito, sino que también operaban de forma mucho más eficiente. Eliminaron la exploración improductiva y las conjeturas, reduciendo significativamente tanto el número de pasos como el uso de tokens necesarios para terminar una tarea.

El uso de la memoria procedimental (derecha) permite a los agentes completar tareas con menos pasos y menor uso de tokens (fuente: arXiv). Un descubrimiento especialmente notable para uso empresarial es que la memoria procedimental puede transferirse. En una prueba, la memoria procedimental creada por el potente GPT-4o se proporcionó a un modelo mucho más pequeño, Qwen2.5-14B. El rendimiento del modelo más pequeño mejoró notablemente, aumentando su tasa de éxito y reduciendo los pasos necesarios para realizar las tareas.
Según Fang, esto es posible porque los modelos más pequeños suelen realizar correctamente acciones sencillas de un solo paso, pero tienen dificultades con la planificación y el razonamiento a largo plazo. La memoria procedimental del modelo más grande cubre eficazmente este vacío. Esto implica que se pueden adquirir conocimientos con un modelo de alto nivel y aplicarlos después a modelos más pequeños y asequibles sin sacrificar las ventajas de esa experiencia adquirida.
Avanzar hacia agentes totalmente autónomos
Al integrar funciones de actualización de la memoria, el marco Memp permite a los agentes desarrollar y pulir continuamente sus conocimientos procedimentales mientras trabajan en entornos reales. Los investigadores observaron que esto proporcionaba al agente un "dominio continuo y casi lineal de la tarea".
Aun así, lograr una autonomía total se enfrenta a otro obstáculo: numerosas tareas del mundo real, como generar un informe de investigación, no tienen un indicador de éxito claro. Para seguir mejorando, un agente debe saber si su rendimiento ha sido satisfactorio. Fang cree que la solución está en emplear LLM como evaluadores.
"Hoy en día solemos combinar modelos potentes con reglas escritas a mano para calcular las puntuaciones de finalización", observa. "Esto funciona, pero las reglas escritas a mano son inflexibles y difíciles de generalizar".
Un LLM que actuara como juez podría ofrecer la información detallada y supervisora necesaria para que un agente se corrigiera a sí mismo en tareas complejas y subjetivas. Esto haría que el proceso general de aprendizaje fuera más escalable y resistente, lo que supondría un avance vital hacia la creación de trabajadores de IA duraderos, flexibles y auténticamente autónomos, esenciales para la automatización avanzada de las empresas.
Artículo relacionado
Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración
Base44, la plataforma de codificación por estilo (vibe coding) adquirida por Wix por 80 millones de dólares hace apenas un año —cuando contaba con solo seis meses de antigüedad y un equipo de ocho personas—, ha comenzado a implementar su modelo de in
Bayer aprovecha la IA de Iambic para acelerar el descubrimiento de fármacos
El Dr. Juergen Eckhardt ocupa el cargo de director de Desarrollo Empresarial y Licencias en Bayer Pharmaceuticals.Bayer está aprovechando la tecnología de Iambic Therapeutics para implementar modelos
Multiverse Computing lanza un modelo generativo de IA comprimido gratuito
Los modelos lingüísticos de gran tamaño se enfrentan a un reto importante: su inmenso tamaño. La startup española Multiverse Computing está abordando este problema mediante la creación de modelos comp
Recomendaciones de temas especiales relacionados
comentario (2)
0/500
Interesting approach! Giving LLMs a memory system could be a game-changer for automating complex workflows. I wonder how the cost savings compare to other optimization methods out there. The collaboration between academia and industry on this is promising. 🧠
Una nueva técnica desarrollada por la Universidad de Zhejiang y Alibaba Group dota a los agentes de grandes modelos lingüísticos (LLM) de memoria dinámica, lo que aumenta su eficiencia y eficacia a la hora de manejar tareas complejas. Con el nombre de Memp, este método dota a los agentes de una "memoria procedimental" que se actualiza continuamente a medida que acumulan experiencia, reflejando la forma en que los humanos aprenden mediante la práctica repetida.
Memp establece un sistema de aprendizaje permanente en el que los agentes ya no necesitan empezar de cero en cada nueva tarea. A medida que se enfrentan a nuevos escenarios en entornos reales, mejoran constantemente y se vuelven más eficientes, una característica crítica para la automatización fiable de las empresas.
La importancia de la memoria procedimental en los agentes de IA
Los agentes LLM muestran un gran potencial para automatizar intrincadas operaciones empresariales de múltiples pasos. Sin embargo, en la práctica, estas tareas extensas pueden ser propensas al fracaso. Los investigadores destacan que problemas inesperados -como interrupciones de la red, actualizaciones de la interfaz de usuario o cambios en el formato de los datos- pueden interrumpir todo el flujo de trabajo. En la actualidad, esto suele obligar a los agentes a reiniciar desde el principio cada vez, lo que provoca retrasos y mayores costes.
Al mismo tiempo, muchas tareas complejas, aunque parecen diferentes en apariencia, comparten similitudes estructurales subyacentes. En lugar de volver a aprender estos patrones cada vez, un agente debería ser capaz de aprovechar y reutilizar sus experiencias pasadas -tanto los éxitos como los fracasos-, como subrayan los investigadores. Para ello se necesita una "memoria procedimental" especializada, similar a la memoria humana a largo plazo para habilidades como mecanografía o ciclismo, que se convierten en algo natural con la repetición.

La mayoría de los sistemas de agentes actuales carecen de esta funcionalidad. Sus conocimientos procedimentales suelen ser programados manualmente por los desarrolladores, almacenados en plantillas inflexibles o integrados en los parámetros del modelo, que son costosos y lentos de modificar. Incluso los marcos existentes con mejoras de la memoria ofrecen sólo abstracciones generales y no abordan adecuadamente cómo deben desarrollarse, indexarse, refinarse y gestionarse las habilidades a lo largo del ciclo de vida de un agente.
Como afirman los investigadores en su artículo, "no existe una forma basada en principios de cuantificar la eficacia con la que un agente evoluciona su repertorio de procedimientos ni de garantizar que las nuevas experiencias mejoren el rendimiento en lugar de erosionarlo".
Cómo funciona Memp
Memp es un marco de trabajo independiente de las tareas que trata la memoria procedimental como un componente fundamental y optimizable. Funciona a través de tres etapas fundamentales que forman un ciclo continuo: construcción, recuperación y actualización de la memoria.
Los recuerdos se construyen a partir de las experiencias pasadas de un agente, o "trayectorias". El equipo investigó dos formas de almacenar estos recuerdos: como acciones exactas, paso a paso, o resumiendo esas acciones en abstracciones de nivel superior, similares a guiones. Cuando se le presenta una nueva tarea, el agente busca en su memoria la experiencia previa más relevante. Los investigadores probaron varios métodos, como la búsqueda vectorial, para alinear la descripción de la nueva tarea con consultas anteriores, o la extracción de palabras clave para encontrar la coincidencia más cercana.
El mecanismo de actualización es el elemento más vital. Memp incorpora varias estrategias para garantizar la evolución de la memoria del agente. A medida que un agente termina más tareas, su memoria puede actualizarse añadiendo la nueva experiencia, filtrando sólo los resultados satisfactorios o, lo que es más eficaz, analizando los fallos para corregir y mejorar la memoria original.

Este énfasis en la memoria dinámica y adaptable sitúa a Memp dentro de un creciente campo de investigación centrado en mejorar la fiabilidad de los agentes de IA para tareas a largo plazo. El proyecto se alinea con otras iniciativas, como Mem0, que extrae información esencial de largas conversaciones y la organiza en hechos estructurados y gráficos de conocimiento para mantener la coherencia. Del mismo modo, A-MEM permite a los agentes generar y conectar de forma autónoma "notas de memoria" a partir de sus interacciones, construyendo con el tiempo una sofisticada red de conocimientos.
Sin embargo, Runnan Fang, coautor del proyecto, señala una diferencia crucial entre Memp y otros marcos similares.
"Mem0 y A-MEM son trabajos excelentes... pero se centran en recordar contenidos destacados dentro de una única trayectoria o conversación", explica Fang a VentureBeat. Esencialmente, ayudan a un agente a recordar "qué" ocurrió. "Memp, en cambio, se centra en la memoria procedimental de trayectorias cruzadas". Se centra en los conocimientos prácticos que pueden aplicarse a tareas comparables, eliminando la necesidad de que el agente empiece desde cero una y otra vez.
"Al destilar flujos de trabajo anteriores que han tenido éxito y convertirlos en conocimientos procedimentales reutilizables, Memp aumenta las tasas de éxito y acorta los pasos", prosigue Fang. "Y lo que es más importante, también introducimos un mecanismo de actualización para que esta memoria procedimental siga mejorando: al fin y al cabo, la práctica también perfecciona a los agentes".
Superar el reto del arranque en frío
Aunque aprender de experiencias pasadas es un concepto poderoso, plantea un reto práctico: ¿cómo desarrolla un agente su memoria inicial cuando no dispone de ejemplos impecables? El equipo de investigación aborda este problema de "arranque en frío" con una solución práctica.
Fang describió cómo los desarrolladores pueden empezar por definir una métrica de evaluación robusta en lugar de necesitar una trayectoria "dorada" perfecta desde el principio. Esta métrica, que puede basarse en reglas o estar impulsada por otro LLM, evalúa la calidad del rendimiento de un agente. "Una vez establecida esa métrica, dejamos que los modelos de vanguardia exploren dentro del flujo de trabajo del agente y retenemos las trayectorias que obtienen las puntuaciones más altas", explica Fang. Este método reúne rápidamente una colección inicial de valiosas memorias, lo que permite a un nuevo agente adquirir destreza sin necesidad de una extensa codificación manual.
Memp en acción
Para evaluar el marco, el equipo integró Memp con los principales LLM, como GPT-4o, Claude 3.5 Sonnet y Qwen2.5, y los puso a prueba en tareas tan exigentes como las tareas domésticas en la prueba de referencia ALFWorld y la recopilación de información en TravelPlanner. Los resultados revelaron que, construyendo y accediendo a la memoria procedimental, un agente podía resumir y reutilizar eficazmente su experiencia previa.
En las pruebas, los agentes que utilizaban Memp no sólo alcanzaban mayores porcentajes de éxito, sino que también operaban de forma mucho más eficiente. Eliminaron la exploración improductiva y las conjeturas, reduciendo significativamente tanto el número de pasos como el uso de tokens necesarios para terminar una tarea.

Un descubrimiento especialmente notable para uso empresarial es que la memoria procedimental puede transferirse. En una prueba, la memoria procedimental creada por el potente GPT-4o se proporcionó a un modelo mucho más pequeño, Qwen2.5-14B. El rendimiento del modelo más pequeño mejoró notablemente, aumentando su tasa de éxito y reduciendo los pasos necesarios para realizar las tareas.
Según Fang, esto es posible porque los modelos más pequeños suelen realizar correctamente acciones sencillas de un solo paso, pero tienen dificultades con la planificación y el razonamiento a largo plazo. La memoria procedimental del modelo más grande cubre eficazmente este vacío. Esto implica que se pueden adquirir conocimientos con un modelo de alto nivel y aplicarlos después a modelos más pequeños y asequibles sin sacrificar las ventajas de esa experiencia adquirida.
Avanzar hacia agentes totalmente autónomos
Al integrar funciones de actualización de la memoria, el marco Memp permite a los agentes desarrollar y pulir continuamente sus conocimientos procedimentales mientras trabajan en entornos reales. Los investigadores observaron que esto proporcionaba al agente un "dominio continuo y casi lineal de la tarea".
Aun así, lograr una autonomía total se enfrenta a otro obstáculo: numerosas tareas del mundo real, como generar un informe de investigación, no tienen un indicador de éxito claro. Para seguir mejorando, un agente debe saber si su rendimiento ha sido satisfactorio. Fang cree que la solución está en emplear LLM como evaluadores.
"Hoy en día solemos combinar modelos potentes con reglas escritas a mano para calcular las puntuaciones de finalización", observa. "Esto funciona, pero las reglas escritas a mano son inflexibles y difíciles de generalizar".
Un LLM que actuara como juez podría ofrecer la información detallada y supervisora necesaria para que un agente se corrigiera a sí mismo en tareas complejas y subjetivas. Esto haría que el proceso general de aprendizaje fuera más escalable y resistente, lo que supondría un avance vital hacia la creación de trabajadores de IA duraderos, flexibles y auténticamente autónomos, esenciales para la automatización avanzada de las empresas.
Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración
Base44, la plataforma de codificación por estilo (vibe coding) adquirida por Wix por 80 millones de dólares hace apenas un año —cuando contaba con solo seis meses de antigüedad y un equipo de ocho personas—, ha comenzado a implementar su modelo de in
Bayer aprovecha la IA de Iambic para acelerar el descubrimiento de fármacos
El Dr. Juergen Eckhardt ocupa el cargo de director de Desarrollo Empresarial y Licencias en Bayer Pharmaceuticals.Bayer está aprovechando la tecnología de Iambic Therapeutics para implementar modelos
Multiverse Computing lanza un modelo generativo de IA comprimido gratuito
Los modelos lingüísticos de gran tamaño se enfrentan a un reto importante: su inmenso tamaño. La startup española Multiverse Computing está abordando este problema mediante la creación de modelos comp
Interesting approach! Giving LLMs a memory system could be a game-changer for automating complex workflows. I wonder how the cost savings compare to other optimization methods out there. The collaboration between academia and industry on this is promising. 🧠





Hogar






