Hogar
AReaL 2.0 de código abierto: infraestructura de aprendizaje por refuerzo para agentes que evolucionan por sí mismos a través del uso
El 2 de julio, el proyecto de infraestructura de código abierto para el aprendizaje por refuerzo AReaL lanzó oficialmente su versión 2.0. AReaL está diseñado para salvar la brecha entre el entrenamiento de modelos fundamentales y las aplicaciones modernas de agentes, ofreciendo un soporte eficaz para el entrenamiento mediante aprendizaje por refuerzo en escenarios de agentes.
La recién lanzada versión 2.0 de AReaL está dirigida a agentes que operan en entornos empresariales del mundo real, proporcionando una infraestructura de sistema que permite el aprendizaje continuo mientras los agentes están en funcionamiento. A través de AReaL 2.0, los procesos de interacción generados por los agentes al realizar tareas reales pueden registrarse, organizarse e integrarse en ciclos de entrenamiento posteriores. Estos procesos se utilizan para perfeccionar continuamente los modelos subyacentes, lo que permite que los agentes se vuelvan más eficaces sin dejar de ser seguros y controlables.
En la actualidad, los agentes están entrando en entornos de producción reales: escriben código, buscan información y recurren a herramientas para completar tareas cada vez más complejas dentro de los sistemas empresariales. Sin embargo, ha surgido un problema: los agentes trabajan a diario, pero rara vez aprenden de sus experiencias.
En escenarios empresariales reales, los agentes generan una gran cantidad de experiencia valiosa: qué tareas se completaron correctamente, dónde fallaron las llamadas a las herramientas, por qué los usuarios quedaron insatisfechos y si una determinada decisión iba por mal camino. Sin embargo, esta información se almacena principalmente en registros, lo que dificulta su transformación de forma estable y segura en el siguiente paso hacia la mejora de las capacidades.
AReaL 2.0 pretende resolver el problema de cómo los agentes siguen aprendiendo tras su implementación. Los desarrolladores no necesitan volver a desarrollar los agentes; simplemente tienen que redirigir las solicitudes que los agentes envían normalmente a los grandes modelos a través del punto final de inferencia unificado de AReaL 2.0 para integrarlas en el proceso de aprendizaje por refuerzo en línea.

Figura: Diagrama de la arquitectura de aprendizaje por refuerzo en línea (Online RL) de AReaL 2.0
Tomemos como ejemplo el agente Hermes. Hermes sigue recibiendo tareas, planificando pasos y llamando a modelos como de costumbre. AReaL 2.0 registra los procesos de interacción clave cuando Hermes completa las tareas en segundo plano y utiliza estas trayectorias reales, combinadas con señales de retroalimentación o recompensa tras la finalización de la tarea, para el entrenamiento posterior. Los desarrolladores también pueden sustituir a Hermes por su propio agente y entorno de tareas, utilizando el mismo enfoque para crear un proceso de aprendizaje por refuerzo en línea para los agentes.
Esto significa que la mejora de las capacidades de un agente ya no depende únicamente de datos construidos manualmente, del entrenamiento fuera de línea ni de la reimplementación. Las conversaciones de varios turnos, las llamadas a herramientas, los resultados de ejecución y las señales de retroalimentación procedentes de tareas reales pueden convertirse en material para el aprendizaje de los modelos.
Este punto es especialmente importante en entornos empresariales. Los agentes en los flujos de trabajo empresariales se enfrentan a tareas reales, complejas y en constante cambio: los repositorios de código pueden actualizarse, los procesos de negocio pueden cambiar, las necesidades de los usuarios pueden variar y las herramientas y los sistemas también pueden cambiar. Si las capacidades de un agente quedan fijas una vez desplegado, le resultará difícil adaptarse al entorno real con el paso del tiempo. AReaL 2.0 pretende cubrir el eslabón perdido entre «ser capaz de utilizar herramientas» y «ser capaz de aprender de su uso».
Al mismo tiempo, el aprendizaje continuo en escenarios empresariales reales no puede limitarse simplemente a «recopilar datos y volver a entrenar». Los agentes pueden acceder a código, información de clientes, bases de conocimiento corporativas y sistemas internos, por lo que el proceso de entrenamiento debe tener en cuenta requisitos como el control de acceso, la anonimización de datos, el aislamiento y la auditoría. AReaL 2.0 introduce en el diseño de su sistema un mecanismo de proxy de datos para los rastros de los agentes, lo que permite gestionar y utilizar los datos reales de las tareas de una forma más segura y controlable al incorporarlos al proceso de entrenamiento.
El equipo de AReaL señaló en su informe técnico que el principal cuello de botella para los agentes que evolucionan por sí mismos no es solo la solidez del modelo o el grado de avance del algoritmo de aprendizaje por refuerzo, sino la falta de una infraestructura de aprendizaje por refuerzo en línea al servicio de agentes reales. AReaL 2.0 es una actualización arquitectónica dirigida a la próxima generación de aplicaciones de agentes: conecta los servicios de los agentes, los registros de tareas reales, la gobernanza de datos y el entrenamiento de aprendizaje por refuerzo en línea, proporcionando a los agentes la base de ingeniería práctica para seguir aprendiendo tras su implementación.
Desde una perspectiva a más largo plazo, AReaL 2.0 apunta al paradigma de evolución de la próxima generación de aplicaciones de agentes: los agentes ya no son herramientas que se entrenan y se implementan una sola vez, sino que obtienen continuamente retroalimentación en entornos reales, transformando tanto el éxito como el fracaso en experiencia y mejorando continuamente sus capacidades dentro de unos límites seguros.
El proyecto AReaL fue puesto en marcha en 2024 por equipos entre los que se encontraban Ant Group, la Universidad de Tsinghua y la Universidad de Ciencia y Tecnología de Hong Kong. En mayo de 2026, AReaL salió oficialmente del programa de incubación Ant InclusionAI y se convirtió en una comunidad independiente de código abierto, uniéndose al proyecto del ecosistema de la Fundación PyTorch, lo que le permitió integrarse aún más en el ecosistema principal de infraestructura de aprendizaje por refuerzo.
A medida que la comunidad se desarrolla de forma independiente, AReaL también ha seguido contando con la participación y el apoyo de socios del sector y del ecosistema de código abierto, entre los que se incluyen el equipo de Huawei Cloud y MindLab. En el futuro, AReaL seguirá avanzando en áreas como el aprendizaje por refuerzo en línea, la evaluación automatizada y el entrenamiento de agentes multimodales, colaborando con la comunidad para impulsar el desarrollo de ecosistemas de agentes que evolucionen por sí mismos.
Actualmente, el informe técnico y el código de AReaL 2.0 se han publicado como código abierto.
· Repositorio de GitHub: https://github.com/areal-project/AReaL
· Informe técnico: https://arxiv.org/abs/2607.01120
Artículo relacionado
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El 2 de julio, el proyecto de infraestructura de código abierto para el aprendizaje por refuerzo AReaL lanzó oficialmente su versión 2.0. AReaL está diseñado para salvar la brecha entre el entrenamiento de modelos fundamentales y las aplicaciones modernas de agentes, ofreciendo un soporte eficaz para el entrenamiento mediante aprendizaje por refuerzo en escenarios de agentes.
La recién lanzada versión 2.0 de AReaL está dirigida a agentes que operan en entornos empresariales del mundo real, proporcionando una infraestructura de sistema que permite el aprendizaje continuo mientras los agentes están en funcionamiento. A través de AReaL 2.0, los procesos de interacción generados por los agentes al realizar tareas reales pueden registrarse, organizarse e integrarse en ciclos de entrenamiento posteriores. Estos procesos se utilizan para perfeccionar continuamente los modelos subyacentes, lo que permite que los agentes se vuelvan más eficaces sin dejar de ser seguros y controlables.
En la actualidad, los agentes están entrando en entornos de producción reales: escriben código, buscan información y recurren a herramientas para completar tareas cada vez más complejas dentro de los sistemas empresariales. Sin embargo, ha surgido un problema: los agentes trabajan a diario, pero rara vez aprenden de sus experiencias.
En escenarios empresariales reales, los agentes generan una gran cantidad de experiencia valiosa: qué tareas se completaron correctamente, dónde fallaron las llamadas a las herramientas, por qué los usuarios quedaron insatisfechos y si una determinada decisión iba por mal camino. Sin embargo, esta información se almacena principalmente en registros, lo que dificulta su transformación de forma estable y segura en el siguiente paso hacia la mejora de las capacidades.
AReaL 2.0 pretende resolver el problema de cómo los agentes siguen aprendiendo tras su implementación. Los desarrolladores no necesitan volver a desarrollar los agentes; simplemente tienen que redirigir las solicitudes que los agentes envían normalmente a los grandes modelos a través del punto final de inferencia unificado de AReaL 2.0 para integrarlas en el proceso de aprendizaje por refuerzo en línea.

Figura: Diagrama de la arquitectura de aprendizaje por refuerzo en línea (Online RL) de AReaL 2.0
Tomemos como ejemplo el agente Hermes. Hermes sigue recibiendo tareas, planificando pasos y llamando a modelos como de costumbre. AReaL 2.0 registra los procesos de interacción clave cuando Hermes completa las tareas en segundo plano y utiliza estas trayectorias reales, combinadas con señales de retroalimentación o recompensa tras la finalización de la tarea, para el entrenamiento posterior. Los desarrolladores también pueden sustituir a Hermes por su propio agente y entorno de tareas, utilizando el mismo enfoque para crear un proceso de aprendizaje por refuerzo en línea para los agentes.
Esto significa que la mejora de las capacidades de un agente ya no depende únicamente de datos construidos manualmente, del entrenamiento fuera de línea ni de la reimplementación. Las conversaciones de varios turnos, las llamadas a herramientas, los resultados de ejecución y las señales de retroalimentación procedentes de tareas reales pueden convertirse en material para el aprendizaje de los modelos.
Este punto es especialmente importante en entornos empresariales. Los agentes en los flujos de trabajo empresariales se enfrentan a tareas reales, complejas y en constante cambio: los repositorios de código pueden actualizarse, los procesos de negocio pueden cambiar, las necesidades de los usuarios pueden variar y las herramientas y los sistemas también pueden cambiar. Si las capacidades de un agente quedan fijas una vez desplegado, le resultará difícil adaptarse al entorno real con el paso del tiempo. AReaL 2.0 pretende cubrir el eslabón perdido entre «ser capaz de utilizar herramientas» y «ser capaz de aprender de su uso».
Al mismo tiempo, el aprendizaje continuo en escenarios empresariales reales no puede limitarse simplemente a «recopilar datos y volver a entrenar». Los agentes pueden acceder a código, información de clientes, bases de conocimiento corporativas y sistemas internos, por lo que el proceso de entrenamiento debe tener en cuenta requisitos como el control de acceso, la anonimización de datos, el aislamiento y la auditoría. AReaL 2.0 introduce en el diseño de su sistema un mecanismo de proxy de datos para los rastros de los agentes, lo que permite gestionar y utilizar los datos reales de las tareas de una forma más segura y controlable al incorporarlos al proceso de entrenamiento.
El equipo de AReaL señaló en su informe técnico que el principal cuello de botella para los agentes que evolucionan por sí mismos no es solo la solidez del modelo o el grado de avance del algoritmo de aprendizaje por refuerzo, sino la falta de una infraestructura de aprendizaje por refuerzo en línea al servicio de agentes reales. AReaL 2.0 es una actualización arquitectónica dirigida a la próxima generación de aplicaciones de agentes: conecta los servicios de los agentes, los registros de tareas reales, la gobernanza de datos y el entrenamiento de aprendizaje por refuerzo en línea, proporcionando a los agentes la base de ingeniería práctica para seguir aprendiendo tras su implementación.
Desde una perspectiva a más largo plazo, AReaL 2.0 apunta al paradigma de evolución de la próxima generación de aplicaciones de agentes: los agentes ya no son herramientas que se entrenan y se implementan una sola vez, sino que obtienen continuamente retroalimentación en entornos reales, transformando tanto el éxito como el fracaso en experiencia y mejorando continuamente sus capacidades dentro de unos límites seguros.
El proyecto AReaL fue puesto en marcha en 2024 por equipos entre los que se encontraban Ant Group, la Universidad de Tsinghua y la Universidad de Ciencia y Tecnología de Hong Kong. En mayo de 2026, AReaL salió oficialmente del programa de incubación Ant InclusionAI y se convirtió en una comunidad independiente de código abierto, uniéndose al proyecto del ecosistema de la Fundación PyTorch, lo que le permitió integrarse aún más en el ecosistema principal de infraestructura de aprendizaje por refuerzo.
A medida que la comunidad se desarrolla de forma independiente, AReaL también ha seguido contando con la participación y el apoyo de socios del sector y del ecosistema de código abierto, entre los que se incluyen el equipo de Huawei Cloud y MindLab. En el futuro, AReaL seguirá avanzando en áreas como el aprendizaje por refuerzo en línea, la evaluación automatizada y el entrenamiento de agentes multimodales, colaborando con la comunidad para impulsar el desarrollo de ecosistemas de agentes que evolucionen por sí mismos.
Actualmente, el informe técnico y el código de AReaL 2.0 se han publicado como código abierto.
· Repositorio de GitHub: https://github.com/areal-project/AReaL
· Informe técnico: https://arxiv.org/abs/2607.01120
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











