AReaL 2.0 开源项目:通过使用实现自我进化智能体的强化学习基础设施
7月2日,开源强化学习基础设施项目AReaL正式发布了2.0版本。AReaL旨在弥合基础模型训练与现代智能体应用之间的鸿沟,为智能体场景提供高效的强化学习训练支持。
新发布的 AReaL 2.0 面向在真实商业环境中运行的智能体,提供了一套系统基础设施,使智能体在实际使用过程中能够持续学习。 借助 AReaL 2.0,代理在完成实际任务时生成的交互过程可以被记录、整理并整合到后续的训练周期中。这些过程被用于持续优化底层模型,使代理在保持安全可控的同时不断提升能力。
目前,智能代理正进入真实的生产环境——编写代码、检索信息并调用工具,在企业系统内完成日益复杂的任务。然而,一个问题随之浮现:智能代理虽然每天都在工作,却很少能从经验中成长。
在真实的商业场景中,智能代理会产生大量宝贵的经验:哪些任务完成得很好、工具调用在何处失败、用户为何不满意,以及某项决策是否偏离了正轨。然而,这些信息大多存储在日志中,难以将其稳定且安全地转化为能力提升的下一步。
AReaL 2.0 旨在解决代理在部署后如何持续成长的问题。开发人员无需重新开发代理;只需将代理通常发送给大型模型的请求通过 AReaL 2.0 的统一推理端点进行路由,即可将其集成到在线强化学习过程中。

图:AReaL 2.0 在线强化学习(Online RL)架构图
以 Hermes 智能体为例。Hermes 仍会像往常一样接收任务、规划步骤并调用模型。 AReaL 2.0 会在后台记录 Hermes 完成任务时的关键交互过程,并将这些真实轨迹与任务完成后的反馈或奖励信号结合,用于后续训练。开发者还可以用自己的智能体和任务环境替换 Hermes,采用相同的方法为智能体构建在线强化学习流程。
这意味着智能体的能力提升不再仅依赖于人工构建的数据、离线训练和重新部署。多轮对话、工具调用、执行结果以及来自真实任务的反馈信号,均可成为模型学习的素材。
这一点在企业场景中尤为重要。企业工作流中的智能代理面临着真实、复杂且不断变化的任务:代码仓库可能更新,业务流程可能变更,用户需求可能发生变化,工具和系统也可能发生改变。如果智能代理的能力在部署后便一成不变,它将难以随着时间的推移适应真实环境。 AReaL 2.0 旨在填补“能够使用工具”与“能够从使用中学习”之间的缺失环节。
与此同时,在真实的业务场景中进行持续学习,不能仅仅局限于“收集数据并重新训练”。代理可能访问代码、客户信息、企业知识库和内部系统,因此训练管道必须考虑访问控制、数据匿名化、隔离和审计等要求。 AReaL 2.0 在系统设计中引入了代理机制来处理智能体的操作轨迹,从而在真实任务数据进入训练流程时,能够以更安全、更可控的方式进行管理和利用。
AReaL 团队在其技术报告中指出,自进化智能体面临的关键瓶颈不仅在于模型的强弱或强化学习算法是否先进,更在于缺乏能够服务于真实智能体的在线强化学习基础设施。 AReaL 2.0 是一次面向下一代智能体应用的架构升级:它将智能体服务、真实任务轨迹、数据治理和在线强化学习训练有机结合,为智能体提供了在部署后持续学习的实用工程基础。
从长远来看,AReaL 2.0 指明了下一代智能体应用的演进范式:智能体不再是仅需一次性训练和部署的工具,而是能够在真实环境中持续获取反馈,将成功与失败都转化为经验,并在安全边界内不断提升自身能力。
AReaL 项目由蚂蚁集团、清华大学和香港科技大学等团队于 2024 年共同发起。 2026年5月,AReaL正式从蚂蚁InclusionAI孵化计划中毕业,成为一个独立的开源社区,加入了PyTorch基金会生态系统项目,进一步融入了主流强化学习基础设施生态系统。
随着社区的独立发展,AReaL 也持续获得了来自行业及开源生态合作伙伴的参与和支持,其中包括华为云团队和 MindLab。 未来,AReaL将围绕在线强化学习、自动评估和多模态智能体训练等领域持续迭代,与社区携手推进自进化智能体生态系统的建设。
目前,AReaL 2.0 的技术报告和代码已开源。
· GitHub 仓库:https://github.com/areal-project/AReaL
· 技术报告:https://arxiv.org/abs/2607.01120
相关文章
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
相关专题推荐
评论 (0)
0/500
7月2日,开源强化学习基础设施项目AReaL正式发布了2.0版本。AReaL旨在弥合基础模型训练与现代智能体应用之间的鸿沟,为智能体场景提供高效的强化学习训练支持。
新发布的 AReaL 2.0 面向在真实商业环境中运行的智能体,提供了一套系统基础设施,使智能体在实际使用过程中能够持续学习。 借助 AReaL 2.0,代理在完成实际任务时生成的交互过程可以被记录、整理并整合到后续的训练周期中。这些过程被用于持续优化底层模型,使代理在保持安全可控的同时不断提升能力。
目前,智能代理正进入真实的生产环境——编写代码、检索信息并调用工具,在企业系统内完成日益复杂的任务。然而,一个问题随之浮现:智能代理虽然每天都在工作,却很少能从经验中成长。
在真实的商业场景中,智能代理会产生大量宝贵的经验:哪些任务完成得很好、工具调用在何处失败、用户为何不满意,以及某项决策是否偏离了正轨。然而,这些信息大多存储在日志中,难以将其稳定且安全地转化为能力提升的下一步。
AReaL 2.0 旨在解决代理在部署后如何持续成长的问题。开发人员无需重新开发代理;只需将代理通常发送给大型模型的请求通过 AReaL 2.0 的统一推理端点进行路由,即可将其集成到在线强化学习过程中。

图:AReaL 2.0 在线强化学习(Online RL)架构图
以 Hermes 智能体为例。Hermes 仍会像往常一样接收任务、规划步骤并调用模型。 AReaL 2.0 会在后台记录 Hermes 完成任务时的关键交互过程,并将这些真实轨迹与任务完成后的反馈或奖励信号结合,用于后续训练。开发者还可以用自己的智能体和任务环境替换 Hermes,采用相同的方法为智能体构建在线强化学习流程。
这意味着智能体的能力提升不再仅依赖于人工构建的数据、离线训练和重新部署。多轮对话、工具调用、执行结果以及来自真实任务的反馈信号,均可成为模型学习的素材。
这一点在企业场景中尤为重要。企业工作流中的智能代理面临着真实、复杂且不断变化的任务:代码仓库可能更新,业务流程可能变更,用户需求可能发生变化,工具和系统也可能发生改变。如果智能代理的能力在部署后便一成不变,它将难以随着时间的推移适应真实环境。 AReaL 2.0 旨在填补“能够使用工具”与“能够从使用中学习”之间的缺失环节。
与此同时,在真实的业务场景中进行持续学习,不能仅仅局限于“收集数据并重新训练”。代理可能访问代码、客户信息、企业知识库和内部系统,因此训练管道必须考虑访问控制、数据匿名化、隔离和审计等要求。 AReaL 2.0 在系统设计中引入了代理机制来处理智能体的操作轨迹,从而在真实任务数据进入训练流程时,能够以更安全、更可控的方式进行管理和利用。
AReaL 团队在其技术报告中指出,自进化智能体面临的关键瓶颈不仅在于模型的强弱或强化学习算法是否先进,更在于缺乏能够服务于真实智能体的在线强化学习基础设施。 AReaL 2.0 是一次面向下一代智能体应用的架构升级:它将智能体服务、真实任务轨迹、数据治理和在线强化学习训练有机结合,为智能体提供了在部署后持续学习的实用工程基础。
从长远来看,AReaL 2.0 指明了下一代智能体应用的演进范式:智能体不再是仅需一次性训练和部署的工具,而是能够在真实环境中持续获取反馈,将成功与失败都转化为经验,并在安全边界内不断提升自身能力。
AReaL 项目由蚂蚁集团、清华大学和香港科技大学等团队于 2024 年共同发起。 2026年5月,AReaL正式从蚂蚁InclusionAI孵化计划中毕业,成为一个独立的开源社区,加入了PyTorch基金会生态系统项目,进一步融入了主流强化学习基础设施生态系统。
随着社区的独立发展,AReaL 也持续获得了来自行业及开源生态合作伙伴的参与和支持,其中包括华为云团队和 MindLab。 未来,AReaL将围绕在线强化学习、自动评估和多模态智能体训练等领域持续迭代,与社区携手推进自进化智能体生态系统的建设。
目前,AReaL 2.0 的技术报告和代码已开源。
· GitHub 仓库:https://github.com/areal-project/AReaL
· 技术报告:https://arxiv.org/abs/2607.01120
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用





首页






