自学式人工智能代理改变网络体验:准备指南

著名人工智能研究人员戴维-西尔弗(David Silver)和理查德-萨顿(Richard Sutton)在一篇新论文中提出,人工智能正在进入一个变革性的 "体验时代"。他们认为,人工智能系统将越来越多地摆脱对人类提供的数据的依赖,转而通过与世界的直接互动和数据收集来取得进步。
虽然这篇论文是一篇概念性和前瞻性的文章,但其见解对计划开发和整合未来人工智能代理和系统的企业具有直接的现实意义。
西尔弗和萨顿都是受人尊敬的科学家,他们对人工智能的发展轨迹有着准确的预测。他们的远见卓识在当今最先进的人工智能系统中体现得淋漓尽致。强化学习先驱萨顿在 2019 年发表的一篇颇具影响力的文章《苦涩的一课》中认为,人工智能最重大的长期突破始终来自于利用大规模计算扩展通用搜索和学习,而不是主要来自于嵌入复杂的人类知识。
DeepMind 首席科学家戴维-西尔弗(David Silver)在开发 AlphaGo、AlphaZero 和 AlphaStar(深度强化学习的重要里程碑)的过程中发挥了主导作用。他还与他人合作撰写了一篇 2021 年的论文,断言强化学习与精心设计的奖励信号相结合,最终可以产生高度先进的人工智能。
当今最复杂的大型语言模型(LLM)就是这两个概念的典范。自 GPT-3 以来,功能强大的 LLMs 浪潮主要依靠扩展计算能力和数据来吸收大量知识。最近的推理模型,如 DeepSeek-R1,进一步证明了直接奖励信号的强化学习足以获得复杂的推理能力。
什么是体验时代?
经验时代 "建立在萨顿和西尔弗所倡导的概念之上,现在又结合了人工智能的最新进展。作者指出,"仅靠从人类数据中进行监督学习来推动进步的步伐明显放缓,这表明需要一种新的方法"。
这种新方法需要一个全新的数据源,随着代理能力的提高,数据源的生成方式也会不断改进。"萨顿和西尔弗解释说:"要做到这一点,就必须允许代理从自身的经验中不断学习,即代理与环境交互时产生的数据。他们认为,最终,"经验将成为改进的主要媒介,并最终使当今系统中使用的人类数据规模相形见绌"。
作者认为,未来的人工智能系统将 "突破以人为中心的人工智能系统的局限性",不仅要从经验数据中学习,还要从四个关键维度学习:
- 流:人工智能代理不是在孤立的事件中运行,而是 "拥有自己的经验流,像人类一样,在很长的时间尺度上不断进步"。这样就能进行长期规划并逐步调整行为。这方面的早期迹象出现在人工智能系统中,这些系统具有广泛的上下文窗口和记忆架构,可通过用户互动不断更新。
- 行动与观察:体验时代的代理系统将超越人类特权的行动和观察,在现实世界中自主运行。我们可以在使用计算机控制和模型上下文协议(MCP)等工具与外部应用程序和资源对接的代理系统中看到这一点。
- 奖励:虽然目前的强化学习系统在很大程度上依赖于人类设计的奖励功能,但未来的人工智能代理应该创建自己的动态奖励功能。这些功能将随着时间的推移而不断发展,使用户的偏好与来自代理行动和观察的真实反馈相一致。早期的自我设计奖励系统,如英伟达(Nvidia)的 DrEureka,提供了这种未来的曙光。
- 规划与推理:目前的推理模型通常是模仿人类思维设计的。作者提出:"肯定存在更高效的思维机制,可以使用非人类语言,例如利用符号计算、分布式计算、连续计算或可微分计算。人工智能代理应该与世界打交道,利用观察到的数据来测试、完善和更新其推理,同时建立一个内部世界模型。
人工智能代理通过强化学习进行调整的概念并不新鲜,但在历史上,这类代理仅限于棋盘游戏等严格控制的环境。现在,能够驾驭复杂环境(如操作计算机)的代理加上强化学习方面的进步,有望克服这些限制,加速向体验时代转变。
这对企业意味着什么?
萨顿和西尔弗的论文中针对实际应用提出了一个重要观点:"代理可以使用'人性化'的操作和观察,如用户界面,自然而然地促进与用户的沟通和协作。代理还可以采取'机器友好'的行动,执行代码和调用应用程序接口,使代理能够自主地为其目标服务"。
体验时代意味着开发人员必须同时为人类用户和人工智能代理设计应用程序。机器友好型操作需要安全、可访问的 API,可直接使用或通过 MCP 等接口使用。这还涉及创建可通过谷歌 Agent2Agent 等协议发现的代理。设计应用程序接口和代理接口,允许访问操作和观察结果,将使代理能够逐步推理并从与软件的交互中学习。
如果萨顿和西尔弗的设想得以实现,数十亿个代理最终将在网络上运行,随后在物理世界中执行任务。它们的行为和需求将与人类用户有本质区别。建立对代理友好的交互方法对于有效利用未来的人工智能系统和降低潜在风险至关重要。
"萨顿和西尔弗总结说:"通过建立在 RL 基础之上,并调整其核心原则以应对新时代的挑战,我们可以释放自主学习的全部潜能,并为实现真正的超人智能铺平道路。
DeepMind 拒绝为本新闻提供更多评论。
相关文章
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
相关专题推荐
评论 (1)
0/500

著名人工智能研究人员戴维-西尔弗(David Silver)和理查德-萨顿(Richard Sutton)在一篇新论文中提出,人工智能正在进入一个变革性的 "体验时代"。他们认为,人工智能系统将越来越多地摆脱对人类提供的数据的依赖,转而通过与世界的直接互动和数据收集来取得进步。
虽然这篇论文是一篇概念性和前瞻性的文章,但其见解对计划开发和整合未来人工智能代理和系统的企业具有直接的现实意义。
西尔弗和萨顿都是受人尊敬的科学家,他们对人工智能的发展轨迹有着准确的预测。他们的远见卓识在当今最先进的人工智能系统中体现得淋漓尽致。强化学习先驱萨顿在 2019 年发表的一篇颇具影响力的文章《苦涩的一课》中认为,人工智能最重大的长期突破始终来自于利用大规模计算扩展通用搜索和学习,而不是主要来自于嵌入复杂的人类知识。
DeepMind 首席科学家戴维-西尔弗(David Silver)在开发 AlphaGo、AlphaZero 和 AlphaStar(深度强化学习的重要里程碑)的过程中发挥了主导作用。他还与他人合作撰写了一篇 2021 年的论文,断言强化学习与精心设计的奖励信号相结合,最终可以产生高度先进的人工智能。
当今最复杂的大型语言模型(LLM)就是这两个概念的典范。自 GPT-3 以来,功能强大的 LLMs 浪潮主要依靠扩展计算能力和数据来吸收大量知识。最近的推理模型,如 DeepSeek-R1,进一步证明了直接奖励信号的强化学习足以获得复杂的推理能力。
什么是体验时代?
经验时代 "建立在萨顿和西尔弗所倡导的概念之上,现在又结合了人工智能的最新进展。作者指出,"仅靠从人类数据中进行监督学习来推动进步的步伐明显放缓,这表明需要一种新的方法"。
这种新方法需要一个全新的数据源,随着代理能力的提高,数据源的生成方式也会不断改进。"萨顿和西尔弗解释说:"要做到这一点,就必须允许代理从自身的经验中不断学习,即代理与环境交互时产生的数据。他们认为,最终,"经验将成为改进的主要媒介,并最终使当今系统中使用的人类数据规模相形见绌"。
作者认为,未来的人工智能系统将 "突破以人为中心的人工智能系统的局限性",不仅要从经验数据中学习,还要从四个关键维度学习:
- 流:人工智能代理不是在孤立的事件中运行,而是 "拥有自己的经验流,像人类一样,在很长的时间尺度上不断进步"。这样就能进行长期规划并逐步调整行为。这方面的早期迹象出现在人工智能系统中,这些系统具有广泛的上下文窗口和记忆架构,可通过用户互动不断更新。
- 行动与观察:体验时代的代理系统将超越人类特权的行动和观察,在现实世界中自主运行。我们可以在使用计算机控制和模型上下文协议(MCP)等工具与外部应用程序和资源对接的代理系统中看到这一点。
- 奖励:虽然目前的强化学习系统在很大程度上依赖于人类设计的奖励功能,但未来的人工智能代理应该创建自己的动态奖励功能。这些功能将随着时间的推移而不断发展,使用户的偏好与来自代理行动和观察的真实反馈相一致。早期的自我设计奖励系统,如英伟达(Nvidia)的 DrEureka,提供了这种未来的曙光。
- 规划与推理:目前的推理模型通常是模仿人类思维设计的。作者提出:"肯定存在更高效的思维机制,可以使用非人类语言,例如利用符号计算、分布式计算、连续计算或可微分计算。人工智能代理应该与世界打交道,利用观察到的数据来测试、完善和更新其推理,同时建立一个内部世界模型。
人工智能代理通过强化学习进行调整的概念并不新鲜,但在历史上,这类代理仅限于棋盘游戏等严格控制的环境。现在,能够驾驭复杂环境(如操作计算机)的代理加上强化学习方面的进步,有望克服这些限制,加速向体验时代转变。
这对企业意味着什么?
萨顿和西尔弗的论文中针对实际应用提出了一个重要观点:"代理可以使用'人性化'的操作和观察,如用户界面,自然而然地促进与用户的沟通和协作。代理还可以采取'机器友好'的行动,执行代码和调用应用程序接口,使代理能够自主地为其目标服务"。
体验时代意味着开发人员必须同时为人类用户和人工智能代理设计应用程序。机器友好型操作需要安全、可访问的 API,可直接使用或通过 MCP 等接口使用。这还涉及创建可通过谷歌 Agent2Agent 等协议发现的代理。设计应用程序接口和代理接口,允许访问操作和观察结果,将使代理能够逐步推理并从与软件的交互中学习。
如果萨顿和西尔弗的设想得以实现,数十亿个代理最终将在网络上运行,随后在物理世界中执行任务。它们的行为和需求将与人类用户有本质区别。建立对代理友好的交互方法对于有效利用未来的人工智能系统和降低潜在风险至关重要。
"萨顿和西尔弗总结说:"通过建立在 RL 基础之上,并调整其核心原则以应对新时代的挑战,我们可以释放自主学习的全部潜能,并为实现真正的超人智能铺平道路。
DeepMind 拒绝为本新闻提供更多评论。
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦





首页






