阿里巴巴推出Qwen-UI-Agent,一款面向现实世界的多模态基础模型
阿里巴巴正式推出了Qwen-UI-Agent,这是一个专为在真实世界环境中运行的图形用户界面(GUI)智能代理设计的基础模型。该模型覆盖移动端、桌面端、网页端及深度搜索环境,突破了传统模拟测试的局限,能够在复杂的物理设备上无缝运行。

超越行业领先者的性能
Qwen-UI-Agent 在权威基准测试和真实环境中均展现出了卓越的能力:
移动端表现:在 MobileWorld 基准测试中取得了高达 82.1% 的得分,超越了多款国际主流旗舰模型。 在其包含 100 多台真实设备的定制基准测试 MobileWorld-Real 中,成功率高达 92.2%,在 Android 日常任务中表现近乎完美。桌面性能:在 OSWorld-Verified 测试中获得 79.5% 的得分,与基线模型相比,该模型在多项任务中显著减少了执行步骤。Web 与通用能力:在 WebArena Web 测试中,该模型在所有对比模型中排名第一。其通用能力和代理能力均超越基础训练模型,能够轻松处理长尾请求。弥合模拟与现实之间的鸿沟
为弥合模拟与实际应用之间的鸿沟,Qwen-UI-Agent 采用了一个包含 100 多部实体手机和 150 多个应用程序的实时移动环境。该设置支持任务创建、轨迹采集和模型训练。 研究团队还推出了 MobileWorld-Real——一个包含 400 多个任务的真实设备基准测试集,可基于实际设备性能进行精确的模型选择。

简化的指令与强大的安全性
除了标准的图形用户界面(GUI)操作外,该模型还能直接执行命令行指令。通过在单次决策中输出批量操作,它缩短了执行轨迹并提高了效率。 整个流程中集成了全面的安全机制:该模型会拒绝并终止涉及非法或高风险请求的任务。对于支付、数据删除或隐私授权等敏感操作,它会在关键步骤暂停,等待用户确认。
此外,该模型支持对超过 100 步的执行轨迹进行在线强化学习。结合自适应课程学习,它能持续提升处理具有挑战性的长期任务的能力。
项目主页:https://tongyi-mai.github.io/Qwen-UI-Agent/
相关文章
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
相关专题推荐
评论 (0)
0/500
阿里巴巴正式推出了Qwen-UI-Agent,这是一个专为在真实世界环境中运行的图形用户界面(GUI)智能代理设计的基础模型。该模型覆盖移动端、桌面端、网页端及深度搜索环境,突破了传统模拟测试的局限,能够在复杂的物理设备上无缝运行。

超越行业领先者的性能
Qwen-UI-Agent 在权威基准测试和真实环境中均展现出了卓越的能力:
移动端表现:在 MobileWorld 基准测试中取得了高达 82.1% 的得分,超越了多款国际主流旗舰模型。 在其包含 100 多台真实设备的定制基准测试 MobileWorld-Real 中,成功率高达 92.2%,在 Android 日常任务中表现近乎完美。桌面性能:在 OSWorld-Verified 测试中获得 79.5% 的得分,与基线模型相比,该模型在多项任务中显著减少了执行步骤。Web 与通用能力:在 WebArena Web 测试中,该模型在所有对比模型中排名第一。其通用能力和代理能力均超越基础训练模型,能够轻松处理长尾请求。弥合模拟与现实之间的鸿沟
为弥合模拟与实际应用之间的鸿沟,Qwen-UI-Agent 采用了一个包含 100 多部实体手机和 150 多个应用程序的实时移动环境。该设置支持任务创建、轨迹采集和模型训练。 研究团队还推出了 MobileWorld-Real——一个包含 400 多个任务的真实设备基准测试集,可基于实际设备性能进行精确的模型选择。

简化的指令与强大的安全性
除了标准的图形用户界面(GUI)操作外,该模型还能直接执行命令行指令。通过在单次决策中输出批量操作,它缩短了执行轨迹并提高了效率。 整个流程中集成了全面的安全机制:该模型会拒绝并终止涉及非法或高风险请求的任务。对于支付、数据删除或隐私授权等敏感操作,它会在关键步骤暂停,等待用户确认。
此外,该模型支持对超过 100 步的执行轨迹进行在线强化学习。结合自适应课程学习,它能持续提升处理具有挑战性的长期任务的能力。
项目主页:https://tongyi-mai.github.io/Qwen-UI-Agent/
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用





首页






