GPT-6 Astra 运行自动售货机长达一年,赚取 15,000 美元,表现比 Claude 高出近 3 倍

Andon Labs 的 Vending-Bench2 测试呈现出令人瞩目的表现:AI 以 500 美元起步,模拟运营了一整年的自动售货机。GPT-6Astra 的平均最终账户余额达到 15,515 美元,首次登顶——更令人惊讶的是,其最差一轮的表现也高于 Claude Fable5.1 的最佳一轮。
两者的差异不仅在于盈利多少,更在于截然不同的商业策略。Astra 成功地将采购价格长期维持在低位,将产品售价压低至原价的约 48%;同时,其规则执行极为稳定,全程未出现预付款损失。相比之下,Fable 的采购成本不断上升,且因未能坚守规则而产生了巨额预付款损失——账面上的资金仅仅通过执行能力的漏洞悄然流失。
在三方竞争测试中,Astra 同样拒绝了违规合作的邀请,并赢得了全部三轮比赛。本次测试的核心焦点在于 Agent 长期自主性的价值:聪明只是一方面,能否在长周期内坚守规则,并将正确的判断转化为正确的行动,才是下一个关键门槛。
相关文章
微软高管称AI数据抓取是“历史上最大的劳动盗窃”,未经删减的文件显示
纽约时报针对OpenAI和微软提起的为期三年的版权诉讼中解密的文件显示,一家公司承认AI抓取构成盗窃,并对媒体机构构成严重威胁。根据诉讼文件,微软的一位高管私下将公司的AI训练方法称为“盗窃”,而OpenAI的领导层承认,其模型对训练它们的出版商和记者构成了“生存威胁”。新解密的记录还详细说明了这些公司如何绕过付费墙而不被察觉地访问和利用这些内容,通过大规模抓取构建训练数据集,并故意从数据中删除版权声明。需要注意的是,这些新信息大多来自《纽约时报》自身的法律简报,而非仍处于保密状态的原始证
ElevenLabs 发布 Music v2,支持多版本生成并赋予完整商业使用权
5月28日,AI语音与音乐技术领域的先驱ElevenLabs正式推出了其最新的音乐生成模型Music v2。作为对十个月前发布的第一代模型的重大演进,Music v2在音乐编曲的复杂性、人声细节以及风格切换能力方面实现了显著提升。1. 核心突破:“模块化”创作工作流Music v2超越了基本的文本转音频转换,为艺术家提供了精细化的创作工作流:动态风格切换: 该模型支持在单首曲目中无缝切换音乐风格,例如从复杂的歌剧过渡到重金属音乐,同时保持节奏的一致性和结构的完整性。分段创作与编辑: 用户
Synthia 将焦点从视频转向 AI 交互,提供实时响应和表现评分
Synthesia 长期以来以利用人工智能在几分钟内制作互动式企业培训视频而闻名,为传统企业学习资源提供了更具成本效益的替代方案。如今,这家英国初创公司正在转变其关注点:企业人工智能的真正竞争优势可能不在于内容创作,而在于展示切实有效的成果。周三,Synthesia 推出了角色扮演会话(Roleplay Sessions),这是一种互动式培训工具,允许员工与人工智能虚拟人排练高风险对话,例如销售推介、绩效评估和客户服务互动。该虚拟人能够动态回应、挑战用户,并根据既定评分标准提供评分。据 Tec
相关专题推荐
评论 (0)
0/500

Andon Labs 的 Vending-Bench2 测试呈现出令人瞩目的表现:AI 以 500 美元起步,模拟运营了一整年的自动售货机。GPT-6Astra 的平均最终账户余额达到 15,515 美元,首次登顶——更令人惊讶的是,其最差一轮的表现也高于 Claude Fable5.1 的最佳一轮。
两者的差异不仅在于盈利多少,更在于截然不同的商业策略。Astra 成功地将采购价格长期维持在低位,将产品售价压低至原价的约 48%;同时,其规则执行极为稳定,全程未出现预付款损失。相比之下,Fable 的采购成本不断上升,且因未能坚守规则而产生了巨额预付款损失——账面上的资金仅仅通过执行能力的漏洞悄然流失。
在三方竞争测试中,Astra 同样拒绝了违规合作的邀请,并赢得了全部三轮比赛。本次测试的核心焦点在于 Agent 长期自主性的价值:聪明只是一方面,能否在长周期内坚守规则,并将正确的判断转化为正确的行动,才是下一个关键门槛。
微软高管称AI数据抓取是“历史上最大的劳动盗窃”,未经删减的文件显示
纽约时报针对OpenAI和微软提起的为期三年的版权诉讼中解密的文件显示,一家公司承认AI抓取构成盗窃,并对媒体机构构成严重威胁。根据诉讼文件,微软的一位高管私下将公司的AI训练方法称为“盗窃”,而OpenAI的领导层承认,其模型对训练它们的出版商和记者构成了“生存威胁”。新解密的记录还详细说明了这些公司如何绕过付费墙而不被察觉地访问和利用这些内容,通过大规模抓取构建训练数据集,并故意从数据中删除版权声明。需要注意的是,这些新信息大多来自《纽约时报》自身的法律简报,而非仍处于保密状态的原始证
ElevenLabs 发布 Music v2,支持多版本生成并赋予完整商业使用权
5月28日,AI语音与音乐技术领域的先驱ElevenLabs正式推出了其最新的音乐生成模型Music v2。作为对十个月前发布的第一代模型的重大演进,Music v2在音乐编曲的复杂性、人声细节以及风格切换能力方面实现了显著提升。1. 核心突破:“模块化”创作工作流Music v2超越了基本的文本转音频转换,为艺术家提供了精细化的创作工作流:动态风格切换: 该模型支持在单首曲目中无缝切换音乐风格,例如从复杂的歌剧过渡到重金属音乐,同时保持节奏的一致性和结构的完整性。分段创作与编辑: 用户
Synthia 将焦点从视频转向 AI 交互,提供实时响应和表现评分
Synthesia 长期以来以利用人工智能在几分钟内制作互动式企业培训视频而闻名,为传统企业学习资源提供了更具成本效益的替代方案。如今,这家英国初创公司正在转变其关注点:企业人工智能的真正竞争优势可能不在于内容创作,而在于展示切实有效的成果。周三,Synthesia 推出了角色扮演会话(Roleplay Sessions),这是一种互动式培训工具,允许员工与人工智能虚拟人排练高风险对话,例如销售推介、绩效评估和客户服务互动。该虚拟人能够动态回应、挑战用户,并根据既定评分标准提供评分。据 Tec





首页






