人类声称AI并不停滞,它超出了基准测试

大型语言模型(LLM)和其他生成式AI技术在自我修正方面取得了显著进展,这为新应用铺平了道路,包括所谓的“代理式AI”,这是由领先的AI模型开发公司Anthropic的副总裁Michael Gerstenhaber所述。。
“它在自我修正、自我推理方面表现得越来越好,”在Anthropic领导API技术的Gerstenhaber在纽约接受彭博智能分析师Anurag Rana采访时分享道。Anthropic是Claude系列LLM的创造者,是OpenAI的GPT模型的直接竞争者。“每隔几个月,我们就发布一个新模型,扩展LLM的功能,”他补充说,强调了行业动态的动态性质,每次模型修订都会解锁新的潜在用途。
AI模型的新功能
Anthropic的最新模型引入了任务规划等功能,使它们能够像人类一样在计算机上执行任务,例如在线订购披萨。Gerstenhaber指出,这种逐步执行任务的方式“昨天还不可行,今天已经触手可及”。
这场讨论还邀请了AI初创公司Scale AI的首席技术官Vijay Karunamunthy,是一场由彭博智能主办的为期一天的会议的一部分,主题为“生成式AI:它能否兑现生产力承诺?”
挑战AI怀疑论
Gerstenhaber的见解挑战了AI怀疑论者的观点,他们认为生成式AI和更广泛的AI领域正在“撞墙”,认为每个新模型迭代的回报递减。例如,AI学者Gary Marcus自2022年以来一直公开表达他的担忧,警告说,仅仅增加AI模型的参数数量不会按比例提高性能。。
然而,Gerstenhaber断言,Anthropic正在推动超越当前AI基准测试所能衡量的边界。他说:“即使某些领域的进展看似放缓,那是因为我们正在解锁全新功能,但我们已经饱和了基准测试以及执行旧任务的能力。”这使得评估当前生成式AI模型的全部能力变得越来越困难。
扩展与学习
Gerstenhaber和Karunamunthy都强调了扩展生成式AI模型以增强其自我修正能力的重要性。Gerstenhaber评论说:“我们确实看到了智能的扩展越来越多。”Karunamunthy补充道:“我们认为规划和推理没有撞墙的一个原因是,我们仍在学习如何构建这些任务,以便模型能够适应新的和多样的环境。”
Gerstenhaber同意这一观点,他说:“我们正处于早期阶段,从应用开发者那里学习他们的需求以及模型的不足之处,然后我们可以将其整合回语言模型中。”
实时学习与适应
据Gerstenhaber称,这一进展很大程度上得益于Anthropic的快速基础研究步伐,以及来自行业反馈的实时学习。他说:“我们正在适应行业告诉我们的需求,实时学习。”
客户通常从较大的模型开始,然后缩小到更简单的模型以适应特定用途。Gerstenhaber解释说:“最初,他们评估一个模型是否足够智能来很好地执行任务,然后是否足够快以满足他们的应用需求,最后是否尽可能具有成本效益。”
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (8)
0/500
This self-correction stuff is wild! 😮 It's like AI is learning to double-check its own homework. Wonder how far this 'agentic AI' will go—could it outsmart us at our own jobs soon?
It's wild to think AI can now self-correct! 😮 Makes me wonder how soon we'll see these 'agentic AI' systems running our lives—hope they don’t outsmart us too much!
This article really opened my eyes to how fast AI is evolving! Self-correcting LLMs sound like a game-changer for agentic AI. Can’t wait to see what new apps come out of this! 😄
La perspectiva de Anthropic sobre que la IA no se estanca sino que supera los benchmarks es bastante genial. Es como si la IA estuviera jugando ajedrez mientras nosotros aún estamos tratando de entender las damas. Lo de la autocorrección suena prometedor, pero aún estoy un poco escéptico. 🤔
Anthropic의 AI가 정체되지 않고 벤치마크를 뛰어넘는다는 생각이 멋지네요. AI는 체스를 하고 있는데, 우리는 아직 체커를 이해하는 단계예요. 자기 교정 이야기는 유망하지만, 아직 조금 회의적이에요. 🤔

大型语言模型(LLM)和其他生成式AI技术在自我修正方面取得了显著进展,这为新应用铺平了道路,包括所谓的“代理式AI”,这是由领先的AI模型开发公司Anthropic的副总裁Michael Gerstenhaber所述。。
“它在自我修正、自我推理方面表现得越来越好,”在Anthropic领导API技术的Gerstenhaber在纽约接受彭博智能分析师Anurag Rana采访时分享道。Anthropic是Claude系列LLM的创造者,是OpenAI的GPT模型的直接竞争者。“每隔几个月,我们就发布一个新模型,扩展LLM的功能,”他补充说,强调了行业动态的动态性质,每次模型修订都会解锁新的潜在用途。
AI模型的新功能
Anthropic的最新模型引入了任务规划等功能,使它们能够像人类一样在计算机上执行任务,例如在线订购披萨。Gerstenhaber指出,这种逐步执行任务的方式“昨天还不可行,今天已经触手可及”。
这场讨论还邀请了AI初创公司Scale AI的首席技术官Vijay Karunamunthy,是一场由彭博智能主办的为期一天的会议的一部分,主题为“生成式AI:它能否兑现生产力承诺?”
挑战AI怀疑论
Gerstenhaber的见解挑战了AI怀疑论者的观点,他们认为生成式AI和更广泛的AI领域正在“撞墙”,认为每个新模型迭代的回报递减。例如,AI学者Gary Marcus自2022年以来一直公开表达他的担忧,警告说,仅仅增加AI模型的参数数量不会按比例提高性能。。
然而,Gerstenhaber断言,Anthropic正在推动超越当前AI基准测试所能衡量的边界。他说:“即使某些领域的进展看似放缓,那是因为我们正在解锁全新功能,但我们已经饱和了基准测试以及执行旧任务的能力。”这使得评估当前生成式AI模型的全部能力变得越来越困难。
扩展与学习
Gerstenhaber和Karunamunthy都强调了扩展生成式AI模型以增强其自我修正能力的重要性。Gerstenhaber评论说:“我们确实看到了智能的扩展越来越多。”Karunamunthy补充道:“我们认为规划和推理没有撞墙的一个原因是,我们仍在学习如何构建这些任务,以便模型能够适应新的和多样的环境。”
Gerstenhaber同意这一观点,他说:“我们正处于早期阶段,从应用开发者那里学习他们的需求以及模型的不足之处,然后我们可以将其整合回语言模型中。”
实时学习与适应
据Gerstenhaber称,这一进展很大程度上得益于Anthropic的快速基础研究步伐,以及来自行业反馈的实时学习。他说:“我们正在适应行业告诉我们的需求,实时学习。”
客户通常从较大的模型开始,然后缩小到更简单的模型以适应特定用途。Gerstenhaber解释说:“最初,他们评估一个模型是否足够智能来很好地执行任务,然后是否足够快以满足他们的应用需求,最后是否尽可能具有成本效益。”
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
This self-correction stuff is wild! 😮 It's like AI is learning to double-check its own homework. Wonder how far this 'agentic AI' will go—could it outsmart us at our own jobs soon?
It's wild to think AI can now self-correct! 😮 Makes me wonder how soon we'll see these 'agentic AI' systems running our lives—hope they don’t outsmart us too much!
This article really opened my eyes to how fast AI is evolving! Self-correcting LLMs sound like a game-changer for agentic AI. Can’t wait to see what new apps come out of this! 😄
La perspectiva de Anthropic sobre que la IA no se estanca sino que supera los benchmarks es bastante genial. Es como si la IA estuviera jugando ajedrez mientras nosotros aún estamos tratando de entender las damas. Lo de la autocorrección suena prometedor, pero aún estoy un poco escéptico. 🤔
Anthropic의 AI가 정체되지 않고 벤치마크를 뛰어넘는다는 생각이 멋지네요. AI는 체스를 하고 있는데, 우리는 아직 체커를 이해하는 단계예요. 자기 교정 이야기는 유망하지만, 아직 조금 회의적이에요. 🤔





首页






