谷歌的 GEPA 提升了 LLM 性能,绕过了昂贵的强化学习需求
来自加州大学伯克利分校、斯坦福大学和 Databricks 公司的研究人员推出了一种名为 GEPA 的新型人工智能优化方法,与传统的强化学习技术相比,该方法在使大型语言模型适应专门任务方面有了显著改进。
GEPA 有别于传统的学习方法,即在简单的数字分数驱动下,通过成千上万次的试错尝试进行学习。相反,它利用 LLM 的内部语言能力来分析其性能、识别错误并逐步完善其指令。除了比既有方法获得更高的准确性外,GEPA 的效率也高得多,试运行次数最多可减少 35 次,却能取得卓越的成果。
对于开发复杂人工智能代理和工作流程的公司来说,这一突破意味着更快的开发速度、更低的计算成本以及更强大、更可靠的应用。
优化现代人工智能系统的高成本
现代企业人工智能应用很少依赖于对 LLM 的单一调用。它们通常是 "复合人工智能系统"--结合多个 LLM 模块、数据库或代码解释器等外部工具以及自定义逻辑来执行复杂任务(如多步骤研究和数据分析)的复杂工作流。
这些系统常用的优化策略是强化学习,例如高级推理模型中使用的组相对策略优化等技术。这些方法将人工智能系统视为一个黑盒子,通过基本的成功指标来评估任务。然后,利用这种有限的反馈来逐步调整模型参数,以获得更好的性能。
RL 的主要局限在于效率低下。要从最小的数字分数中有效地学习,RL 通常需要数以万计甚至数十万计的试运行。对于任何涉及昂贵的工具调用或专有模型的实际企业应用来说,这一过程都是极其缓慢和昂贵的。
正如作者之一、加州大学伯克利分校博士生 Lakshya A Agrawal 所解释的那样,这种复杂性给许多组织带来了重大障碍。"Agrawal 指出:"对于许多团队来说,RL 因其费用和复杂性而不切实际--他们默认的方法主要是人工提示工程。GEPA 专为使用高性能模型的团队而设计,这些模型通常无法进行微调,因此他们可以在不管理专用硬件的情况下提高性能。
研究团队是这样提出挑战的:"我们如何才能从每一次代价高昂的试验中提取最大的学习信号,从而使复杂的模块化人工智能系统在紧张的数据或预算限制下进行有效的调整?
通过语言学习的优化器

GEPA 框架 来源:ArXiv GEPA 通过用详细的自然语言反馈取代稀疏的奖励信号来应对这一挑战。它利用了这样一个事实:人工智能系统的整个执行过程--其推理步骤、工具调用和错误信息--都可以表示为文本,供 LLM 处理。这种方法基于三个核心原则。
首先是 "基因提示进化",GEPA 将一组提示视为基因库,反复修改以生成新的和潜在的改进版本。这一变异过程遵循第二条原则:"通过自然语言反馈进行反思"。经过多次试运行后,GEPA 会向 LLM 提供完整的执行历史和结果。然后,LLM 通过分析这些信息来诊断问题,并起草更精确、更完善的提示。例如,它可能会检查编译器错误,并确定提示必须指定特定的库版本,而不是仅仅收到代码生成的低分。
第三项原则是 "基于帕累托的选择",它促进了智能探索。GEPA 不会只关注得分最高的单一提示,因为这样做有可能导致采用次优解决方案。它能识别出哪些提示在不同的测试案例中表现出色,从而编制出一份主要候选者名册。通过从这些成功策略中取样,GEPA 探索了更广阔的解决方案空间,更有可能发现在不同输入中表现出色的提示。

专注于单个顶级候选者可能会使模型陷入局部最小值,而帕累托选择则会探索更多选项,以找到最优解 来源:ArXiv 整个过程的成功取决于研究人员所说的 "反馈工程"。Agrawal 强调,关键在于捕捉系统已经产生但往往被忽略的丰富文本细节。"他解释说:"传统的管道通常将这些信息浓缩成单一的数字奖励,隐藏了特定结果背后的原因。"GEPA的核心方法是构建反馈,不仅揭示最终结果,还揭示中间步骤和纯文本中的错误--这与人类专家用来分析系统行为的证据相同。
例如,对于文档检索系统来说,这就需要列出哪些文档被正确检索,哪些被遗漏,而不仅仅是报告最终的准确率得分。
实践中的 GEPA
研究团队在四个不同的任务中对 GEPA 进行了评估,从多跳问题解答到隐私保护查询。他们测试了开源和专有模型,将 GEPA 与基于 RL 的 GRPO 和高级提示优化器 MIPROv2 进行了比较。
在所有评估中,GEPA 的性能明显优于 GRPO,得分最多提高了 19%,而试运行次数却减少了 35 倍。Agrawal 举例说明了这一效率:"他说:"与 GRPO 的 24 小时相比,我们用 GEPA 在大约 3 小时内优化了一个答题系统--开发时间缩短了 8 倍,同时性能提高了 20%。"针对相同的测试场景,基于 RL 的优化在 GPU 计算上花费了约 300 美元,而 GEPA 只用了不到 20 美元就取得了更好的结果--在我们的实验中,成本降低了 15 倍"。

GEPA 在关键性能指标上优于其他基准方法 来源:ArXiv 除了原始指标之外,研究人员还观察到,GEPA 优化后的系统在处理新的、未见过的数据时更加可靠,"泛化差距 "更小就说明了这一点。Agrawal 认为,这种鲁棒性的提高源于 GEPA 从更丰富的反馈中学习。"他说:"GEPA 较小的泛化差距可能是由于它对每个结果都使用了详细的自然语言反馈,说明了哪些成功、哪些失败以及原因,而不是依赖于单一的数字分数。"这鼓励系统在全面了解成功的基础上制定指令和策略,而不是简单地记忆训练数据中的模式。对于企业来说,这种增强的可靠性意味着在面向客户的场景中,人工智能应用将更加稳健、适应性更强。
一个关键的实际优势是,GEPA 的最终指令比 MIPROv2 等优化器生成的提示短 9.2 倍,后者通常包含大量示例。对于基于 API 的模型来说,更短的提示可以减少延迟并降低成本,从而使最终应用在生产中运行得更快更经济。
论文还探讨了 GEPA 作为 "推理时间 "搜索策略的应用前景,将人工智能从单步答案生成器转变为迭代问题求解器。Agrawal 描述了将 GEPA 整合到公司开发流水线的可能性,GEPA 可以自动创建和完善系统的多个优化版本,测试它们的性能,并将最佳变体提交工程审查。"Agrawal 补充说:"这就将优化变成了一个连续的自动化流程,能快速生成解决方案,其质量往往能达到或超过专家手动调整的水平。在对 CUDA 代码生成的测试中,这种方法在 20% 的任务中将性能提升到了专家级水平,而使用 GPT-4o 这样的模型进行单次尝试时,性能提升率仅为 0%。
作者认为,GEPA 是迈向人工智能开发新模式的基础性一步。然而,除了促进更像人类的人工智能之外,它最直接的影响可能是使高性能系统的创建民主化。
"我们预计,GEPA 将促进人工智能系统构建的积极转变,使那些拥有深厚的任务领域专业知识,但可能没有时间或意愿掌握复杂 RL 技术的终端用户也能进行优化,"Agrawal 总结道。"它赋予了拥有精确、特定任务知识的利益相关者权力"。
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (0)
0/500
来自加州大学伯克利分校、斯坦福大学和 Databricks 公司的研究人员推出了一种名为 GEPA 的新型人工智能优化方法,与传统的强化学习技术相比,该方法在使大型语言模型适应专门任务方面有了显著改进。
GEPA 有别于传统的学习方法,即在简单的数字分数驱动下,通过成千上万次的试错尝试进行学习。相反,它利用 LLM 的内部语言能力来分析其性能、识别错误并逐步完善其指令。除了比既有方法获得更高的准确性外,GEPA 的效率也高得多,试运行次数最多可减少 35 次,却能取得卓越的成果。
对于开发复杂人工智能代理和工作流程的公司来说,这一突破意味着更快的开发速度、更低的计算成本以及更强大、更可靠的应用。
优化现代人工智能系统的高成本
现代企业人工智能应用很少依赖于对 LLM 的单一调用。它们通常是 "复合人工智能系统"--结合多个 LLM 模块、数据库或代码解释器等外部工具以及自定义逻辑来执行复杂任务(如多步骤研究和数据分析)的复杂工作流。
这些系统常用的优化策略是强化学习,例如高级推理模型中使用的组相对策略优化等技术。这些方法将人工智能系统视为一个黑盒子,通过基本的成功指标来评估任务。然后,利用这种有限的反馈来逐步调整模型参数,以获得更好的性能。
RL 的主要局限在于效率低下。要从最小的数字分数中有效地学习,RL 通常需要数以万计甚至数十万计的试运行。对于任何涉及昂贵的工具调用或专有模型的实际企业应用来说,这一过程都是极其缓慢和昂贵的。
正如作者之一、加州大学伯克利分校博士生 Lakshya A Agrawal 所解释的那样,这种复杂性给许多组织带来了重大障碍。"Agrawal 指出:"对于许多团队来说,RL 因其费用和复杂性而不切实际--他们默认的方法主要是人工提示工程。GEPA 专为使用高性能模型的团队而设计,这些模型通常无法进行微调,因此他们可以在不管理专用硬件的情况下提高性能。
研究团队是这样提出挑战的:"我们如何才能从每一次代价高昂的试验中提取最大的学习信号,从而使复杂的模块化人工智能系统在紧张的数据或预算限制下进行有效的调整?
通过语言学习的优化器

GEPA 通过用详细的自然语言反馈取代稀疏的奖励信号来应对这一挑战。它利用了这样一个事实:人工智能系统的整个执行过程--其推理步骤、工具调用和错误信息--都可以表示为文本,供 LLM 处理。这种方法基于三个核心原则。
首先是 "基因提示进化",GEPA 将一组提示视为基因库,反复修改以生成新的和潜在的改进版本。这一变异过程遵循第二条原则:"通过自然语言反馈进行反思"。经过多次试运行后,GEPA 会向 LLM 提供完整的执行历史和结果。然后,LLM 通过分析这些信息来诊断问题,并起草更精确、更完善的提示。例如,它可能会检查编译器错误,并确定提示必须指定特定的库版本,而不是仅仅收到代码生成的低分。
第三项原则是 "基于帕累托的选择",它促进了智能探索。GEPA 不会只关注得分最高的单一提示,因为这样做有可能导致采用次优解决方案。它能识别出哪些提示在不同的测试案例中表现出色,从而编制出一份主要候选者名册。通过从这些成功策略中取样,GEPA 探索了更广阔的解决方案空间,更有可能发现在不同输入中表现出色的提示。

整个过程的成功取决于研究人员所说的 "反馈工程"。Agrawal 强调,关键在于捕捉系统已经产生但往往被忽略的丰富文本细节。"他解释说:"传统的管道通常将这些信息浓缩成单一的数字奖励,隐藏了特定结果背后的原因。"GEPA的核心方法是构建反馈,不仅揭示最终结果,还揭示中间步骤和纯文本中的错误--这与人类专家用来分析系统行为的证据相同。
例如,对于文档检索系统来说,这就需要列出哪些文档被正确检索,哪些被遗漏,而不仅仅是报告最终的准确率得分。
实践中的 GEPA
研究团队在四个不同的任务中对 GEPA 进行了评估,从多跳问题解答到隐私保护查询。他们测试了开源和专有模型,将 GEPA 与基于 RL 的 GRPO 和高级提示优化器 MIPROv2 进行了比较。
在所有评估中,GEPA 的性能明显优于 GRPO,得分最多提高了 19%,而试运行次数却减少了 35 倍。Agrawal 举例说明了这一效率:"他说:"与 GRPO 的 24 小时相比,我们用 GEPA 在大约 3 小时内优化了一个答题系统--开发时间缩短了 8 倍,同时性能提高了 20%。"针对相同的测试场景,基于 RL 的优化在 GPU 计算上花费了约 300 美元,而 GEPA 只用了不到 20 美元就取得了更好的结果--在我们的实验中,成本降低了 15 倍"。

除了原始指标之外,研究人员还观察到,GEPA 优化后的系统在处理新的、未见过的数据时更加可靠,"泛化差距 "更小就说明了这一点。Agrawal 认为,这种鲁棒性的提高源于 GEPA 从更丰富的反馈中学习。"他说:"GEPA 较小的泛化差距可能是由于它对每个结果都使用了详细的自然语言反馈,说明了哪些成功、哪些失败以及原因,而不是依赖于单一的数字分数。"这鼓励系统在全面了解成功的基础上制定指令和策略,而不是简单地记忆训练数据中的模式。对于企业来说,这种增强的可靠性意味着在面向客户的场景中,人工智能应用将更加稳健、适应性更强。
一个关键的实际优势是,GEPA 的最终指令比 MIPROv2 等优化器生成的提示短 9.2 倍,后者通常包含大量示例。对于基于 API 的模型来说,更短的提示可以减少延迟并降低成本,从而使最终应用在生产中运行得更快更经济。
论文还探讨了 GEPA 作为 "推理时间 "搜索策略的应用前景,将人工智能从单步答案生成器转变为迭代问题求解器。Agrawal 描述了将 GEPA 整合到公司开发流水线的可能性,GEPA 可以自动创建和完善系统的多个优化版本,测试它们的性能,并将最佳变体提交工程审查。"Agrawal 补充说:"这就将优化变成了一个连续的自动化流程,能快速生成解决方案,其质量往往能达到或超过专家手动调整的水平。在对 CUDA 代码生成的测试中,这种方法在 20% 的任务中将性能提升到了专家级水平,而使用 GPT-4o 这样的模型进行单次尝试时,性能提升率仅为 0%。
作者认为,GEPA 是迈向人工智能开发新模式的基础性一步。然而,除了促进更像人类的人工智能之外,它最直接的影响可能是使高性能系统的创建民主化。
"我们预计,GEPA 将促进人工智能系统构建的积极转变,使那些拥有深厚的任务领域专业知识,但可能没有时间或意愿掌握复杂 RL 技术的终端用户也能进行优化,"Agrawal 总结道。"它赋予了拥有精确、特定任务知识的利益相关者权力"。
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






