选项
首页
新闻
字节跳动发布Seed-Thinking-v1.5 AI模型以增强推理能力

字节跳动发布Seed-Thinking-v1.5 AI模型以增强推理能力

2025-08-23
185

高级推理AI的竞赛始于2024年9月OpenAI的o1模型,随着2025年1月DeepSeek的R1发布而加速。

主要AI开发者现正竞相打造更快、更具成本效益的推理AI模型,通过链式思考过程提供精确、深思熟虑的回答,确保回答前的准确性。

字节跳动,TikTok的母公司,推出了Seed-Thinking-v1.5,这是一个在技术论文中概述的新大型语言模型(LLM),旨在提升STEM和通用领域的推理能力。

该模型尚未发布,其许可模式——无论是专有、开源还是混合——仍未披露。然而,该论文提供了值得在发布前探索的关键见解。

继Meta的Llama 4和Mistral的Mixtral之后,Seed-Thinking-v1.5采用了专家混合(MoE)架构。

这种方法通过整合多个专注于不同领域的专业模型来提升效率。

Seed-Thinking-v1.5一次仅使用其2000亿参数中的200亿,优化了性能。

字节跳动在GitHub上发布的论文强调了该模型专注于结构化推理和深思熟虑的回答生成。

它超越了DeepSeek R1,并在第三方基准测试中与Google的Gemini 2.5 Pro和OpenAI的o3-mini-high匹敌,甚至在ARC-AGI基准测试中表现出色,该基准是衡量向通用人工智能进展的关键指标,超越了OpenAI标准下人类在经济价值任务中的表现。

作为紧凑而强大的替代大型模型,Seed-Thinking-v1.5通过创新的强化学习、精选训练数据和先进的AI基础设施实现了强劲的基准测试结果。

基准测试表现与核心优势

Seed-Thinking-v1.5在困难任务中表现出色,在AIME 2024上得分86.7%,在Codeforces上pass@8得分55.0%,在GPQA科学基准测试中得分77.3%,在推理指标上接近或超越OpenAI的o3-mini-high和Google的Gemini 2.5 Pro等模型。

在非推理任务中,它比DeepSeek R1高出8.0%的人类偏好胜率,展示了逻辑和数学之外的多样性。

为应对基准测试饱和,字节跳动创建了BeyondAIME,一个更难的数学基准测试,以抵制记忆并更好地评估模型性能。这与Codeforces数据集一起,将公开发布以助力未来研究。

训练数据策略

数据质量在开发Seed-Thinking-v1.5中至关重要。用于监督微调的40万个样本经过精心挑选:30万个可验证的STEM、逻辑和编码任务,以及10万个不可验证的任务,如创意写作。

用于强化学习的数据分为:

  • 可验证问题:从精英竞赛中精心挑选的10万个STEM问题和逻辑谜题,由专家验证。
  • 不可验证任务:用于开放式提示的人类偏好数据集,通过成对奖励模型评估。

超过80%的STEM数据专注于高级数学,逻辑任务如数独和24点谜题按模型进展进行扩展。

强化学习创新

Seed-Thinking-v1.5使用定制的actor-critic(VAPO)和策略梯度(DAPO)框架来稳定强化学习,解决长链式思考场景中的问题。

两个奖励模型增强了强化学习监督:

  • Seed-Verifier:基于规则的LLM,确保生成答案与参考答案的数学等价性。
  • Seed-Thinking-Verifier:基于推理的评判模型,保持一致性评估,抵御奖励操控。

这一双重系统支持简单和复杂任务的精确评估。

可扩展的基础设施设计

字节跳动的HybridFlow框架,由Ray集群提供支持,支持高效的大规模训练,通过协同定位训练和推理以最小化GPU空闲时间。

流式推出系统(SRS)将模型演化与运行时分离,通过异步管理部分生成,将迭代速度提高至三倍。

其他技术包括:

  • 混合精度(FP8)以提高内存效率
  • 专家并行和内核自动调优以优化MoE
  • ByteCheckpoint用于稳健的检查点
  • AutoTuner用于优化的并行和内存设置

以人为本的评估与实际应用

在创意写作、人文学科和一般对话的人类测试中,Seed-Thinking-v1.5超越了DeepSeek R1,证明了其现实世界的相关性。

团队指出,在可验证任务上的训练增强了对创意领域的泛化能力,这是由严格的数学工作流程驱动的。

对技术团队和企业的意义

对于管理LLM生命周期的技术领导者,Seed-Thinking-v1.5提供了一个将高级推理整合到企业AI系统中的模型。

其模块化训练,结合可验证数据集和多阶段强化学习,适合需要精确控制的LLM开发团队。

Seed-Verifier和Seed-Thinking-Verifier增强了可信的奖励建模,对于面向客户或受监管的环境至关重要。

对于时间紧迫的团队,VAPO和动态采样减少了迭代周期,简化了特定任务的微调。

混合基础设施,包括SRS和FP8优化,提升了训练吞吐量和硬件效率,适用于云和本地系统。

模型的自适应奖励反馈解决了管理多样化数据管道的挑战,确保跨领域的一致性。

对于数据工程师,严格的数据过滤和专家验证的重点强调了高质量数据集在提升模型性能中的价值。

未来展望

由吴永辉领导、林海滨公开代表的字节跳动Seed LLM系统团队开发的Seed-Thinking-v1.5,基于Doubao 1.5 Pro的努力,采用了共享的RLHF和数据精选技术。

团队旨在改进强化学习,专注于训练效率和不可验证任务的奖励建模。发布BeyondAIME等基准测试将推动推理导向的AI研究的进一步进展。

相关文章
山姆·奥特曼引发关于人工智能减速的辩论 山姆·奥特曼引发关于人工智能减速的辩论 在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗 OpenAI 与苹果公司就商业秘密诉讼进行对抗 OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
前TikTok高管推出一款基于人工智能的应用程序,帮助用户掌握拍照姿势 前TikTok高管推出一款基于人工智能的应用程序,帮助用户掌握拍照姿势 越来越多的企业开始利用人工智能图像生成技术,向用户传授摄影技巧。去年,谷歌在Pixel设备上推出了“相机教练”(Camera Coach)功能,帮助用户调整取景和构图;今年7月,Adobe在其实验性相机应用中推出了一项新功能,利用人工智能对照片进行点评并推荐调整方案。顺应这一趋势,前TikTok员工Melody Chu和Jing Liu即将推出一款名为“Superpose”的全新iOS应用,该应用
相关专题推荐
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
评论 (1)
0/500
ChristopherDavis
ChristopherDavis 2026-01-19 08:30:41

Cette accélération dans la course au raisonnement avancé me donne un peu le vertige 😅. D'un côté c'est fascinant de voir comment les modèles deviennent de plus en plus 'intelligents', mais d'un autre... on est certains que tout ce développement est sous contrôle ? Pas sûr que les entreprises pensent beaucoup aux implications éthiques quand elles sont lancées dans cette bataille commerciale ultra-compétitive.

OR