选项
首页
新闻
Meta的Llama 3.1是AI代的进步

Meta的Llama 3.1是AI代的进步

2025-04-15
247

Meta的Llama 3.1是AI代的进步

周二,Meta揭开了其Llama系列大型语言模型(LLMs)的最新成员——Llama 3.1的面纱。该公司自豪地宣称Llama 3.1是首个开源的“前沿模型”,这一术语通常用于指代最先进的人工智能模型。

Llama 3.1有多种规模,但真正引人注目的是其巨型“405B”模型。凭借惊人的4050亿个神经“权重”或参数,它超越了其他著名开源模型,如Nvidia的Nemotron 4、Google的Gemma 2和Mixtral。更引人入胜的是Meta团队在打造这一巨型模型时所做的三个关键决策。

这些决策堪称神经网络工程的杰作,构成了Llama 3.1 405B构建和训练的支柱。它们还建立在Meta在Llama 2中展示的效率提升基础上,展示了减少深度学习总体计算预算的潜力。

首先,Llama 3.1 405B放弃了Google在其闭源Gemini 1.5和Mistral在其Mixtral中使用的“专家混合”方法。这种方法涉及创建不同的神经权重组合,其中一些可以关闭以简化预测。相反,Meta的研究人员坚持使用自Google在2017年引入的经典“仅解码器变换器模型架构”。他们声称这一选择带来了更稳定的训练过程。

其次,为了提升这种简单变换器模型的性能,Meta的团队提出了一种巧妙的多阶段训练方法。众所周知,平衡训练数据量和计算资源会显著影响预测质量。但传统的“扩展定律”,即基于模型规模和数据预测性能的规则,并不一定能反映模型在“下游”任务(如推理测试)中的表现。

因此,Meta开发了自己的扩展定律。他们增加了训练数据和计算资源,通过多次迭代测试不同组合,以查看生成的模型在关键下游任务中的表现。这一细致的过程帮助他们找到了最佳点,从而选择了4050亿个参数作为旗舰模型。最终训练由Meta的Grand Teton AI服务器上的16000个Nvidia H100 GPU芯片提供支持,并采用复杂系统并行运行数据和权重。

第三个创新在于训练后阶段。每次训练结束后,Llama 3.1都会经历一个由人类反馈指导的严格过程,类似于OpenAI和其他公司用来优化模型输出的方法。这包括“监督微调”,模型通过人类偏好学习区分理想和非理想输出。

Meta随后引入了一种名为“直接偏好优化”(DPO)的创新,这是今年由斯坦福大学AI学者开创的一种更高效的强化学习方法。他们还通过展示使用API调用解决的提示示例,训练Llama 3.1使用“工具”,如外部搜索引擎,从而提升其“零样本”工具使用能力。

为了对抗“幻觉”,团队精心挑选了特定训练数据并创建了原创问答对,微调模型以仅回答其知道的内容,并拒绝回答不确定的问题。

在整个开发过程中,Meta研究人员强调简单性,指出高质量数据、规模和直接的方法始终带来最佳结果。尽管他们探索了更复杂的架构和训练方案,但发现增加的复杂性并不足以证明其益处。

Llama 3.1 405B的规模是开源模型的一个里程碑,通常被商业闭源模型所压制。Meta的首席执行官马克·扎克伯格强调了其经济优势,指出开发者运行Llama 3.1 405B的推理成本仅为使用GPT-4o等模型的一半。

扎克伯格还将开源AI视为软件的自然发展,类比Unix从专有系统演变为更先进、安全和广泛的生态系统,这得益于开源开发。

然而,正如ZDNET的Steven Vaughan-Nichols指出的,Meta在Hugging Face上发布的代码缺少一些细节,且代码许可证比典型的开源许可证更严格。因此,尽管Llama 3.1算是开源,但并非完全如此。然而,其训练过程的详细程度令人耳目一新,尤其是当OpenAI和Google等巨头对其闭源模型越来越讳莫如深时。

相关文章
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才 字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才 在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印 Suno 在法律诉讼中为歌曲添加水印 Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据 马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据 埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
相关专题推荐
设计与艺术 适用于角色设定表、灵感板和项目提案演示文稿的 AI 视觉风格参考工具
适用于角色设定表、灵感板和项目提案演示文稿的 AI 视觉风格参考工具

2026年最新最佳AI视觉风格参考工具(适用于角色设定图、灵感板和项目提案)现已登陆XIX.AI!这份精心筛选的高评分清单汇集了经过严格实战测试、功能强大且能彻底改变游戏规则的工具。 您将在此找到免费版与付费版的对比分析、详细排名以及不容错过的精选工具,助您激发创意并优化工作流程。立即探索,发现能有效提升工作效率的理想工具!

11 个工具
xix.ai
搜索引擎优化 最适合制定搜索策略的AI搜索结果页面(SERP)分析工具
最适合制定搜索策略的AI搜索结果页面(SERP)分析工具

2026年最新、最受欢迎且评价最高的人工智能搜索结果页面(SERP)分析工具,均由XIX.AI通过严格的实际测试精心筛选,并每周更新排名。这些强大的工具可助您发掘隐藏的优化机会、提升内容表现,并在搜索领域获得竞争优势。立即寻找最适合您的工具,提升您的搜索策略。现在就来探索吧!

13 个工具
xix.ai
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
评论 (27)
0/500
DavidRodriguez
DavidRodriguez 2025-08-31 00:30:32

Interessant, dass Meta Llama 3.1 als erstes Open-Source-Modell bezeichnet. Aber wer kann so ein riesiges Modell eigentlich sinnvoll nutzen? Für kleine Unternehmen bestimmt zu teuer im Betrieb. 🧐

ThomasBaker
ThomasBaker 2025-07-31 09:41:20

Wow, Llama 3.1 sounds like a game-changer! Open-source and frontier-level? That’s huge for AI devs. Curious how it stacks up against closed models like GPT-4. 😎

AlbertThomas
AlbertThomas 2025-04-22 23:18:49

O Llama 3.1 é incrível! Adoro que seja de código aberto, é como ter um superpoder no meu arsenal de programação. No começo pode ser um pouco confuso, mas vale a pena experimentar se você gosta de IA! 🚀

GaryGonzalez
GaryGonzalez 2025-04-22 16:13:48

ラマ3.1は本当にすごい!オープンソースで使えるのが最高です。最初は少し圧倒されましたが、慣れると便利です。AIに興味があるなら、ぜひ試してみてください!🚀

AnthonyPerez
AnthonyPerez 2025-04-22 15:26:53

¡Llama 3.1 es una bestia! Me encanta que sea de código abierto, es como tener un superpoder en mi arsenal de programación. Al principio puede ser un poco abrumador, pero definitivamente vale la pena probarlo si te interesa la IA! 🚀

JustinAnderson
JustinAnderson 2025-04-21 05:42:32

¡Llama 3.1 de Meta es una maravilla! Me sorprende cómo están empujando los límites con la IA de código abierto. El rendimiento es genial, pero desearía que hubiera más documentación para principiantes. De todas formas, ¡es una herramienta que hay que probar! 💪

OR