选项
首页
新闻
Meta捍卫Llama 4版本,引用Bug作为混合质量报告的原因

Meta捍卫Llama 4版本,引用Bug作为混合质量报告的原因

2025-04-23
226

在周末,Meta,这个支持Facebook、Instagram、WhatsApp和Quest VR的巨头,出人意料地推出了他们最新的AI语言模型Llama 4。不仅推出了一款,而是三种新版本,每种都因“Mixture-of-Experts”架构和一种名为MetaP的新训练方法(涉及固定超参数)而拥有增强的功能。此外,所有三种模型都具有扩展的上下文窗口,使它们能在一次交互中处理更多信息。

尽管发布令人兴奋,但AI社区的反应最多只能算是不温不火。周六,Meta将其中两款模型,Llama 4 Scout和Llama 4 Maverick,开放供下载和使用,但回应远非热情。

Llama 4引发AI用户的困惑和批评

在北美颇受欢迎的中文社区1point3acres论坛上出现了一篇未经证实帖子,这篇帖子被转到了Reddit的r/LocalLlama子版块。据称这篇帖子来自Meta GenAI组织的一名研究员,声称Llama 4在内部第三方基准测试中表现不佳。帖子暗示Meta领导层通过在后训练期间混合测试集来操纵结果,以满足各种指标并呈现有利的结果。这一说法的真实性受到质疑,Meta尚未回应VentureBeat的询问。

然而,对Llama 4性能的质疑并未止于此。在X平台上,用户@cto_junior对模型的性能表示怀疑,引用了一项独立测试,Llama 4 Maverick在测试编码任务的aider polyglot基准测试中仅得分16%。这一分数远低于同等规模的旧模型,如DeepSeek V3和Claude 3.7 Sonnet。

AI博士兼作者Andriy Burkov也在X上质疑Llama 4 Scout宣称的1000万token上下文窗口,称其为“虚拟的”,因为该模型未在超过256k token的提示上进行训练。他警告说,发送更长的提示可能会导致低质量输出。

在r/LocalLlama子版块上,用户Dr_Karminski对Llama 4表示失望,将其较差的性能与DeepSeek的非推理V3模型在模拟七边形内球运动等任务上进行比较。

前Meta研究员、现AI2高级研究科学家Nathan Lambert在其Interconnects Substack博客上批评了Meta的基准比较。他指出,Meta宣传材料中使用的Llama 4 Maverick模型与公开发布的模型不同,后者针对对话性进行了优化。Lambert指出这种差异,称:“狡猾。下面的结果是假的,对Meta社区来说,不发布他们用于主要营销推广的模型是一个重大冒犯。”他补充说,尽管宣传模型“因其幼稚的特性正在损害发布的技术声誉”,但其他平台上可用的实际模型“相当聪明,语气也合理。”

Meta回应,否认“在测试集上训练”并归因于快速推出导致的实施错误

针对批评和指控,Meta的副总裁兼GenAI负责人Ahmad Al-Dahle在X上回应了这些关切。他表达了对社区参与Llama 4的热情,但承认不同服务中质量不一致的报告。他将这些问题归因于快速推出以及公共实施稳定所需的时间。Al-Dahle坚决否认了在测试集上训练的指控,强调质量不一的原因是实施错误,而非任何不当行为。他重申了Meta对Llama 4模型重大进步的信念,以及与社区合作实现其潜力的承诺。

然而,这一回应并未能平息社区的失望,许多人仍报告性能不佳,并要求提供更多关于模型训练过程的技术文档。此次发布比之前的Llama版本面临更多问题,引发了对其开发和推出的疑问。

此次发布的时间点引人注目,因为它是在Meta研究副总裁Joelle Pineau宣布离职之后。她上周在LinkedIn上表达了对公司的感激,并于周末推广了Llama 4模型系列。

随着Llama 4继续被其他推理提供商采用,结果好坏参半,显然初始发布并未达到Meta所期望的成功。即将于4月29日举行的首届Meta LlamaCon将是第三方开发者的首次聚会,预计将成为讨论和辩论的热点。我们将密切关注进展,敬请关注。

相关文章
Frontier AI Labs 拒绝透露针对失控模型的遏制策略 Frontier AI Labs 拒绝透露针对失控模型的遏制策略 最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
马克·扎克伯格真的相信人工智能是面向每个人的吗? 马克·扎克伯格真的相信人工智能是面向每个人的吗? 正在加载播放器…Meta 本周推出了 Glimmer,这是一个开源权重的 AI 模型,任何人都可以下载并在个人硬件上运行——这与该公司更强大的模型 Muse Spark 形成了鲜明对比,后者仍锁定在其自有 API 之后。此次发布伴随着马克·扎克伯格(Mark Zuckerberg)的一封公开信,他在信中主张人工智能应向所有人开放,而非由少数几家实验室控制。但正如 Equity 节目主持人所指出的那样,这一愿景附带了几个重要的限制条件。在本期 TechCrunch 的 Equity 播客中,K
Facebook推出面向创作者的AI辅助应用 Facebook推出面向创作者的AI辅助应用 Facebook周三透露,该公司正将“创作者工作室”(Creator Studio)转型为一款专用的AI辅助应用,以帮助创作者扩大在该平台上的影响力。通过提供这款由人工智能驱动的工具,Meta 旨在在 TikTok 和 YouTube 的激烈竞争中留住 Facebook 上的创作者。该公司还希望该应用能减少对 ChatGPT 等外部工具在内容构思和表现分析方面的依赖。该新应用目前正面向部分创作者进
相关专题推荐
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
教育与学习 面向教师、辅导老师和基于群体的学习项目的 AI 测验构建平台
面向教师、辅导老师和基于群体的学习项目的 AI 测验构建平台

2026年最新最佳AI测验构建平台,适用于教师、辅导老师和基于群体的学习项目!XIX.AI精心整理了一份顶级评分列表,包含经过现实世界测试的强力变革性工具,以提供准确的排名。这些必试平台有助于提高写作效率、简化内容创作,并简化各种学习场景中的测验设计。立即探索,发现您解锁教学AI优势的理想工具!

13 个工具
xix.ai
评论 (11)
0/500
PaulGonzalez
PaulGonzalez 2026-05-06 10:00:47

Meta hat mal wieder die AI-Welt aufgemischt! Llama 4 klingt nach einem riesigen Schritt, aber die Meldungen über gemischte Qualität wegen Bugs sind irgendwie enttäuschend. 🤔 Finde es trotzdem cool, dass sie so transparent sind und die Probleme direkt ansprechen – das ist bei Tech-Giganten nicht immer selbstverständlich. Hoffentlich kriegen sie die Fehler schnell in den Griff, sonst könnte das Vertrauen in die Modelle leiden. Die MoE-Architektur an sich ist ja mega spannend!

WalterHarris
WalterHarris 2025-12-30 00:30:49

Hmm, Meta's Llama 4-Release sorgt also für gemischte Qualitätsberichte und sie schieben es auf Bugs? Interessant. Kann es nicht einfach sein, dass das MoE-Design in der Praxis schwieriger zu beherrschen ist, als in der Theorie versprochen? Die Eile, mit der die großen Tech-Konzerne KI pushen, macht mich nachdenklich. Kommen diese 'Verbesserungen' überhaupt bei den normalen Anwendern an, wo es wirklich zählt? Irgendwie ein klassisches 'Release jetzt, Patch später'-Szenario... 🤔

HenryBrown
HenryBrown 2025-10-04 08:30:32

Meta qui sort encore un modèle en catimini avec des bugs... Original cette stratégie de 'test en production' sur des millions d'utilisateurs 🙄 Ça me rappelle les mises à jour foireuses d'Instagram ! #BetaTestGéant

JohnWilson
JohnWilson 2025-08-26 09:01:18

Meta's Llama 4 drop was wild! Three versions with that fancy Mixture-of-Experts setup? Sounds powerful, but those bugs they mentioned make me wonder if it’s ready for prime time. Anyone tried it yet? 🧐

HarryRoberts
HarryRoberts 2025-08-22 05:01:34

Wow, Llama 4 sounds like a beast with that Mixture-of-Experts setup! But bugs causing mixed quality? Kinda feels like Meta rushed this out to beat the competition. Hope they patch it up soon! 🦙

ArthurJones
ArthurJones 2025-08-12 19:00:59

Wow, Llama 4 sounds like a beast with that Mixture-of-Experts setup! But bugs causing mixed quality? That’s a bit concerning for a big player like Meta. Hope they iron it out soon, I’m curious to see how it stacks up against other models! 🦙

OR