选项
首页
新闻
Meta的AI模型基准:误导性?

Meta的AI模型基准:误导性?

2025-04-10
178

Meta的AI模型基准:误导性?

Meta 在周末发布了他们的新 AI 模型 Maverick,它已经在 LM Arena 上掀起波澜,夺得了第二名的位置。你知道的,那个地方是人类扮演法官和陪审团的角色,比较不同的 AI 模型并挑选他们喜欢的。不过,等等,有个转折!结果发现,在 LM Arena 上展示风采的 Maverick 版本,与开发者可以下载和使用的版本并不完全相同。

一些敏锐的 AI 研究者在 X(是的,那个以前叫 Twitter 的平台)上发现,Meta 将 LM Arena 版本称为“实验性聊天版本”。如果你去 Llama 网站上看,有一张图表透露了细节,称测试使用的是“为对话优化设计的 Llama 4 Maverick”。我们之前讨论过这个,但 LM Arena 并不是衡量 AI 性能的黄金标准。大多数 AI 公司不会为了在这个测试中得分更高而专门调整模型——或者至少,他们不会承认这样做。

问题是,当你调整一个模型以在基准测试中表现出色,但随后向公众发布一个不同的“普通”版本时,开发者很难弄清楚这个模型在现实场景中的实际表现如何。而且,这有点误导,对吧?基准测试虽然有缺陷,但应该为我们提供模型在不同任务中能做什么和不能做什么的清晰图景。

X 上的研究者很快就注意到,你可以下载的 Maverick 和 LM Arena 上的版本之间存在一些重大差异。Arena 版本似乎特别喜欢使用表情符号,而且回答总是冗长而拖沓。

好吧,Llama 4 确实有点过头了,哈哈,这是什么啰嗦之城 pic.twitter.com/y3GvhbVz65

— Nathan Lambert (@natolambert) 2025年4月6日

出于某种原因,Arena 中的 Llama 4 模型使用了更多的表情符号

在 together.ai 上,它似乎表现更好:pic.twitter.com/f74ODX4zTt

— Tech Dev Notes (@techdevnotes) 2025年4月6日

我们已经联系了 Meta 和运行 LM Arena 的 Chatbot Arena 团队,看看他们对此有什么说法。敬请期待!

相关文章
Frontier AI Labs 拒绝透露针对失控模型的遏制策略 Frontier AI Labs 拒绝透露针对失控模型的遏制策略 最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
马克·扎克伯格真的相信人工智能是面向每个人的吗? 马克·扎克伯格真的相信人工智能是面向每个人的吗? 正在加载播放器…Meta 本周推出了 Glimmer,这是一个开源权重的 AI 模型,任何人都可以下载并在个人硬件上运行——这与该公司更强大的模型 Muse Spark 形成了鲜明对比,后者仍锁定在其自有 API 之后。此次发布伴随着马克·扎克伯格(Mark Zuckerberg)的一封公开信,他在信中主张人工智能应向所有人开放,而非由少数几家实验室控制。但正如 Equity 节目主持人所指出的那样,这一愿景附带了几个重要的限制条件。在本期 TechCrunch 的 Equity 播客中,K
Facebook推出面向创作者的AI辅助应用 Facebook推出面向创作者的AI辅助应用 Facebook周三透露,该公司正将“创作者工作室”(Creator Studio)转型为一款专用的AI辅助应用,以帮助创作者扩大在该平台上的影响力。通过提供这款由人工智能驱动的工具,Meta 旨在在 TikTok 和 YouTube 的激烈竞争中留住 Facebook 上的创作者。该公司还希望该应用能减少对 ChatGPT 等外部工具在内容构思和表现分析方面的依赖。该新应用目前正面向部分创作者进
相关专题推荐
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
评论 (37)
0/500
RalphGarcia
RalphGarcia 2025-10-13 02:30:34

メタのAIベンチマークって怪しくない?🤔 人間が好みで評価するランダムなランキングより、実用的なテストの方が信用できると思う。結局ベンチマークゲームに夢中になる企業より、実際に役立つAIを作ってる会社の方が価値あるよね。 #AIベンチマーク

ScottWalker
ScottWalker 2025-07-28 09:20:54

Meta's Maverick hitting second on LM Arena? Impressive, but I'm skeptical about those benchmarks. Feels like a hype train—wonder if it’s more flash than substance. 🤔 Anyone tested it in real-world tasks yet?

KennethMartin
KennethMartin 2025-04-21 18:14:21

Meta's Maverick AI model is impressive, snagging second place on LM Arena! But are the benchmarks really telling the whole story? It's cool to see AI models go head-to-head, but I'm not sure if it's all fair play. Makes you wonder, right? 🤔 Maybe we need a more transparent way to judge these models!

WalterThomas
WalterThomas 2025-04-21 10:55:14

मेटा का नया AI मॉडल, मैवरिक, LM एरिना में दूसरे स्थान पर पहुंचा! यह प्रभावशाली है, लेकिन क्या बेंचमार्क वास्तव में पूरी कहानी बता रहे हैं? AI मॉडल्स को आपस में प्रतिस्पर्धा करते देखना मजेदार है, लेकिन मुझे नहीं पता कि यह निष्पक्ष है या नहीं। आपको सोचने पर मजबूर करता है, है ना? 🤔 शायद हमें इन मॉडल्स को जज करने का एक और पारदर्शी तरीका चाहिए!

JohnYoung
JohnYoung 2025-04-18 23:03:42

메타의 새로운 AI 모델, 마브릭이 LM Arena에서 2위를 차지하다니 대단해요! 하지만 벤치마크가 정말 모든 것을 말해주고 있는지 궁금해요. AI 모델 간의 경쟁은 재미있지만, 공정한지 확신할 수 없네요. 더 투명한 평가 방법이 필요할 것 같아요 🤔

JohnHernández
JohnHernández 2025-04-18 00:58:48

Meta's Maverick AI model snagging second place on LM Arena is pretty cool, but the benchmarks might be a bit off! 🤔 It's fun to see these models go head-to-head, but I'm not sure if the results are totally fair. Worth keeping an eye on! 👀

OR