選項
首頁
新聞
Meta捍衛Llama 4版本,引用Bug作為混合質量報告的原因

Meta捍衛Llama 4版本,引用Bug作為混合質量報告的原因

2025-04-23
226

週末期間,擁有Facebook、Instagram、WhatsApp和Quest VR的強大企業Meta,出人意料地推出了其最新的AI語言模型Llama 4。不僅僅是一個版本,而是推出了三個新版本,每個版本都因採用了“專家混合”架構和一種名為MetaP的新穎訓練方法(涉及固定超參數)而具備增強的功能。更重要的是,這三個模型都擁有廣泛的上下文窗口,使它們能夠在單次互動中處理更多資訊。

儘管發布令人興奮,但AI社群的反應充其量只能說是冷淡。週六,Meta將其中兩個模型Llama 4 Scout和Llama 4 Maverick開放供下載和使用,但反響遠非熱烈。

Llama 4引發AI使用者的困惑與批評

在北美流行的中文社群論壇1point3acres上的一則未經證實的帖子,傳到了Reddit的r/LocalLlama子版塊。該帖子據稱來自Meta的GenAI組織的一名研究人員,聲稱Llama 4在內部第三方基準測試中表現不佳。帖子暗示,Meta的領導層通過在後訓練階段混合測試集來操縱結果,以滿足各種指標並呈現有利結果。該說法的真實性受到質疑,Meta尚未回應VentureBeat的詢問。

然而,對Llama 4性能的質疑並未止於此。在X上,用戶@cto_junior對該模型的表現表示難以置信,引用了一項獨立測試,顯示Llama 4 Maverick在測試編碼任務的aider polyglot基準測試中僅得分16%。這一得分遠低於DeepSeek V3和Claude 3.7 Sonnet等同等規模的舊模型。

AI博士兼作者Andriy Burkov也在X上質疑Llama 4 Scout宣稱的1000萬token上下文窗口,指出這是“虛擬的”,因為該模型未在超過256k token的提示上進行訓練。他警告說,發送更長的提示可能會導致低品質的輸出。

在r/LocalLlama子版塊上,用戶Dr_Karminski對Llama 4表示失望,比較其在模擬七邊形內球體運動等任務上的表現與DeepSeek的非推理V3模型相比表現不佳。

前Meta研究員、現為AI2高級研究科學家的Nathan Lambert,在其Interconnects Substack博客上批評了Meta的基準比較。他指出,Meta宣傳材料中使用的Llama 4 Maverick模型與公開發布的模型不同,後者被優化為更具對話性。Lambert指出這一差異,說道:“狡猾。下面展示的結果是假的,對Meta的社群來說,不發布他們用於主要行銷推廣的模型是一大侮辱。”他補充說,雖然宣傳模型“因其幼稚的特性而損害了發布的技術聲譽”,但在其他平台上可用的實際模型“相當聰明且語氣合理”。

Meta回應,否認“在測試集上訓練”並歸咎於快速推出導致的實現錯誤

針對批評和指控,Meta的副總裁兼GenAI負責人Ahmad Al-Dahle在X上回應了這些擔憂。他對社群與Llama 4的互動表示熱情,但承認不同服務的品質報告不一致。他將這些問題歸因於快速推出以及公開實現穩定所需的時間。Al-Dahle堅決否認在測試集上訓練的指控,強調品質變化的原因是實現錯誤,而非任何不當行為。他重申Meta對Llama 4模型重大進展的信心,以及與社群合作實現其潛力的承諾。

然而,這一回應並未平息社群的挫折感,許多人仍報告性能不佳,並要求提供更多關於模型訓練過程的技術文件。這次發布比之前的Llama版本面臨更多問題,引發了關於其開發和推出的疑問。

此次發布的時機引人注目,因為它是在Meta研究副總裁Joelle Pineau宣佈離職之後。Joelle Pineau上週在LinkedIn上表達了對公司在職期間的感恩,並於週末推廣了Llama 4模型系列。

隨著Llama 4繼續被其他推理提供者採用,結果喜憂參半,顯然這次初步發布並未如Meta所希望的那樣成功。即將於4月29日舉行的首屆Meta LlamaCon,將是模型系列第三方開發者的首次聚會,預計將成為討論和爭論的熱點。我們將密切關注進展,請持續關注。

相關文章
Frontier AI Labs 拒絕透露針對失控模型的管控策略 Frontier AI Labs 拒絕透露針對失控模型的管控策略 近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
馬克·扎克伯格真的相信人工智慧是面向每個人的嗎? 馬克·扎克伯格真的相信人工智慧是面向每個人的嗎? 正在載入播放器…Meta 本週推出了 Glimmer,這是一個開源權重的 AI 模型,任何人都可以下載並在個人硬體上執行——這與該公司更強大的模型 Muse Spark 形成了鮮明對比,後者仍鎖定在其自有 API 之後。此次釋出伴隨著馬克·扎克伯格(Mark Zuckerberg)的一封公開信,他在信中主張人工智慧應向所有人開放,而非由少數幾家實驗室控制。但正如 Equity 節目主持人所指出的那樣,這一願景附帶了幾個重要的限制條件。在本期 TechCrunch 的 Equity 播客中,K
Facebook 推出專為內容創作者設計的 AI 輔助應用程式 Facebook 推出專為內容創作者設計的 AI 輔助應用程式 Facebook 於週三透露,將把「創作者工作室」(Creator Studio)轉型為一款專用的 AI 輔助應用程式,協助創作者在平台上擴大影響力。透過提供這項由人工智慧驅動的工具,Meta 旨在面對 TikTok 和 YouTube 的激烈競爭,仍能留住 Facebook 上的創作者。該公司亦預期此應用程式能減少對 ChatGPT 等外部工具在內容構思與表現分析方面的依賴。目前該新應用程式正針
相關專題推薦
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
評論 (11)
0/500
PaulGonzalez
PaulGonzalez 2026-05-06 10:00:47

Meta hat mal wieder die AI-Welt aufgemischt! Llama 4 klingt nach einem riesigen Schritt, aber die Meldungen über gemischte Qualität wegen Bugs sind irgendwie enttäuschend. 🤔 Finde es trotzdem cool, dass sie so transparent sind und die Probleme direkt ansprechen – das ist bei Tech-Giganten nicht immer selbstverständlich. Hoffentlich kriegen sie die Fehler schnell in den Griff, sonst könnte das Vertrauen in die Modelle leiden. Die MoE-Architektur an sich ist ja mega spannend!

WalterHarris
WalterHarris 2025-12-30 00:30:49

Hmm, Meta's Llama 4-Release sorgt also für gemischte Qualitätsberichte und sie schieben es auf Bugs? Interessant. Kann es nicht einfach sein, dass das MoE-Design in der Praxis schwieriger zu beherrschen ist, als in der Theorie versprochen? Die Eile, mit der die großen Tech-Konzerne KI pushen, macht mich nachdenklich. Kommen diese 'Verbesserungen' überhaupt bei den normalen Anwendern an, wo es wirklich zählt? Irgendwie ein klassisches 'Release jetzt, Patch später'-Szenario... 🤔

HenryBrown
HenryBrown 2025-10-04 08:30:32

Meta qui sort encore un modèle en catimini avec des bugs... Original cette stratégie de 'test en production' sur des millions d'utilisateurs 🙄 Ça me rappelle les mises à jour foireuses d'Instagram ! #BetaTestGéant

JohnWilson
JohnWilson 2025-08-26 09:01:18

Meta's Llama 4 drop was wild! Three versions with that fancy Mixture-of-Experts setup? Sounds powerful, but those bugs they mentioned make me wonder if it’s ready for prime time. Anyone tried it yet? 🧐

HarryRoberts
HarryRoberts 2025-08-22 05:01:34

Wow, Llama 4 sounds like a beast with that Mixture-of-Experts setup! But bugs causing mixed quality? Kinda feels like Meta rushed this out to beat the competition. Hope they patch it up soon! 🦙

ArthurJones
ArthurJones 2025-08-12 19:00:59

Wow, Llama 4 sounds like a beast with that Mixture-of-Experts setup! But bugs causing mixed quality? That’s a bit concerning for a big player like Meta. Hope they iron it out soon, I’m curious to see how it stacks up against other models! 🦙

OR