選項
首頁
新聞
NVIDIA的新Llama-3.1 Nemotron Ultra Ultra的表現為DeepSeek R1,尺寸為一半

NVIDIA的新Llama-3.1 Nemotron Ultra Ultra的表現為DeepSeek R1,尺寸為一半

2025-04-13
205

NVIDIA的新Llama-3.1 Nemotron Ultra Ultra的表現為DeepSeek R1,尺寸為一半

當Meta正因其最新的Llama 4模型家族受到審查時,Nvidia已悄然推出基於Meta早期Llama-3.1-405B-Instruct模型的新款完全開源大型語言模型(LLM)。此模型名為Llama-3.1-Nemotron-Ultra-253B-v1,擁有2530億個參數,專為高級推理、指令遵循和AI助手工作流程而設計。Nvidia在三月舉行的年度GPU技術會議(GTC)上首次暗示了此模型。

此次發布凸顯了Nvidia通過架構創新和細緻的後訓練過程持續提升性能的承諾。該模型於2025年4月7日宣布,其程式碼、權重和後訓練數據現已在Hugging Face上免費提供。該模型設計為可根據系統提示在複雜推理任務和簡單輸出之間無縫切換,為開發者提供應用上的靈活性。

專為高效推理設計

基於Nvidia在優化LLM推理方面的先前努力,Llama-3.1-Nemotron-Ultra-253B採用了神經架構搜尋(NAS)過程來優化其架構。這包括創新的功能,如跳躍注意力層、融合前饋神經網絡(FFNs)和可變FFN壓縮比率。這些修改降低了模型的記憶體使用量和計算需求,使其可在單個8x H100 GPU節點上部署,而不影響輸出品質。

Nvidia聲稱此模型在資料中心部署中提供強大性能且成本效益高。它與Nvidia的B100和Hopper微架構相容,並已在BF16和FP8精度模式下進行測試。

後訓練以增強推理和對齊

該模型經歷了全面的後訓練過程,包括在數學、程式碼生成、聊天和工具使用等多個領域進行監督微調,隨後使用群組相對策略優化(GRPO)進行強化學習,以增強其指令遵循和推理能力。

進一步的精煉來自於對650億個標記的知識蒸餾階段,以及在額外880億個標記上的持續預訓練。訓練數據來源包括FineWeb、Buzz-V1.2和Dolma,後訓練提示和回應則來自公開語料庫和合成生成方法。這種方法幫助模型區分其推理模式。

在多個領域和基準測試中提升性能

啟用推理功能後,該模型在多個基準測試中顯示出顯著改進。例如,在MATH500基準測試中,其性能從標準模式的80.40%飆升至推理啟用後的97.00%。同樣,AIME25分數從16.67%躍升至72.50%,LiveCodeBench結果則從29.03%增加到66.31%,翻倍有餘。

該模型在基於工具的任務和一般問答(GPQA)中也表現出色,在推理模式下得分為76.01%,相較於未啟用推理的56.60%。這些基準測試使用最大序列長度為32,000個標記,每項測試重複最多16次以確保準確性。

與最先進的MoE模型DeepSeek R1(擁有6710億個參數)相比,Nvidia的模型雖然參數較少,但表現依然出色。它在GPQA(76.01對71.5)、IFEval指令遵循(89.45對83.3)和LiveCodeBench程式碼任務(66.31對65.9)等任務中超越DeepSeek R1。然而,DeepSeek R1在某些數學評估中略勝一籌,特別是在AIME25(79.8對72.50)和MATH500(97.3對97.00)。

這些結果表明,Nvidia的密集模型在推理和一般指令對齊方面可與MoE模型匹敵或超越,儘管在數學密集型任務中略微落後。

使用與整合

該模型與Hugging Face Transformers庫(建議使用4.48.3版本)無縫整合,並支援最長128,000個標記的序列。開發者可通過系統提示切換推理行為,並根據任務需求選擇解碼策略。對於推理任務,Nvidia建議使用溫度採樣(0.6)並搭配0.95的top-p值,而對於確定性輸出則推薦使用貪婪解碼。

Llama-3.1-Nemotron-Ultra-253B支援多語言應用,包括英語、德語、法語、義大利語、葡萄牙語、印地語、西班牙語和泰語。它適用於各種LLM使用場景,如聊天機器人開發、AI代理工作流程、檢索增強生成(RAG)和程式碼生成。

授權用於商業用途

該模型根據Nvidia開放模型許可證和Llama 3.1社群許可協議發布,適用於商業應用。Nvidia強調負責任AI發展的重要性,敦促團隊評估模型在其特定使用場景中的對齊性、安全性和偏見。

Nvidia的AI模型後訓練總監Oleksii Kuchaiev在X上分享了此次開放發布的興奮心情,強調其2530億密集設計與可切換的推理能力,以及開放權重和數據的包含。

相關文章
Nvidia 執行長黃仁勳告訴特朗普:“我們不會讓 [人工智慧放緩] 發生。” Nvidia 執行長黃仁勳告訴特朗普:“我們不會讓 [人工智慧放緩] 發生。” 在週一於洛杉磯舉行的 All-In 峰會上,英偉達(Nvidia)執行長黃仁勳接到美國總統唐納德·特朗普的意外來電,這是一通他無法簡單忽略的電話。“我正和幾位好友站在臺上,”黃仁勳向特朗普解釋道,他指的是 All-In 播客背後的風險投資家,包括科技投資者 Chamath Palihapitiya 和 Jason Calacanis,以及白宮顧問 David Friedberg 和 David Sacks。這一舉動很可能讓公關專業人士感到噩夢連連,黃仁勳透過將特朗普置於擴音模式,讓全場聽
黃仁勳揭示英偉達“全新”的2000億美元市場機遇 黃仁勳揭示英偉達“全新”的2000億美元市場機遇 英偉達創始人兼執行長黃仁勳脫穎而出,成為推動公司敘事的最具吸引力的企業願景家之一,甚至可能是最偉大的。在對公司未來前景和收入流方面,他毫不掩飾的樂觀態度甚至可能超越Salesforce的馬克·貝尼奧夫。然而,他始終用一個個季度的業績來印證這種熱情。與其對他的“為英偉達發現了一個全新的2000億美元總可定址市場(TAM)”的說法持懷疑態度,我認為他已經贏得了一定的可信度。黃仁勳將這一巨大的新市場機會歸因於英偉達今年3月推出的最新CPU產品Vera。在週三的財報電話會議上——該公司剛剛度過
Frontier AI Labs 拒絕透露針對失控模型的管控策略 Frontier AI Labs 拒絕透露針對失控模型的管控策略 近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
相關專題推薦
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
評論 (54)
0/500
JonathanNelson
JonathanNelson 2025-12-09 16:30:42

Интересно, как Nvidia удалось упаковать все эти параметры в модель размером вдвое меньше. Выходит, вложения в архитектуру дают больше преимуществ, чем просто увеличение данных? Хотя, конечно, с учётом их вычислительных ресурсов не стоит удивляться. Что особенно ценно, так это тот факт, что модель открыта. На этом фоне заявления Meta порой звучат слишком громко и с многочисленными оговорками 🤔 Это может изменить правила игры для независимых исследователей!

CharlesYoung
CharlesYoung 2025-11-03 12:30:34

¿Nvidia saca otro modelo open-source más potente que DeepSeek R1? 🤔 Me pregunto si esto realmente marcará una diferencia práctica para los desarrolladores o es solo otra carrera por los números en los benchmarks. ¡253 mil millones de parámetros parece excesivo!

DouglasMartínez
DouglasMartínez 2025-08-18 23:01:00

Nvidia's new model sounds like a beast! Half the size of DeepSeek R1 but still outperforms it? That's wild efficiency. Can't wait to see how devs play with this open-source gem! 🚀

StephenRoberts
StephenRoberts 2025-08-01 10:48:18

Nvidia's new model sounds like a beast! Half the size of DeepSeek R1 but still outshines it? That's some serious tech flex. Can't wait to see how devs play with this open-source gem! 😎

AnthonyRoberts
AnthonyRoberts 2025-04-24 16:35:07

Nvidia's new Llama-3.1 Nemotron Ultra is a beast! It's amazing how it outperforms DeepSeek R1 with half the size. I've been using it for my projects and the results are incredible. Just wish it was a bit faster, but overall, a solid choice! 🚀

JohnRoberts
JohnRoberts 2025-04-23 08:03:45

¡El Llama-3.1 Nemotron Ultra de Nvidia es impresionante! Supera al DeepSeek R1 con la mitad del tamaño, lo cual es alucinante. Lo he estado usando en mis proyectos y es súper eficiente. Lo único es que puede ser un poco complicado de configurar. Aún así, una excelente opción para quien busque un LLM potente. 🚀

OR