美團推出「LongCat-Next」AI 模型,具備統一的視覺與語音架構

4月3日,MiTi團隊正式推出原生多模態大型模型 LongCat-Next。該模型突破了傳統的「語言基礎架構加外掛程式」模式,將圖像、音訊和文字轉換為統一的離散標記流。這使人工智慧能夠原生地「看見」和「聽見」物理世界,並像處理文字一樣處理這些輸入。
技術核心:DiNA 架構實現「模態內化」
為消除不同資料類型之間的隔閡,MiTi 開發了 DiNA(離散原生自迴歸)架構,實現了多模態建模的深度統一:
完整的模態統一:該模型針對文字、圖像和音訊使用相同的參數、注意力機制及損失函數。
理解與生成對稱性:在單一數學框架內,預測下一個文字標記即為「理解」,而預測圖像標記則為「生成」。這兩項過程在訓練期間展現出顯著的協同效益。
極致壓縮:透過 dNaViT 視覺分詞器,可處理任何解析度的輸入。藉由 8 層殘差向量量化過程,在像素空間中實現最高 28 倍的壓縮率,同時保留 OCR 和財務文件分析等任務所需的關鍵細節。
實證表現:離散建模並無固有限制
LongCat-Next 在多項基準測試中展現出超越專用模型的表現,有效挑戰了「離散化必然導致資訊損失」的傳統觀念:
細粒度感知:在密集文本場景的 OmniDocBench 測試中,其表現不僅超越 Qwen3-Omni,更勝過專用的視覺模型 Qwen3-VL。
視覺推理:在 MathVista 測試中取得 83.1 分的高分,展現出強健的產業級邏輯推理能力。
跨模態協作:在維持領先的語言能力(C-Eval 86.80)的同時,支援文字與語音的低延遲並行生成,並具備可自訂的語音克隆功能。
產業洞見:實體世界 AI 的基礎
大型語言模型長期以來都以文字為核心。LongCat-Next 的突破性之處在於,它證明了實體世界資訊可以像語言一樣被離散化並建模。當 AI 擁有統一的「母語」時,無論是使用工具、編寫程式碼,還是解讀複雜圖表,都能變得更加智能且直覺。
MiTi 現已將 LongCat-Next 模型與 dNaViT 詞法分析器開源。這套高效且潛力巨大的原生離散架構,為開發者提供了打造能感知並與現實世界互動的人工智慧所需的關鍵工具。
相關文章
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
相關專題推薦
評論 (1)
0/500
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐

4月3日,MiTi團隊正式推出原生多模態大型模型 LongCat-Next。該模型突破了傳統的「語言基礎架構加外掛程式」模式,將圖像、音訊和文字轉換為統一的離散標記流。這使人工智慧能夠原生地「看見」和「聽見」物理世界,並像處理文字一樣處理這些輸入。
技術核心:DiNA 架構實現「模態內化」
為消除不同資料類型之間的隔閡,MiTi 開發了 DiNA(離散原生自迴歸)架構,實現了多模態建模的深度統一:
完整的模態統一:該模型針對文字、圖像和音訊使用相同的參數、注意力機制及損失函數。
理解與生成對稱性:在單一數學框架內,預測下一個文字標記即為「理解」,而預測圖像標記則為「生成」。這兩項過程在訓練期間展現出顯著的協同效益。
極致壓縮:透過 dNaViT 視覺分詞器,可處理任何解析度的輸入。藉由 8 層殘差向量量化過程,在像素空間中實現最高 28 倍的壓縮率,同時保留 OCR 和財務文件分析等任務所需的關鍵細節。
實證表現:離散建模並無固有限制
LongCat-Next 在多項基準測試中展現出超越專用模型的表現,有效挑戰了「離散化必然導致資訊損失」的傳統觀念:
細粒度感知:在密集文本場景的 OmniDocBench 測試中,其表現不僅超越 Qwen3-Omni,更勝過專用的視覺模型 Qwen3-VL。
視覺推理:在 MathVista 測試中取得 83.1 分的高分,展現出強健的產業級邏輯推理能力。
跨模態協作:在維持領先的語言能力(C-Eval 86.80)的同時,支援文字與語音的低延遲並行生成,並具備可自訂的語音克隆功能。
產業洞見:實體世界 AI 的基礎
大型語言模型長期以來都以文字為核心。LongCat-Next 的突破性之處在於,它證明了實體世界資訊可以像語言一樣被離散化並建模。當 AI 擁有統一的「母語」時,無論是使用工具、編寫程式碼,還是解讀複雜圖表,都能變得更加智能且直覺。
MiTi 現已將 LongCat-Next 模型與 dNaViT 詞法分析器開源。這套高效且潛力巨大的原生離散架構,為開發者提供了打造能感知並與現實世界互動的人工智慧所需的關鍵工具。
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐





首頁






