美団(Meituan)、視覚と音声のアーキテクチャを統合したAIモデル「LongCat-Next」を発表

4月3日、MiTiチームはネイティブ型マルチモーダル大規模モデル「LongCat-Next」を正式にリリースしました。このモデルは、画像、音声、テキストを統一された離散トークンのストリームに変換することで、従来の「言語基盤+プラグイン」というアプローチを超越しています。これにより、AIは物理世界をネイティブに「見る」ことや「聞く」ことが可能となり、テキストと同様にこれらの入力を処理できるようになります。
技術的核:DiNAアーキテクチャが実現する「モダリティの内部化」
異なるデータタイプ間の障壁を取り除くため、MiTiはDiNA(Discrete Native Autoregressive)アーキテクチャを開発し、マルチモーダルモデリングにおける深い統合を実現しました:
完全なモダリティ統合:このモデルは、テキスト、画像、音声に対して同一のパラメータ、アテンション機構、損失関数を使用します。
理解と生成の対称性:単一の数学的枠組みにおいて、次のテキストトークンの予測は「理解」を構成し、画像トークンの予測は「生成」を構成します。両プロセスは、トレーニング中に著しい相乗効果を発揮します。
極端な圧縮:dNaViTビジュアルトークナイザーを活用し、あらゆる解像度の入力を処理します。8層の残差ベクトル量子化プロセスを通じて、OCRや金融文書分析などのタスクに必要な重要な詳細情報を保持しつつ、ピクセル空間で最大28倍の圧縮を実現します。
実証的な性能:離散モデリングに固有の限界はない
LongCat-Nextは、複数のベンチマークにおいて専用モデルを上回る性能を発揮し、「離散化は必然的に情報損失を招く」という従来の通念に効果的に異議を唱えています:
きめ細かな認識:高密度テキストシナリオ向けのOmniDocBenchにおいて、Qwen3-Omniだけでなく、専門のビジョンモデルであるQwen3-VLをも上回る性能を発揮しました。
視覚的推論:MathVistaで83.1という高いスコアを記録し、堅牢で産業レベルの論理的推論能力を実証しました。
クロスモーダル連携:最先端の言語能力(C-Eval 86.80)を維持しつつ、テキストと音声の低遅延並列生成に加え、カスタマイズ可能なボイスクローニングをサポートします。
業界インサイト:実世界AIの基盤
大規模言語モデルは、長らくテキスト中心でした。LongCat-Nextの画期的な点は、物理世界の情報も言語と同様に離散化・モデル化できることを実証したことです。AIが統一された「ネイティブ言語」を保有すれば、ツールの使用、コードの記述、複雑な図表の解釈において、より知的かつ直感的な動作が可能になります。
MiTiは現在、LongCat-NextモデルとdNaViTトークナイザーをオープンソース化しています。この効率的で可能性に満ちたネイティブ離散アーキテクチャは、現実世界を認識し、それと対話できるAIを構築するために、開発者に不可欠なツールを提供します。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (1)
0/500
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐

4月3日、MiTiチームはネイティブ型マルチモーダル大規模モデル「LongCat-Next」を正式にリリースしました。このモデルは、画像、音声、テキストを統一された離散トークンのストリームに変換することで、従来の「言語基盤+プラグイン」というアプローチを超越しています。これにより、AIは物理世界をネイティブに「見る」ことや「聞く」ことが可能となり、テキストと同様にこれらの入力を処理できるようになります。
技術的核:DiNAアーキテクチャが実現する「モダリティの内部化」
異なるデータタイプ間の障壁を取り除くため、MiTiはDiNA(Discrete Native Autoregressive)アーキテクチャを開発し、マルチモーダルモデリングにおける深い統合を実現しました:
完全なモダリティ統合:このモデルは、テキスト、画像、音声に対して同一のパラメータ、アテンション機構、損失関数を使用します。
理解と生成の対称性:単一の数学的枠組みにおいて、次のテキストトークンの予測は「理解」を構成し、画像トークンの予測は「生成」を構成します。両プロセスは、トレーニング中に著しい相乗効果を発揮します。
極端な圧縮:dNaViTビジュアルトークナイザーを活用し、あらゆる解像度の入力を処理します。8層の残差ベクトル量子化プロセスを通じて、OCRや金融文書分析などのタスクに必要な重要な詳細情報を保持しつつ、ピクセル空間で最大28倍の圧縮を実現します。
実証的な性能:離散モデリングに固有の限界はない
LongCat-Nextは、複数のベンチマークにおいて専用モデルを上回る性能を発揮し、「離散化は必然的に情報損失を招く」という従来の通念に効果的に異議を唱えています:
きめ細かな認識:高密度テキストシナリオ向けのOmniDocBenchにおいて、Qwen3-Omniだけでなく、専門のビジョンモデルであるQwen3-VLをも上回る性能を発揮しました。
視覚的推論:MathVistaで83.1という高いスコアを記録し、堅牢で産業レベルの論理的推論能力を実証しました。
クロスモーダル連携:最先端の言語能力(C-Eval 86.80)を維持しつつ、テキストと音声の低遅延並列生成に加え、カスタマイズ可能なボイスクローニングをサポートします。
業界インサイト:実世界AIの基盤
大規模言語モデルは、長らくテキスト中心でした。LongCat-Nextの画期的な点は、物理世界の情報も言語と同様に離散化・モデル化できることを実証したことです。AIが統一された「ネイティブ言語」を保有すれば、ツールの使用、コードの記述、複雑な図表の解釈において、より知的かつ直感的な動作が可能になります。
MiTiは現在、LongCat-NextモデルとdNaViTトークナイザーをオープンソース化しています。この効率的で可能性に満ちたネイティブ離散アーキテクチャは、現実世界を認識し、それと対話できるAIを構築するために、開発者に不可欠なツールを提供します。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐





家






