NVIDIA、Nemotron-Labs-Audex-30B-A3B 統合音声知能モデルを公開

マルチモーダル大規模モデルが急速に進化する中、音声処理能力がしばしば犠牲になっている—多くのモデルはテキストの論理を犠牲にして音声理解を向上させている。この課題に対処するため、NVIDIAの研究者たちはNemotron-Labs-Audex-30B-A3B(Audex)を発表した。これは、このギャップを埋めるために設計された統一された音声・テキスト大規模言語モデルである。
Audexは、堅牢な純粋テキストベースのMixture of Experts(MoE)アーキテクチャを基盤とした、簡潔で効率的な設計を採用している。単一のTransformerデコーダを使用することで、テキストと量子化された音声トークンを同時に処理する。このアプローチは、音声入力をテキスト埋め込み空間に投影し、既存のマルチモーダルタスク用LLMインフラストラクチャとのシームレスな統合を確保し、真の深い統合を実現する。
トレーニングには、1,574億の音声トークンと3,205億のテキストトークンからなる大規模なデータセットが使用された。マルチステージの教師ありトレーニング、純粋テキストベースのカスケード強化学習、およびマルチドメインのインポリシー知識蒸留を通じて、Audexは音声理解、音声認識、翻訳、生成において業界をリードするパフォーマンスを達成している。重要なのは、推論、アライメント、知識検索、長文処理における元のLLMの中核能力を、最小限の劣化で維持していることである。
オープンソースモデルとして、Audexは音声技術分野において重要なマイルストーンとなる。理論研究を超えて、開発者が直接評価およびデプロイできる成熟したソリューションを提供する。複雑な音声インタラクションを管理する者にとって、Audexはパフォーマンスを向上させながら、マルチモーダル知能研究の新たな道を開くバランスの取れた選択肢を提供する。
関連記事
Claude Opus 5.2 ナイトグレーがより高速なレスポンスで発売され、怠慢な問題が解決されました
Opus 5.2 が今朝静かにリリースされ、多くの開発者が更新されたモデル「Claude Opus 5.2」が Claude Code 内で限定ロールアウトを開始したことに気づいた。昨日の夜、X のユーザーは Claude Code で Opus 5 を呼び出すと、標準的なウェブバージョンよりも大幅に優れたパフォーマンスを発揮し、「次元の壁を越えた攻撃」のような結果になることを観察した。このルーティング戦略はトップ AI 企業では一般的である。パケット分析の結果、フロントエンドのラベルは変更さ
Fireworks AI、Opus搭載のFireRouterを発表:精度の大幅な低下を抑えつつ、エンコーディングコストを57%削減
Fireworks AIは、Claude Opusシリーズ向けに設計された業界初のキャッシュ対応ルーティングシステム「FireRouter with Opus」を発表しました。サーバーレスエンドポイントを通じて利用可能となったこの独立型ルーティングモデルは、1ヶ月以上の内部A/Bテストを経て、エンコーディングタスクにおいて98.1%の精度を達成し、Opus単独使用と比較してコストを57%削減しました。FireRouterは、各ユーザーインタラクション中に現在のタスクに対する各モデルの適合性を評価
モバイルSEOのためのコアウェブバイタルの修正方法
ローカルSEOを強化する:Googleエンティティクラウドドライブスタックを構築する目次:はじめにGoogleエンティティクラウドスタッキングの理解Googleエンティティクラウドスタッキングの主な利点Googleエンティティクラウドスタックの始め方 4.1. オプション1:古参Gmailアカウントの取得 4.2. オプション2:新規アカウントの作成エンティティスタック用のGoogle Driveの設定 5.1. フォルダタイプの理解 5.2. パブリックフォルダの作成 5.3. ア
関連特集おすすめ
コメント (0)
0/500

マルチモーダル大規模モデルが急速に進化する中、音声処理能力がしばしば犠牲になっている—多くのモデルはテキストの論理を犠牲にして音声理解を向上させている。この課題に対処するため、NVIDIAの研究者たちはNemotron-Labs-Audex-30B-A3B(Audex)を発表した。これは、このギャップを埋めるために設計された統一された音声・テキスト大規模言語モデルである。
Audexは、堅牢な純粋テキストベースのMixture of Experts(MoE)アーキテクチャを基盤とした、簡潔で効率的な設計を採用している。単一のTransformerデコーダを使用することで、テキストと量子化された音声トークンを同時に処理する。このアプローチは、音声入力をテキスト埋め込み空間に投影し、既存のマルチモーダルタスク用LLMインフラストラクチャとのシームレスな統合を確保し、真の深い統合を実現する。
トレーニングには、1,574億の音声トークンと3,205億のテキストトークンからなる大規模なデータセットが使用された。マルチステージの教師ありトレーニング、純粋テキストベースのカスケード強化学習、およびマルチドメインのインポリシー知識蒸留を通じて、Audexは音声理解、音声認識、翻訳、生成において業界をリードするパフォーマンスを達成している。重要なのは、推論、アライメント、知識検索、長文処理における元のLLMの中核能力を、最小限の劣化で維持していることである。
オープンソースモデルとして、Audexは音声技術分野において重要なマイルストーンとなる。理論研究を超えて、開発者が直接評価およびデプロイできる成熟したソリューションを提供する。複雑な音声インタラクションを管理する者にとって、Audexはパフォーマンスを向上させながら、マルチモーダル知能研究の新たな道を開くバランスの取れた選択肢を提供する。
Claude Opus 5.2 ナイトグレーがより高速なレスポンスで発売され、怠慢な問題が解決されました
Opus 5.2 が今朝静かにリリースされ、多くの開発者が更新されたモデル「Claude Opus 5.2」が Claude Code 内で限定ロールアウトを開始したことに気づいた。昨日の夜、X のユーザーは Claude Code で Opus 5 を呼び出すと、標準的なウェブバージョンよりも大幅に優れたパフォーマンスを発揮し、「次元の壁を越えた攻撃」のような結果になることを観察した。このルーティング戦略はトップ AI 企業では一般的である。パケット分析の結果、フロントエンドのラベルは変更さ
Fireworks AI、Opus搭載のFireRouterを発表:精度の大幅な低下を抑えつつ、エンコーディングコストを57%削減
Fireworks AIは、Claude Opusシリーズ向けに設計された業界初のキャッシュ対応ルーティングシステム「FireRouter with Opus」を発表しました。サーバーレスエンドポイントを通じて利用可能となったこの独立型ルーティングモデルは、1ヶ月以上の内部A/Bテストを経て、エンコーディングタスクにおいて98.1%の精度を達成し、Opus単独使用と比較してコストを57%削減しました。FireRouterは、各ユーザーインタラクション中に現在のタスクに対する各モデルの適合性を評価
モバイルSEOのためのコアウェブバイタルの修正方法
ローカルSEOを強化する:Googleエンティティクラウドドライブスタックを構築する目次:はじめにGoogleエンティティクラウドスタッキングの理解Googleエンティティクラウドスタッキングの主な利点Googleエンティティクラウドスタックの始め方 4.1. オプション1:古参Gmailアカウントの取得 4.2. オプション2:新規アカウントの作成エンティティスタック用のGoogle Driveの設定 5.1. フォルダタイプの理解 5.2. パブリックフォルダの作成 5.3. ア





家






