NVIDIA dévoile le modèle d’intelligence audio unifié Nemotron-Labs-Audex-30B-A3B

Alors que les grands modèles multimodaux évoluent rapidement, les capacités de traitement audio sont souvent compromises : de nombreux modèles améliorent la compréhension audio au détriment de la logique textuelle. Pour remédier à cette situation, les chercheurs de NVIDIA ont présenté Nemotron-Labs-Audex-30B-A3B (Audex), un grand modèle de langage unifié audio-texte conçu pour combler cet écart.
Audex adopte une conception simplifiée et efficace, reposant sur une architecture robuste de type Mixture of Experts (MoE) purement textuelle. En utilisant un seul décodeur Transformer, il traite simultanément les tokens textuels et les tokens audio quantifiés. Cette approche projette les entrées audio dans l'espace d'intégration textuelle, garantissant une intégration transparente avec les infrastructures de LLM existantes pour les tâches multimodales et atteignant une intégration profonde véritable.
L'entraînement a impliqué des ensembles de données massifs composés de 157,4 milliards de tokens audio et 320,5 milliards de tokens textuels. Grâce à un entraînement supervisé multi-étapes, à l'apprentissage par renforcement en cascade purement textuel et à la distillation de connaissances multi-domaines selon la politique, Audex atteint des performances de pointe dans le secteur en matière de compréhension audio, de reconnaissance vocale, de traduction et de génération. Crucialement, il préserve les capacités fondamentales du LLM d'origine en matière de raisonnement, d'alignement, de récupération de connaissances et de traitement de longs textes, avec une dégradation minimale.
En tant que modèle open source, Audex marque une étape importante pour le secteur des technologies vocales. Allant au-delà de la recherche théorique, il offre une solution mature permettant aux développeurs d'évaluer et de déployer directement. Pour ceux qui gèrent des interactions audio complexes, Audex propose une option équilibrée qui améliore les performances tout en ouvrant de nouvelles voies pour la recherche sur l'intelligence multimodale.
Article connexe
Claude Opus 5.2 Gris Nuit est lancé avec une réponse plus rapide, résolvant le problème de paresse
Opus 5.2 a été lancé discrètement ce matin, incitant de nombreux développeurs à remarquer que le modèle mis à jour, Claude Opus 5.2, a entamé un déploiement limité au sein de Claude Code.Hier soir, les utilisateurs de X ont observé que l’appel d’Opu
Fireworks AI dévoile FireRouter avec Opus : réduit les coûts d’encodage de 57 % avec une baisse minimale de la précision
Fireworks AI a présenté FireRouter avec Opus, le premier système de routage conscient du cache de l’industrie, conçu spécifiquement pour la série Claude Opus. Désormais accessible via une extrémité de serveur sans serveur, ce modèle de routage indépe
Comment corriger les Core Web Vitals pour le référencement mobile
Boostez le référencement local : Construisez vos piles de nuage d'entités Google DriveTable des matières :IntroductionComprendre l'empilement de nuage d'entités GooglePrincipaux avantages de l'empilement de nuage d'entités GoogleCommencer avec l
Recommandations de sujets spéciaux liés
commentaires (0)

Alors que les grands modèles multimodaux évoluent rapidement, les capacités de traitement audio sont souvent compromises : de nombreux modèles améliorent la compréhension audio au détriment de la logique textuelle. Pour remédier à cette situation, les chercheurs de NVIDIA ont présenté Nemotron-Labs-Audex-30B-A3B (Audex), un grand modèle de langage unifié audio-texte conçu pour combler cet écart.
Audex adopte une conception simplifiée et efficace, reposant sur une architecture robuste de type Mixture of Experts (MoE) purement textuelle. En utilisant un seul décodeur Transformer, il traite simultanément les tokens textuels et les tokens audio quantifiés. Cette approche projette les entrées audio dans l'espace d'intégration textuelle, garantissant une intégration transparente avec les infrastructures de LLM existantes pour les tâches multimodales et atteignant une intégration profonde véritable.
L'entraînement a impliqué des ensembles de données massifs composés de 157,4 milliards de tokens audio et 320,5 milliards de tokens textuels. Grâce à un entraînement supervisé multi-étapes, à l'apprentissage par renforcement en cascade purement textuel et à la distillation de connaissances multi-domaines selon la politique, Audex atteint des performances de pointe dans le secteur en matière de compréhension audio, de reconnaissance vocale, de traduction et de génération. Crucialement, il préserve les capacités fondamentales du LLM d'origine en matière de raisonnement, d'alignement, de récupération de connaissances et de traitement de longs textes, avec une dégradation minimale.
En tant que modèle open source, Audex marque une étape importante pour le secteur des technologies vocales. Allant au-delà de la recherche théorique, il offre une solution mature permettant aux développeurs d'évaluer et de déployer directement. Pour ceux qui gèrent des interactions audio complexes, Audex propose une option équilibrée qui améliore les performances tout en ouvrant de nouvelles voies pour la recherche sur l'intelligence multimodale.
Claude Opus 5.2 Gris Nuit est lancé avec une réponse plus rapide, résolvant le problème de paresse
Opus 5.2 a été lancé discrètement ce matin, incitant de nombreux développeurs à remarquer que le modèle mis à jour, Claude Opus 5.2, a entamé un déploiement limité au sein de Claude Code.Hier soir, les utilisateurs de X ont observé que l’appel d’Opu
Fireworks AI dévoile FireRouter avec Opus : réduit les coûts d’encodage de 57 % avec une baisse minimale de la précision
Fireworks AI a présenté FireRouter avec Opus, le premier système de routage conscient du cache de l’industrie, conçu spécifiquement pour la série Claude Opus. Désormais accessible via une extrémité de serveur sans serveur, ce modèle de routage indépe
Comment corriger les Core Web Vitals pour le référencement mobile
Boostez le référencement local : Construisez vos piles de nuage d'entités Google DriveTable des matières :IntroductionComprendre l'empilement de nuage d'entités GooglePrincipaux avantages de l'empilement de nuage d'entités GoogleCommencer avec l





Maison






