Lar
A NVIDIA apresenta o modelo de inteligência unificada de áudio Nemotron-Labs-Audex-30B-A3B

As grandes modelos multimodais evoluem rapidamente, as capacidades de processamento de áudio são frequentemente comprometidas — muitos modelos melhoram a compreensão de áudio em detrimento da lógica textual. Para resolver isso, pesquisadores da NVIDIA apresentaram o Nemotron-Labs-Audex-30B-A3B (Audex), um grande modelo de linguagem unificado de áudio-texto projetado para preencher essa lacuna.
O Audex emprega um design simplificado e eficiente, construído sobre uma arquitetura robusta de Mistura de Especialistas (MoE) puramente textual. Ao utilizar um único decodificador Transformer, ele processa tokens de texto e tokens de áudio quantizados simultaneamente. Essa abordagem projeta as entradas de áudio no espaço de incorporação de texto, garantindo integração perfeita com a infraestrutura existente de LLMs para tarefas multimodais e alcançando uma integração profunda verdadeira.
O treinamento envolveu conjuntos de dados extensos compostos por 157,4 bilhões de tokens de áudio e 320,5 bilhões de tokens de texto. Através de treinamento supervisionado em múltiplas etapas, Aprendizado por Reforço em Cascata puramente textual e destilação de conhecimento em política de múltiplos domínios, o Audex alcança desempenho líder na indústria em compreensão de áudio, reconhecimento de fala, tradução e geração. Crucialmente, ele preserva as capacidades principais do LLM original em raciocínio, alinhamento, recuperação de conhecimento e processamento de texto longo com degradação mínima.
Como um modelo de código aberto, o Audex marca um marco significativo para o setor de tecnologia de voz. Indo além da pesquisa teórica, ele oferece uma solução madura para que desenvolvedores avaliem e implantem diretamente. Para aqueles que gerenciam interações de áudio complexas, o Audex fornece uma opção equilibrada que melhora o desempenho enquanto abre novas vias para a pesquisa de inteligência multimodal.
Artigo relacionado
O Claude Opus 5.2 Night Gray é lançado com resposta mais rápida, resolvendo o problema de preguiça
O Opus 5.2 foi lançado discretamente nesta manhã, levando muitos desenvolvedores a notar que o modelo atualizado, Claude Opus 5.2, iniciou uma rollout limitada dentro do Claude Code.Na noite de ontem, usuários do X observaram que invocar o Opus 5 no
A Fireworks AI apresenta o FireRouter com Opus: reduz os custos de codificação em 57% com uma queda mínima na precisão
A Fireworks AI apresentou o FireRouter com Opus, o primeiro sistema de roteamento consciente de cache do setor, desenvolvido especificamente para a série Claude Opus. Agora disponível por meio de um endpoint serverless, este modelo de roteamento inde
Como corrigir as Core Web Vitals para o SEO móvel
Impulsione o SEO Local: Construa Pilhas de Nuvem de Entidades do Google DriveSumário:IntroduçãoCompreendendo o Empilhamento de Nuvem de Entidades do GooglePrincipais Benefícios do Empilhamento de Nuvem de Entidades do GoogleComeçando com Pilhas
Recomendações de tópicos especiais relacionados
Comentários (0)

As grandes modelos multimodais evoluem rapidamente, as capacidades de processamento de áudio são frequentemente comprometidas — muitos modelos melhoram a compreensão de áudio em detrimento da lógica textual. Para resolver isso, pesquisadores da NVIDIA apresentaram o Nemotron-Labs-Audex-30B-A3B (Audex), um grande modelo de linguagem unificado de áudio-texto projetado para preencher essa lacuna.
O Audex emprega um design simplificado e eficiente, construído sobre uma arquitetura robusta de Mistura de Especialistas (MoE) puramente textual. Ao utilizar um único decodificador Transformer, ele processa tokens de texto e tokens de áudio quantizados simultaneamente. Essa abordagem projeta as entradas de áudio no espaço de incorporação de texto, garantindo integração perfeita com a infraestrutura existente de LLMs para tarefas multimodais e alcançando uma integração profunda verdadeira.
O treinamento envolveu conjuntos de dados extensos compostos por 157,4 bilhões de tokens de áudio e 320,5 bilhões de tokens de texto. Através de treinamento supervisionado em múltiplas etapas, Aprendizado por Reforço em Cascata puramente textual e destilação de conhecimento em política de múltiplos domínios, o Audex alcança desempenho líder na indústria em compreensão de áudio, reconhecimento de fala, tradução e geração. Crucialmente, ele preserva as capacidades principais do LLM original em raciocínio, alinhamento, recuperação de conhecimento e processamento de texto longo com degradação mínima.
Como um modelo de código aberto, o Audex marca um marco significativo para o setor de tecnologia de voz. Indo além da pesquisa teórica, ele oferece uma solução madura para que desenvolvedores avaliem e implantem diretamente. Para aqueles que gerenciam interações de áudio complexas, o Audex fornece uma opção equilibrada que melhora o desempenho enquanto abre novas vias para a pesquisa de inteligência multimodal.
O Claude Opus 5.2 Night Gray é lançado com resposta mais rápida, resolvendo o problema de preguiça
O Opus 5.2 foi lançado discretamente nesta manhã, levando muitos desenvolvedores a notar que o modelo atualizado, Claude Opus 5.2, iniciou uma rollout limitada dentro do Claude Code.Na noite de ontem, usuários do X observaram que invocar o Opus 5 no
A Fireworks AI apresenta o FireRouter com Opus: reduz os custos de codificação em 57% com uma queda mínima na precisão
A Fireworks AI apresentou o FireRouter com Opus, o primeiro sistema de roteamento consciente de cache do setor, desenvolvido especificamente para a série Claude Opus. Agora disponível por meio de um endpoint serverless, este modelo de roteamento inde
Como corrigir as Core Web Vitals para o SEO móvel
Impulsione o SEO Local: Construa Pilhas de Nuvem de Entidades do Google DriveSumário:IntroduçãoCompreendendo o Empilhamento de Nuvem de Entidades do GooglePrincipais Benefícios do Empilhamento de Nuvem de Entidades do GoogleComeçando com Pilhas











