Hogar
Tongyi Qianwen Qwen-Audio-3.0-TTS entra en funcionamiento con un retraso del primer paquete de 300 ms y 20 dialectos
El equipo de Alibaba Qwen ha lanzado el nuevo modelo de síntesis de voz en tiempo real Qwen-Audio-3.0-TTS, lo que supone un avance que lleva la síntesis de voz de la generación básica a la verdadera expresión. La versión Plus ocupa ahora el primer puesto a nivel mundial en Speech Arena, un prestigioso banco de pruebas de Artificial Analysis, superando a Gemini 3.1 TTS, ElevenLabs v3 y otros modelos importantes.

Hay dos versiones disponibles: la versión Flash está pensada para la interacción en tiempo real, con una latencia inicial de unos 300 ms, ideal para asistentes inteligentes y otros casos de uso que requieren baja latencia; la versión Plus da prioridad a la generación de alta calidad, ofreciendo una mayor naturalidad y similitud vocal.
Cuatro avances clave en las capacidades principales:
En primer lugar, la compatibilidad multilingüe y con dialectos se ha ampliado a 16 idiomas, y la versión Plus alcanza una similitud media con el hablante del 82,75 % en los 16 idiomas, la más alta del sector. También abarca 20 dialectos chinos, manteniendo las características auténticas de los dialectos en lugar de atenuarlas, lo que permite expresiones más parecidas a las de un nativo.
En segundo lugar, las instrucciones flexibles en lenguaje natural permiten a los usuarios generar voz precisa con indicaciones como «tono amable de atención al cliente» o «estilo de presentador de retransmisión en directo», sin necesidad de anotaciones profesionales.
En tercer lugar, el control detallado de etiquetas admite etiquetas estructuradas como [jadeo] y [enfadado], lo que permite una gestión precisa de detalles no verbales como la respiración y la risa —ideal para videojuegos, audiolibros y situaciones similares—.
En cuarto lugar, una gran robustez acústica: incluso si el audio de referencia contiene mucho ruido o reverberación, el modelo filtra automáticamente el ruido de fondo al tiempo que conserva la calidad de la voz, lo que garantiza una salida de síntesis estable.
La biblioteca de voces premium que lo acompaña incluye diversos tipos de voces —instrucciones, dialectos e idiomas menos utilizados—, admite salida de audio de alta definición a 48K (cuya puesta en marcha está prevista para el 24 de julio) y puede sintetizar hasta 3 minutos de texto largo por sesión. El modelo ya está totalmente disponible en la plataforma BaiLian de Alibaba Cloud, donde los desarrolladores pueden acceder a él y probarlo, lo que abre nuevas posibilidades en la interacción por voz.

Artículo relacionado
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El equipo de Alibaba Qwen ha lanzado el nuevo modelo de síntesis de voz en tiempo real Qwen-Audio-3.0-TTS, lo que supone un avance que lleva la síntesis de voz de la generación básica a la verdadera expresión. La versión Plus ocupa ahora el primer puesto a nivel mundial en Speech Arena, un prestigioso banco de pruebas de Artificial Analysis, superando a Gemini 3.1 TTS, ElevenLabs v3 y otros modelos importantes.

Hay dos versiones disponibles: la versión Flash está pensada para la interacción en tiempo real, con una latencia inicial de unos 300 ms, ideal para asistentes inteligentes y otros casos de uso que requieren baja latencia; la versión Plus da prioridad a la generación de alta calidad, ofreciendo una mayor naturalidad y similitud vocal.
Cuatro avances clave en las capacidades principales:
En primer lugar, la compatibilidad multilingüe y con dialectos se ha ampliado a 16 idiomas, y la versión Plus alcanza una similitud media con el hablante del 82,75 % en los 16 idiomas, la más alta del sector. También abarca 20 dialectos chinos, manteniendo las características auténticas de los dialectos en lugar de atenuarlas, lo que permite expresiones más parecidas a las de un nativo.
En segundo lugar, las instrucciones flexibles en lenguaje natural permiten a los usuarios generar voz precisa con indicaciones como «tono amable de atención al cliente» o «estilo de presentador de retransmisión en directo», sin necesidad de anotaciones profesionales.
En tercer lugar, el control detallado de etiquetas admite etiquetas estructuradas como [jadeo] y [enfadado], lo que permite una gestión precisa de detalles no verbales como la respiración y la risa —ideal para videojuegos, audiolibros y situaciones similares—.
En cuarto lugar, una gran robustez acústica: incluso si el audio de referencia contiene mucho ruido o reverberación, el modelo filtra automáticamente el ruido de fondo al tiempo que conserva la calidad de la voz, lo que garantiza una salida de síntesis estable.
La biblioteca de voces premium que lo acompaña incluye diversos tipos de voces —instrucciones, dialectos e idiomas menos utilizados—, admite salida de audio de alta definición a 48K (cuya puesta en marcha está prevista para el 24 de julio) y puede sintetizar hasta 3 minutos de texto largo por sesión. El modelo ya está totalmente disponible en la plataforma BaiLian de Alibaba Cloud, donde los desarrolladores pueden acceder a él y probarlo, lo que abre nuevas posibilidades en la interacción por voz.

Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de











