Maison
Tongyi Qianwen Qwen-Audio-3.0-TTS est désormais disponible avec un délai de transmission du premier paquet de 300 ms et 20 dialectes
L'équipe Qwen d'Alibaba a lancé le nouveau modèle de synthèse vocale en temps réel Qwen-Audio-3.0-TTS, faisant ainsi passer la synthèse vocale de la simple génération à une véritable expression. La version Plus occupe désormais la première place mondiale du classement Speech Arena, une référence reconnue par Artificial Analysis, devançant ainsi Gemini 3.1 TTS, ElevenLabs v3 et d’autres modèles majeurs.

Deux versions sont disponibles : la version Flash est destinée aux interactions en temps réel avec une latence initiale d’environ 300 ms, ce qui est idéal pour les assistants intelligents et autres cas d’utilisation nécessitant une faible latence ; la version Plus privilégie une génération de haute qualité, offrant un naturel et une ressemblance vocale améliorés.
Quatre avancées majeures au niveau des capacités de base :
Premièrement, la prise en charge multilingue et des dialectes a été étendue à 16 langues, la version Plus atteignant une similitude moyenne avec l’orateur de 82,75 % sur l’ensemble de ces 16 langues — le taux le plus élevé du secteur. Elle couvre également 20 dialectes chinois, en conservant les caractéristiques authentiques de ces dialectes plutôt qu’en les atténuant, pour des expressions plus proches de celles d’un locuteur natif.
Deuxièmement, des instructions en langage naturel flexibles permettent aux utilisateurs de générer une parole précise à l’aide de consignes telles que « ton doux de service client » ou « style d’animateur de streaming en direct », sans avoir besoin d’annotations professionnelles.
Troisièmement, le contrôle fin des balises prend en charge des balises structurées telles que [halètement] et [colère], permettant une gestion précise des détails non verbaux comme la respiration et le rire — ce qui convient particulièrement aux jeux, aux livres audio et à des scénarios similaires.
Quatrièmement, une grande robustesse acoustique : même si l’enregistrement de référence contient beaucoup de bruit ou de réverbération, le modèle filtre automatiquement les bruits de fond tout en préservant la qualité vocale, garantissant ainsi un résultat de synthèse stable.
La bibliothèque de voix premium qui l’accompagne comprend divers types de voix — instructions, dialectes et langues moins courantes —, prend en charge une sortie audio haute définition à 48 K (dont le lancement est prévu le 24 juillet) et peut synthétiser jusqu’à 3 minutes de texte long par session. Le modèle est désormais entièrement disponible sur la plateforme BaiLian d’Alibaba Cloud, où les développeurs peuvent y accéder et l’essayer, ouvrant ainsi de nouvelles possibilités en matière d’interaction vocale.

Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
L'équipe Qwen d'Alibaba a lancé le nouveau modèle de synthèse vocale en temps réel Qwen-Audio-3.0-TTS, faisant ainsi passer la synthèse vocale de la simple génération à une véritable expression. La version Plus occupe désormais la première place mondiale du classement Speech Arena, une référence reconnue par Artificial Analysis, devançant ainsi Gemini 3.1 TTS, ElevenLabs v3 et d’autres modèles majeurs.

Deux versions sont disponibles : la version Flash est destinée aux interactions en temps réel avec une latence initiale d’environ 300 ms, ce qui est idéal pour les assistants intelligents et autres cas d’utilisation nécessitant une faible latence ; la version Plus privilégie une génération de haute qualité, offrant un naturel et une ressemblance vocale améliorés.
Quatre avancées majeures au niveau des capacités de base :
Premièrement, la prise en charge multilingue et des dialectes a été étendue à 16 langues, la version Plus atteignant une similitude moyenne avec l’orateur de 82,75 % sur l’ensemble de ces 16 langues — le taux le plus élevé du secteur. Elle couvre également 20 dialectes chinois, en conservant les caractéristiques authentiques de ces dialectes plutôt qu’en les atténuant, pour des expressions plus proches de celles d’un locuteur natif.
Deuxièmement, des instructions en langage naturel flexibles permettent aux utilisateurs de générer une parole précise à l’aide de consignes telles que « ton doux de service client » ou « style d’animateur de streaming en direct », sans avoir besoin d’annotations professionnelles.
Troisièmement, le contrôle fin des balises prend en charge des balises structurées telles que [halètement] et [colère], permettant une gestion précise des détails non verbaux comme la respiration et le rire — ce qui convient particulièrement aux jeux, aux livres audio et à des scénarios similaires.
Quatrièmement, une grande robustesse acoustique : même si l’enregistrement de référence contient beaucoup de bruit ou de réverbération, le modèle filtre automatiquement les bruits de fond tout en préservant la qualité vocale, garantissant ainsi un résultat de synthèse stable.
La bibliothèque de voix premium qui l’accompagne comprend divers types de voix — instructions, dialectes et langues moins courantes —, prend en charge une sortie audio haute définition à 48 K (dont le lancement est prévu le 24 juillet) et peut synthétiser jusqu’à 3 minutes de texte long par session. Le modèle est désormais entièrement disponible sur la plateforme BaiLian d’Alibaba Cloud, où les développeurs peuvent y accéder et l’essayer, ouvrant ainsi de nouvelles possibilités en matière d’interaction vocale.

Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











