Maison
Xiaomi dévoile MiMo-V2-TTS, son modèle d'IA développé en interne pour la synthèse vocale tenant compte des dialectes et des émotions
Xiaomi a officiellement lancé son modèle de synthèse vocale à grande échelle développé en interne, MiMo-V2-TTS, qui représente une avancée majeure en matière de génération vocale hautement contrôlable et expressive. S'appuyant sur l'Audio Tokenizer propriétaire de Xiaomi et sur un cadre de modélisation conjointe parole-texte à livres de codes multiples, ce modèle tire parti d'un pré-entraînement intensif sur des centaines de millions d'heures de données vocales pour permettre des ajustements précis, allant du style général aux nuances émotionnelles les plus subtiles. Contrairement aux systèmes TTS conventionnels, MiMo-V2-TTS est capable d'effectuer des changements de ton et des variations émotionnelles au sein d'une même phrase, imitant ainsi de près le rythme naturel de la parole humaine et prenant en charge la synthèse de chansons avec une hauteur et un rythme précis. Sur le plan technique, Xiaomi a intégré un apprentissage par renforcement multidimensionnel afin d'équilibrer la stabilité et l'expressivité du résultat. Le modèle reconnaît intelligemment les indices textuels tels que la ponctuation, les marqueurs d'intonation et les indicateurs d'accentuation, les traduisant en expressions vocales appropriées sans nécessiter d'annotation manuelle supplémentaire. De plus, le modèle fait preuve d'une forte adaptabilité interrégionale, prenant en charge de multiples dialectes, notamment le mandarin du nord-est, le sichuanais, le henanais, le cantonais et les accents taïwanais, et est capable de performances vocales adaptées à chaque personnage.
Étape clé de la feuille de route technologique vocale de Xiaomi, MiMo-V2-TTS élargira encore la prise en charge multilingue et s'intégrera étroitement aux capacités de compréhension multimodale de MiMo-V2-Omni. Cette évolution, de la synthèse vocale autonome vers une perception et une expression multimodales coordonnées, marque un tournant pour les agents IA : ils passent d'une interaction sémantique basique à une interaction homme-machine plus personnalisée et plus riche en émotions, améliorant considérablement l'expérience utilisateur dans des applications telles que les cabines intelligentes et les maisons connectées.

Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (3)
Xiaomi's new MiMo-V2-TTS looks promising for dialect support, but I'm still skeptical about how well it handles complex emotional shifts in real-time conversations. 🤔 The tech is impressive, yet the uncanny valley effect might linger for some users. Let's see if it can truly mimic the subtle nuances of human speech without sounding robotic after long usage. 🎙️✨
Wait, so Xiaomi's new model can synthesize voice with dialects AND emotions? That's either incredibly useful for localization or terrifying for deepfakes. I wonder how they handle tonal languages like Chinese... also, rip voice actors? 😬
Xiaomi a officiellement lancé son modèle de synthèse vocale à grande échelle développé en interne, MiMo-V2-TTS, qui représente une avancée majeure en matière de génération vocale hautement contrôlable et expressive. S'appuyant sur l'Audio Tokenizer propriétaire de Xiaomi et sur un cadre de modélisation conjointe parole-texte à livres de codes multiples, ce modèle tire parti d'un pré-entraînement intensif sur des centaines de millions d'heures de données vocales pour permettre des ajustements précis, allant du style général aux nuances émotionnelles les plus subtiles. Contrairement aux systèmes TTS conventionnels, MiMo-V2-TTS est capable d'effectuer des changements de ton et des variations émotionnelles au sein d'une même phrase, imitant ainsi de près le rythme naturel de la parole humaine et prenant en charge la synthèse de chansons avec une hauteur et un rythme précis. Sur le plan technique, Xiaomi a intégré un apprentissage par renforcement multidimensionnel afin d'équilibrer la stabilité et l'expressivité du résultat. Le modèle reconnaît intelligemment les indices textuels tels que la ponctuation, les marqueurs d'intonation et les indicateurs d'accentuation, les traduisant en expressions vocales appropriées sans nécessiter d'annotation manuelle supplémentaire. De plus, le modèle fait preuve d'une forte adaptabilité interrégionale, prenant en charge de multiples dialectes, notamment le mandarin du nord-est, le sichuanais, le henanais, le cantonais et les accents taïwanais, et est capable de performances vocales adaptées à chaque personnage.
Étape clé de la feuille de route technologique vocale de Xiaomi, MiMo-V2-TTS élargira encore la prise en charge multilingue et s'intégrera étroitement aux capacités de compréhension multimodale de MiMo-V2-Omni. Cette évolution, de la synthèse vocale autonome vers une perception et une expression multimodales coordonnées, marque un tournant pour les agents IA : ils passent d'une interaction sémantique basique à une interaction homme-machine plus personnalisée et plus riche en émotions, améliorant considérablement l'expérience utilisateur dans des applications telles que les cabines intelligentes et les maisons connectées.

Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Xiaomi's new MiMo-V2-TTS looks promising for dialect support, but I'm still skeptical about how well it handles complex emotional shifts in real-time conversations. 🤔 The tech is impressive, yet the uncanny valley effect might linger for some users. Let's see if it can truly mimic the subtle nuances of human speech without sounding robotic after long usage. 🎙️✨
Wait, so Xiaomi's new model can synthesize voice with dialects AND emotions? That's either incredibly useful for localization or terrifying for deepfakes. I wonder how they handle tonal languages like Chinese... also, rip voice actors? 😬











