Maison
Tencent et Tsinghua lancent SongGeneration 2, avec un taux d'erreur de 8,55 %, ce qui accentue la pression sur Suno
Le paysage de la musique générée par l'IA a connu un nouveau tournant majeur début 2026. Le 9 mars, le modèle de base musical SongGeneration2, développé conjointement par Tencent et le laboratoire d'interaction homme-machine en synthèse vocale de l'université de Tsinghua , a été officiellement lancé. Ce modèle a non seulement marqué un bond qualitatif en matière d’architecture technique, mais il a également surpassé les modèles open source courants sur plusieurs aspects essentiels, rivalisant même avec les meilleurs modèles commerciaux en termes de qualité globale.

Trois avancées majeures : finie la musique IA « artificielle »
Les principaux atouts de SongGeneration2 découlent d’une mise à niveau complète de son architecture sous-jacente, qui résout trois problèmes majeurs qui affectaient la musique générée par l’IA jusqu’à présent :
Une musicalité élevée : contrairement au simple empilement de mélodies, ce modèle gère des arrangements multipistes complexes avec une profondeur spatiale impressionnante.
Précision élevée des paroles : la prononciation imprécise et les variations de hauteur de son fantomatiques appartiennent désormais au passé. Son taux d’erreur phonémique (PER) n’est que de 8,55 %, surpassant nettement le modèle commercial de référence Suno v5 (12,4 %) et n’étant devancé que par MiniMax2.5 .
Grande contrôlabilité : que ce soit par le biais de descriptions textuelles ou de consignes audio, il suit les instructions avec précision, permettant une personnalisation approfondie du style et des émotions.

Moteur « Dual-Core » : une collaboration de rêve entre les modèles LLM et les modèles de diffusion
Sur le plan architectural, SongGeneration2 utilise une architecture hybride innovante combinant LLM et diffusion :
Composing Brain (LeLM) : gère la planification de la structure globale et les détails vocaux, résolvant ainsi le défi de « comment chanter ».
Renderer haute fidélité (diffusion) : synthétise des détails acoustiques extrêmement complexes sous la direction du modèle linguistique.
Représentation hiérarchique : le premier à adopter la modélisation parallèle de représentations mixtes et multipistes, conciliant la stabilité mélodique et le raffinement de la qualité sonore.
Véritable open source, accessible à tous : même les ordinateurs ordinaires peuvent désormais « composer des chansons »
Ce qui a le plus enthousiasmé les développeurs, c’est la remarquable ouverture d’esprit de Tencent. Le modèle SongGeneration-v2-large, doté de 4 milliards de paramètres, est désormais entièrement open source et prend en charge la génération multilingue, notamment en chinois et en anglais. Fait remarquable, il fonctionne sans problème sur du matériel grand public disposant de seulement 22 Go de VRAM, ce qui permet la création musicale locale et privée.
Pour permettre aux utilisateurs de l’essayer immédiatement, l’équipe a également publié la version SongGeneration-v2-Fast sur HuggingFace, qui sacrifie une légère baisse de la qualité audio au profit d’une génération ultra-rapide — produisant une chanson complète en moins d’une minute.
Au vu des performances de SongGeneration2 , la musique générée par IA est officiellement passée du statut de « jouet de geek » à celui d’« application de niveau commercial ». Avec la mise en open source prochaine d’un modèle Medium prenant en charge 12 Go de VRAM et d’un cadre d’évaluation automatisé, l’ère où chacun pourra devenir « compositeur » pourrait bien être enfin à nos portes.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
Le paysage de la musique générée par l'IA a connu un nouveau tournant majeur début 2026. Le 9 mars, le modèle de base musical SongGeneration2, développé conjointement par

Trois avancées majeures : finie la musique IA « artificielle »
Les principaux atouts de
Une musicalité élevée : contrairement au simple empilement de mélodies, ce modèle gère des arrangements multipistes complexes avec une profondeur spatiale impressionnante.
Précision élevée des paroles : la prononciation imprécise et les variations de hauteur de son fantomatiques appartiennent désormais au passé. Son taux d’erreur phonémique (PER) n’est que de 8,55 %, surpassant nettement le modèle commercial de référence
Grande contrôlabilité : que ce soit par le biais de descriptions textuelles ou de consignes audio, il suit les instructions avec précision, permettant une personnalisation approfondie du style et des émotions.

Moteur « Dual-Core » : une collaboration de rêve entre les modèles LLM et les modèles de diffusion
Sur le plan architectural,
Composing Brain (LeLM) : gère la planification de la structure globale et les détails vocaux, résolvant ainsi le défi de « comment chanter ».
Renderer haute fidélité (diffusion) : synthétise des détails acoustiques extrêmement complexes sous la direction du modèle linguistique.
Représentation hiérarchique : le premier à adopter la modélisation parallèle de représentations mixtes et multipistes, conciliant la stabilité mélodique et le raffinement de la qualité sonore.
Véritable open source, accessible à tous : même les ordinateurs ordinaires peuvent désormais « composer des chansons »
Ce qui a le plus enthousiasmé les développeurs, c’est la remarquable ouverture d’esprit de Tencent. Le modèle SongGeneration-v2-large, doté de 4 milliards de paramètres, est désormais entièrement open source et prend en charge la génération multilingue, notamment en chinois et en anglais. Fait remarquable, il fonctionne sans problème sur du matériel grand public disposant de seulement 22 Go de VRAM, ce qui permet la création musicale locale et privée.
Pour permettre aux utilisateurs de l’essayer immédiatement, l’équipe a également publié la version SongGeneration-v2-Fast sur HuggingFace, qui sacrifie une légère baisse de la qualité audio au profit d’une génération ultra-rapide — produisant une chanson complète en moins d’une minute.
Au vu des performances de
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











