Maison
ByteDance dévoile Seed Audio 1.0, un outil de conversion de la parole en contenu qui révolutionne la création audio
Récemment, ByteDance a présenté Seed Audio 1.0, son nouveau modèle de création audio, qui marque une avancée significative dans le domaine de la génération audio par IA. Cette mise à jour fait évoluer la technologie au-delà de la simple synthèse vocale pour permettre la création de scènes sonores entièrement intégrées. Le modèle est actuellement disponible pour que les créateurs puissent le tester au Volcano Fangzhou Experience Center.
Traditionnellement, la production de contenus audio d'une qualité comparable à celle utilisée au cinéma et à la télévision nécessitait plusieurs modèles distincts pour générer les voix, les effets sonores et les bruits d'ambiance, qui étaient ensuite combinés manuellement. Cette approche prenait beaucoup de temps et rendait difficile le maintien d'une narration cohérente tout au long de l'enregistrement. Seed Audio 1.0 résout ce problème en intégrant tous les éléments audio au sein d’un cadre unique, plutôt que de se contenter d’assembler des éléments préenregistrés, ce qui lui permet de produire des œuvres sonores complètes soutenant un récit de bout en bout.

Selon les informations officielles, Seed Audio 1.0 présente trois fonctionnalités clés. Premièrement, il offre un contrôle spatio-temporel précis, permettant aux créateurs de définir le timing exact des dialogues et des effets sonores avec une précision allant jusqu’à 100 millisecondes, ce qui est idéal pour le doublage vidéo et la production publicitaire. Deuxièmement, il offre des performances vocales stables, prenant en charge la génération « zero-shot » et une sortie audio étendue tout en préservant les caractéristiques vocales du personnage. Il peut également transmettre naturellement toute une gamme d’émotions telles que la colère ou la joie, et permet même à une seule voix de représenter plusieurs personnages. Troisièmement, il offre une prise en charge multilingue robuste pour plus de 20 langues, dont le chinois, l’anglais et le japonais, garantissant ainsi que la voix sonne naturellement et s’adapte aux particularités linguistiques propres à chaque langue.
Les résultats d’évaluation montrent que le modèle offre de bonnes performances dans neuf scénarios créatifs courants, avec un taux de disponibilité audio supérieur à 90 %. De plus, son score MOS de naturel pour la génération multilingue se situe généralement au-dessus de 4 points, ce qui est considéré comme une excellente note.

En passant d’un outil capable uniquement de générer de la parole à un outil capable de créer du contenu audio complet, Seed Audio 1.0 réduit les obstacles à la production de matériel audio de haute qualité. L’équipe de développement prévoit d’améliorer encore le modèle en y intégrant des entrées multimodales telles que des références vidéo et en explorant des fonctionnalités de traduction contrôlables. Elle vise également à continuer d’améliorer les capacités de génération de longs fichiers audio et de pistes, afin d’aider les créateurs à transformer plus efficacement leurs idées sonores conceptuelles en œuvres audio pleinement fonctionnelles.
Page d'accueil du projet :
https://seed.bytedance.com/seedaudio1_0
Accès à l’expérience :
Centre d’expérience Volcano de Fangzhou - Connexion - Sélectionner un modèle vocal - Synthèse vocale - Doubao - Génération audio - 1.0
Article connexe
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Recommandations de sujets spéciaux liés
commentaires (0)
Récemment, ByteDance a présenté Seed Audio 1.0, son nouveau modèle de création audio, qui marque une avancée significative dans le domaine de la génération audio par IA. Cette mise à jour fait évoluer la technologie au-delà de la simple synthèse vocale pour permettre la création de scènes sonores entièrement intégrées. Le modèle est actuellement disponible pour que les créateurs puissent le tester au Volcano Fangzhou Experience Center.
Traditionnellement, la production de contenus audio d'une qualité comparable à celle utilisée au cinéma et à la télévision nécessitait plusieurs modèles distincts pour générer les voix, les effets sonores et les bruits d'ambiance, qui étaient ensuite combinés manuellement. Cette approche prenait beaucoup de temps et rendait difficile le maintien d'une narration cohérente tout au long de l'enregistrement. Seed Audio 1.0 résout ce problème en intégrant tous les éléments audio au sein d’un cadre unique, plutôt que de se contenter d’assembler des éléments préenregistrés, ce qui lui permet de produire des œuvres sonores complètes soutenant un récit de bout en bout.

Selon les informations officielles, Seed Audio 1.0 présente trois fonctionnalités clés. Premièrement, il offre un contrôle spatio-temporel précis, permettant aux créateurs de définir le timing exact des dialogues et des effets sonores avec une précision allant jusqu’à 100 millisecondes, ce qui est idéal pour le doublage vidéo et la production publicitaire. Deuxièmement, il offre des performances vocales stables, prenant en charge la génération « zero-shot » et une sortie audio étendue tout en préservant les caractéristiques vocales du personnage. Il peut également transmettre naturellement toute une gamme d’émotions telles que la colère ou la joie, et permet même à une seule voix de représenter plusieurs personnages. Troisièmement, il offre une prise en charge multilingue robuste pour plus de 20 langues, dont le chinois, l’anglais et le japonais, garantissant ainsi que la voix sonne naturellement et s’adapte aux particularités linguistiques propres à chaque langue.
Les résultats d’évaluation montrent que le modèle offre de bonnes performances dans neuf scénarios créatifs courants, avec un taux de disponibilité audio supérieur à 90 %. De plus, son score MOS de naturel pour la génération multilingue se situe généralement au-dessus de 4 points, ce qui est considéré comme une excellente note.

En passant d’un outil capable uniquement de générer de la parole à un outil capable de créer du contenu audio complet, Seed Audio 1.0 réduit les obstacles à la production de matériel audio de haute qualité. L’équipe de développement prévoit d’améliorer encore le modèle en y intégrant des entrées multimodales telles que des références vidéo et en explorant des fonctionnalités de traduction contrôlables. Elle vise également à continuer d’améliorer les capacités de génération de longs fichiers audio et de pistes, afin d’aider les créateurs à transformer plus efficacement leurs idées sonores conceptuelles en œuvres audio pleinement fonctionnelles.
Page d'accueil du projet :
https://seed.bytedance.com/seedaudio1_0
Accès à l’expérience :
Centre d’expérience Volcano de Fangzhou - Connexion - Sélectionner un modèle vocal - Synthèse vocale - Doubao - Génération audio - 1.0
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc











