Maison
Volcano Engine lance Doubao Audio Model 1.0 : un son cinématographique en une seule phrase et des voix de personnages cohérentes pendant 10 minutes
Hier, Volc Engine a officiellement lancé le modèle de génération audio Doubao 1.0 (Doubao-Seed-Audio 1.0), qui accepte des entrées textuelles ou audio pour produire des œuvres audio complètes de bout en bout. Sa principale innovation réside dans le fait qu’une seule instruction permet de gérer à la fois les dialogues, les effets sonores et la musique de fond, éliminant ainsi le besoin d’un montage multipiste manuel.

Transformez une phrase en réalisateur audio — aucune post-production n’est nécessaire.
Auparavant, la création d’un contenu audio de haute qualité nécessitait de générer séparément les dialogues, les effets sonores et la musique, puis d’aligner et de mixer manuellement les pistes — un processus complexe qui exigeait une expertise en post-production. Le modèle de génération audio Doubao 1.0 regroupe tout cela en une seule instruction : les utilisateurs peuvent définir les répliques, le ton et le rythme émotionnel de plusieurs personnages en une seule instruction, intégrer des détails tels que des rires, des soupirs, des pauses et des accents dialectaux, et générer simultanément de la musique de fond et des effets sonores d’ambiance, pour obtenir directement un produit fini. Un créateur peut saisir une description et obtenir immédiatement un podcast, un livre audio ou un contenu audio de marque prêt à être diffusé.
Des voix de personnages cohérentes tout au long d’un enregistrement audio de longue durée, sans perte de qualité.
Le plus grand défi dans la création d’enregistrements audio longs réside dans la cohérence : s’assurer qu’un personnage a la même voix à la première minute qu’à la dixième. Le modèle 1.0 de Doubao Audio Generation intègre profondément la conversion texte-audio à un enregistrement de référence, garantissant ainsi une qualité vocale constante sur de longs segments, ce qui évite aux créateurs d’avoir à comparer et à réviser chaque partie. Le modèle actuel prend en charge jusqu’à 2 minutes d’audio par génération et, grâce à la fonctionnalité d’extension, il préserve la cohérence vocale pour des productions plus longues, ce qui convient aux livres audio, aux podcasts et aux longues séries.
De plus, le modèle offre un contrôle dissocié de la voix et du style, permettant à une même voix de s’adapter à diverses émotions et contextes — et même à une seule voix d’incarner plusieurs rôles avec des expressions différentes. Cela améliore considérablement la flexibilité pour le doublage de personnages et la production audio créative. Actuellement, Volc Ark a ouvert les tests de son API, et les utilisateurs individuels peuvent bénéficier d’un quota de création de 30 minutes dans l’Experience Center. Le modèle de génération audio Doubao 1.0 sera également lancé sur des produits tels que CapCut, Jiemod et Tomato.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (1)
Hier, Volc Engine a officiellement lancé le modèle de génération audio Doubao 1.0 (Doubao-Seed-Audio 1.0), qui accepte des entrées textuelles ou audio pour produire des œuvres audio complètes de bout en bout. Sa principale innovation réside dans le fait qu’une seule instruction permet de gérer à la fois les dialogues, les effets sonores et la musique de fond, éliminant ainsi le besoin d’un montage multipiste manuel.

Transformez une phrase en réalisateur audio — aucune post-production n’est nécessaire.
Auparavant, la création d’un contenu audio de haute qualité nécessitait de générer séparément les dialogues, les effets sonores et la musique, puis d’aligner et de mixer manuellement les pistes — un processus complexe qui exigeait une expertise en post-production. Le modèle de génération audio Doubao 1.0 regroupe tout cela en une seule instruction : les utilisateurs peuvent définir les répliques, le ton et le rythme émotionnel de plusieurs personnages en une seule instruction, intégrer des détails tels que des rires, des soupirs, des pauses et des accents dialectaux, et générer simultanément de la musique de fond et des effets sonores d’ambiance, pour obtenir directement un produit fini. Un créateur peut saisir une description et obtenir immédiatement un podcast, un livre audio ou un contenu audio de marque prêt à être diffusé.
Des voix de personnages cohérentes tout au long d’un enregistrement audio de longue durée, sans perte de qualité.
Le plus grand défi dans la création d’enregistrements audio longs réside dans la cohérence : s’assurer qu’un personnage a la même voix à la première minute qu’à la dixième. Le modèle 1.0 de Doubao Audio Generation intègre profondément la conversion texte-audio à un enregistrement de référence, garantissant ainsi une qualité vocale constante sur de longs segments, ce qui évite aux créateurs d’avoir à comparer et à réviser chaque partie. Le modèle actuel prend en charge jusqu’à 2 minutes d’audio par génération et, grâce à la fonctionnalité d’extension, il préserve la cohérence vocale pour des productions plus longues, ce qui convient aux livres audio, aux podcasts et aux longues séries.
De plus, le modèle offre un contrôle dissocié de la voix et du style, permettant à une même voix de s’adapter à diverses émotions et contextes — et même à une seule voix d’incarner plusieurs rôles avec des expressions différentes. Cela améliore considérablement la flexibilité pour le doublage de personnages et la production audio créative. Actuellement, Volc Ark a ouvert les tests de son API, et les utilisateurs individuels peuvent bénéficier d’un quota de création de 30 minutes dans l’Experience Center. Le modèle de génération audio Doubao 1.0 sera également lancé sur des produits tels que CapCut, Jiemod et Tomato.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











