Heim
Volcano Engine bringt „Doubao Audio Model 1.0“ auf den Markt: Filmreifer Sound für einen einzigen Satz, einheitliche Charakterstimmen für 10 Minuten
Gestern hat Volc Engine offiziell das „Doubao Audio Generation Model 1.0“ (Doubao-Seed-Audio 1.0) vorgestellt, das Text- oder Audioeingaben verarbeitet, um von Anfang bis Ende vollständige Audiowerke zu erzeugen. Der entscheidende Durchbruch besteht darin, dass eine einzige Eingabeaufforderung Dialoge, Soundeffekte und Hintergrundmusik gemeinsam verarbeiten kann, wodurch die manuelle Mehrspurbearbeitung entfällt.

Verwandeln Sie einen Satz in einen Audio-Regisseur – ganz ohne Nachbearbeitung.
Bisher erforderte die Erstellung hochwertiger Audioinhalte die separate Generierung von Dialogen, Soundeffekten und Musik sowie das anschließende manuelle Abgleichen und Abmischen der Spuren – ein komplexer Prozess, der Fachwissen in der Postproduktion erforderte. Das Doubao Audio Generation Model 1.0 fasst all dies in einer einzigen Eingabe zusammen: Nutzer können die Zeilen, den Tonfall und den emotionalen Rhythmus mehrerer Charaktere in einer einzigen Anweisung definieren, Details wie Lachen, Seufzer, Pausen und dialektale Akzente einbetten sowie gleichzeitig Hintergrundmusik und Umgebungsgeräusche generieren, wodurch direkt ein fertiges Produkt ausgegeben wird. Ein Creator kann eine Beschreibung eingeben und erhält sofort einen Podcast, ein Hörbuch oder ein Markenaudio, das zur Veröffentlichung bereit ist.
Konsistente Charakterstimmen über die gesamte Länge des Audios hinweg, ohne an Qualität einzubüßen.
Die größte Herausforderung bei der Erstellung langer Audioinhalte ist die Konsistenz – sicherzustellen, dass eine Figur in der ersten Minute genauso klingt wie in der zehnten. Das Doubao Audio Generation Model 1.0 integriert die Text-zu-Audio-Umwandlung tiefgreifend mit Referenzaudio und gewährleistet so eine gleichbleibende Stimmqualität über lange Abschnitte hinweg, sodass Kreative nicht jeden Teil einzeln vergleichen und überarbeiten müssen. Das aktuelle Modell unterstützt bis zu 2 Minuten Audio pro Generierung und bewahrt dank der Erweiterungsfunktion die Stimmkonsistenz auch bei längeren Ausgaben, was sich besonders für Hörbücher, Podcasts und lange Serien eignet.
Zudem ermöglicht das Modell eine entkoppelte Steuerung von Stimme und Stil, sodass sich dieselbe Stimme an verschiedene Emotionen und Kontexte anpassen lässt – sogar so, dass eine einzige Stimme mehrere Rollen mit unterschiedlichen Ausdrucksweisen darstellen kann. Dies erhöht die Flexibilität bei der Sprachausgabe von Charakteren und der kreativen Audioproduktion erheblich. Derzeit hat Volc Ark den API-Testbetrieb eröffnet, und einzelne Nutzer können im Experience Center ein Erstellungskontingent von 30 Minuten erhalten. Das Doubao Audio Generation Model 1.0 wird außerdem in Produkten wie CapCut, Jiemod und Tomato eingeführt.
Verwandter Artikel
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Gestern hat Volc Engine offiziell das „Doubao Audio Generation Model 1.0“ (Doubao-Seed-Audio 1.0) vorgestellt, das Text- oder Audioeingaben verarbeitet, um von Anfang bis Ende vollständige Audiowerke zu erzeugen. Der entscheidende Durchbruch besteht darin, dass eine einzige Eingabeaufforderung Dialoge, Soundeffekte und Hintergrundmusik gemeinsam verarbeiten kann, wodurch die manuelle Mehrspurbearbeitung entfällt.

Verwandeln Sie einen Satz in einen Audio-Regisseur – ganz ohne Nachbearbeitung.
Bisher erforderte die Erstellung hochwertiger Audioinhalte die separate Generierung von Dialogen, Soundeffekten und Musik sowie das anschließende manuelle Abgleichen und Abmischen der Spuren – ein komplexer Prozess, der Fachwissen in der Postproduktion erforderte. Das Doubao Audio Generation Model 1.0 fasst all dies in einer einzigen Eingabe zusammen: Nutzer können die Zeilen, den Tonfall und den emotionalen Rhythmus mehrerer Charaktere in einer einzigen Anweisung definieren, Details wie Lachen, Seufzer, Pausen und dialektale Akzente einbetten sowie gleichzeitig Hintergrundmusik und Umgebungsgeräusche generieren, wodurch direkt ein fertiges Produkt ausgegeben wird. Ein Creator kann eine Beschreibung eingeben und erhält sofort einen Podcast, ein Hörbuch oder ein Markenaudio, das zur Veröffentlichung bereit ist.
Konsistente Charakterstimmen über die gesamte Länge des Audios hinweg, ohne an Qualität einzubüßen.
Die größte Herausforderung bei der Erstellung langer Audioinhalte ist die Konsistenz – sicherzustellen, dass eine Figur in der ersten Minute genauso klingt wie in der zehnten. Das Doubao Audio Generation Model 1.0 integriert die Text-zu-Audio-Umwandlung tiefgreifend mit Referenzaudio und gewährleistet so eine gleichbleibende Stimmqualität über lange Abschnitte hinweg, sodass Kreative nicht jeden Teil einzeln vergleichen und überarbeiten müssen. Das aktuelle Modell unterstützt bis zu 2 Minuten Audio pro Generierung und bewahrt dank der Erweiterungsfunktion die Stimmkonsistenz auch bei längeren Ausgaben, was sich besonders für Hörbücher, Podcasts und lange Serien eignet.
Zudem ermöglicht das Modell eine entkoppelte Steuerung von Stimme und Stil, sodass sich dieselbe Stimme an verschiedene Emotionen und Kontexte anpassen lässt – sogar so, dass eine einzige Stimme mehrere Rollen mit unterschiedlichen Ausdrucksweisen darstellen kann. Dies erhöht die Flexibilität bei der Sprachausgabe von Charakteren und der kreativen Audioproduktion erheblich. Derzeit hat Volc Ark den API-Testbetrieb eröffnet, und einzelne Nutzer können im Experience Center ein Erstellungskontingent von 30 Minuten erhalten. Das Doubao Audio Generation Model 1.0 wird außerdem in Produkten wie CapCut, Jiemod und Tomato eingeführt.
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek











