Hogar
Volcano Engine lanza el modelo 1.0 de Doubao Audio: audio cinematográfico en una sola frase y voces de personajes coherentes durante 10 minutos
Ayer, Volc Engine lanzó oficialmente el modelo de generación de audio Doubao 1.0 (Doubao-Seed-Audio 1.0), que admite entradas de texto o audio para producir obras de audio completas de principio a fin. Su principal avance es que una sola indicación puede gestionar a la vez diálogos, efectos de sonido y música de fondo, lo que elimina la necesidad de realizar una edición manual multipista.

Convierte una frase en un director de audio: no hace falta postproducción.
Anteriormente, crear audio de alta calidad requería generar diálogos, efectos de sonido y música por separado, para luego alinear y mezclar las pistas manualmente —un proceso complejo que dependía de la experiencia en posproducción—. El modelo de generación de audio Doubao 1.0 consolida todo esto en una única indicación: los usuarios pueden definir las líneas de diálogo, el tono y el ritmo emocional de varios personajes en una sola instrucción, incorporar detalles como risas, suspiros, pausas y acentos dialectales, y generar música de fondo y efectos de sonido ambientales simultáneamente, obteniendo directamente un producto terminado. Un creador puede escribir una descripción y recibir de inmediato un podcast, un audiolibro o un audio de marca listo para su publicación.
Voces de los personajes coherentes a lo largo de audios largos sin perder calidad.
El mayor reto en la creación de audios largos es la coherencia: garantizar que un personaje suene igual en el minuto uno y en el minuto diez. El Modelo 1.0 de Doubao Audio Generation integra profundamente la conversión de texto a audio con el audio de referencia, manteniendo una calidad de voz constante a lo largo de segmentos largos, de modo que los creadores no tengan que comparar y revisar cada parte. El modelo actual admite hasta 2 minutos de audio por generación y, gracias a la función de extensión, conserva la coherencia de la voz en grabaciones más largas, lo que lo hace ideal para audiolibros, podcasts y series largas.
Además, el modelo ofrece un control independiente de la voz y el estilo, lo que permite que una misma voz se adapte a diversas emociones y contextos, llegando incluso a permitir que una sola voz interprete múltiples papeles con expresiones diferentes. Esto mejora enormemente la flexibilidad para la interpretación de voces de personajes y la producción creativa de audio. Actualmente, Volc Ark ha abierto las pruebas de la API, y los usuarios particulares pueden obtener una cuota de creación de 30 minutos en el Experience Center. El modelo de generación de audio Doubao 1.0 también se lanzará en productos como CapCut, Jiemod y Tomato.
Artículo relacionado
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Ayer, Volc Engine lanzó oficialmente el modelo de generación de audio Doubao 1.0 (Doubao-Seed-Audio 1.0), que admite entradas de texto o audio para producir obras de audio completas de principio a fin. Su principal avance es que una sola indicación puede gestionar a la vez diálogos, efectos de sonido y música de fondo, lo que elimina la necesidad de realizar una edición manual multipista.

Convierte una frase en un director de audio: no hace falta postproducción.
Anteriormente, crear audio de alta calidad requería generar diálogos, efectos de sonido y música por separado, para luego alinear y mezclar las pistas manualmente —un proceso complejo que dependía de la experiencia en posproducción—. El modelo de generación de audio Doubao 1.0 consolida todo esto en una única indicación: los usuarios pueden definir las líneas de diálogo, el tono y el ritmo emocional de varios personajes en una sola instrucción, incorporar detalles como risas, suspiros, pausas y acentos dialectales, y generar música de fondo y efectos de sonido ambientales simultáneamente, obteniendo directamente un producto terminado. Un creador puede escribir una descripción y recibir de inmediato un podcast, un audiolibro o un audio de marca listo para su publicación.
Voces de los personajes coherentes a lo largo de audios largos sin perder calidad.
El mayor reto en la creación de audios largos es la coherencia: garantizar que un personaje suene igual en el minuto uno y en el minuto diez. El Modelo 1.0 de Doubao Audio Generation integra profundamente la conversión de texto a audio con el audio de referencia, manteniendo una calidad de voz constante a lo largo de segmentos largos, de modo que los creadores no tengan que comparar y revisar cada parte. El modelo actual admite hasta 2 minutos de audio por generación y, gracias a la función de extensión, conserva la coherencia de la voz en grabaciones más largas, lo que lo hace ideal para audiolibros, podcasts y series largas.
Además, el modelo ofrece un control independiente de la voz y el estilo, lo que permite que una misma voz se adapte a diversas emociones y contextos, llegando incluso a permitir que una sola voz interprete múltiples papeles con expresiones diferentes. Esto mejora enormemente la flexibilidad para la interpretación de voces de personajes y la producción creativa de audio. Actualmente, Volc Ark ha abierto las pruebas de la API, y los usuarios particulares pueden obtener una cuota de creación de 30 minutos en el Experience Center. El modelo de generación de audio Doubao 1.0 también se lanzará en productos como CapCut, Jiemod y Tomato.
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











