Hogar
ByteDance presenta Seed Audio 1.0, una herramienta que revoluciona la creación de contenido de audio gracias a su nueva función de conversión de voz a texto
Recientemente, ByteDance ha presentado Seed Audio 1.0, su nuevo modelo de creación de audio, lo que supone un avance significativo en la generación de audio mediante IA. Esta actualización lleva la tecnología más allá de la síntesis de voz básica para permitir la creación de escenas sonoras totalmente integradas. El modelo ya está disponible para que los creadores lo prueben en el Centro de Experiencias Volcano de Fangzhou.
Tradicionalmente, producir contenidos de audio a la altura de los utilizados en el cine y la televisión requería múltiples modelos independientes para generar voces, efectos de sonido y ruidos ambientales, que luego se combinaban manualmente. Este enfoque requería mucho tiempo y dificultaba mantener una narrativa coherente a lo largo de todo el audio. Seed Audio 1.0 resuelve este problema integrando todos los elementos de audio en un único marco, en lugar de limitarse a combinar materiales prefabricados, lo que le permite producir obras sonoras completas que respaldan una narración de principio a fin.

Según la información oficial, Seed Audio 1.0 cuenta con tres capacidades clave. En primer lugar, ofrece un control temporal y espacial preciso, lo que permite a los creadores establecer la sincronización exacta de los diálogos y los efectos de sonido con una precisión de hasta 100 milisegundos, algo ideal para el doblaje de vídeos y la producción publicitaria. En segundo lugar, ofrece un rendimiento vocal estable, admitiendo la generación «zero-shot» y una salida de audio ampliada, al tiempo que conserva las características vocales del personaje. También puede transmitir de forma natural una amplia gama de emociones, como la ira o la alegría, e incluso permite que una sola voz represente a varios personajes. En tercer lugar, ofrece un sólido soporte multilingüe para más de 20 idiomas, entre ellos el chino, el inglés y el japonés, lo que garantiza que la voz suene natural y se adapte a los patrones lingüísticos locales de cada idioma.
Los resultados de la evaluación muestran que el modelo ofrece un buen rendimiento en nueve escenarios creativos habituales, con una disponibilidad de audio superior al 90 %. Además, su puntuación MOS de naturalidad para la generación multilingüe suele situarse por encima de los 4 puntos, lo que se considera una calificación excelente.

Al evolucionar de una herramienta que solo puede generar voz a otra capaz de crear contenido de audio completo, Seed Audio 1.0 reduce las barreras para producir material de audio de alta calidad. El equipo de desarrollo tiene previsto mejorar aún más el modelo incorporando entradas multimodales, como referencias de vídeo, y explorando funciones de traducción controlables. También pretenden seguir mejorando las capacidades de generación de audio largo y de pistas, ayudando a los creadores a convertir sus ideas sonoras conceptuales en obras de audio plenamente funcionales de forma más eficiente.
Página web del proyecto:
https://seed.bytedance.com/seedaudio1_0
Acceso a la experiencia:
Centro de experiencias Volcano Fangzhou - Iniciar sesión - Seleccionar modelo de voz - Síntesis de voz - Doubao - Generación de audio - 1.0
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Recientemente, ByteDance ha presentado Seed Audio 1.0, su nuevo modelo de creación de audio, lo que supone un avance significativo en la generación de audio mediante IA. Esta actualización lleva la tecnología más allá de la síntesis de voz básica para permitir la creación de escenas sonoras totalmente integradas. El modelo ya está disponible para que los creadores lo prueben en el Centro de Experiencias Volcano de Fangzhou.
Tradicionalmente, producir contenidos de audio a la altura de los utilizados en el cine y la televisión requería múltiples modelos independientes para generar voces, efectos de sonido y ruidos ambientales, que luego se combinaban manualmente. Este enfoque requería mucho tiempo y dificultaba mantener una narrativa coherente a lo largo de todo el audio. Seed Audio 1.0 resuelve este problema integrando todos los elementos de audio en un único marco, en lugar de limitarse a combinar materiales prefabricados, lo que le permite producir obras sonoras completas que respaldan una narración de principio a fin.

Según la información oficial, Seed Audio 1.0 cuenta con tres capacidades clave. En primer lugar, ofrece un control temporal y espacial preciso, lo que permite a los creadores establecer la sincronización exacta de los diálogos y los efectos de sonido con una precisión de hasta 100 milisegundos, algo ideal para el doblaje de vídeos y la producción publicitaria. En segundo lugar, ofrece un rendimiento vocal estable, admitiendo la generación «zero-shot» y una salida de audio ampliada, al tiempo que conserva las características vocales del personaje. También puede transmitir de forma natural una amplia gama de emociones, como la ira o la alegría, e incluso permite que una sola voz represente a varios personajes. En tercer lugar, ofrece un sólido soporte multilingüe para más de 20 idiomas, entre ellos el chino, el inglés y el japonés, lo que garantiza que la voz suene natural y se adapte a los patrones lingüísticos locales de cada idioma.
Los resultados de la evaluación muestran que el modelo ofrece un buen rendimiento en nueve escenarios creativos habituales, con una disponibilidad de audio superior al 90 %. Además, su puntuación MOS de naturalidad para la generación multilingüe suele situarse por encima de los 4 puntos, lo que se considera una calificación excelente.

Al evolucionar de una herramienta que solo puede generar voz a otra capaz de crear contenido de audio completo, Seed Audio 1.0 reduce las barreras para producir material de audio de alta calidad. El equipo de desarrollo tiene previsto mejorar aún más el modelo incorporando entradas multimodales, como referencias de vídeo, y explorando funciones de traducción controlables. También pretenden seguir mejorando las capacidades de generación de audio largo y de pistas, ayudando a los creadores a convertir sus ideas sonoras conceptuales en obras de audio plenamente funcionales de forma más eficiente.
Página web del proyecto:
https://seed.bytedance.com/seedaudio1_0
Acceso a la experiencia:
Centro de experiencias Volcano Fangzhou - Iniciar sesión - Seleccionar modelo de voz - Síntesis de voz - Doubao - Generación de audio - 1.0
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











