Lar
A Volcano Engine lança o Doubao Audio Modelo 1.0: áudio cinematográfico em uma única frase e vozes consistentes para personagens por 10 minutos
Ontem, a Volc Engine lançou oficialmente o Modelo de Geração de Áudio Doubao 1.0 (Doubao-Seed-Audio 1.0), que aceita entradas de texto ou áudio para produzir obras de áudio completas de ponta a ponta. Sua principal inovação é que um único comando pode lidar com diálogos, efeitos sonoros e música de fundo ao mesmo tempo, eliminando a necessidade de edição manual em múltiplas faixas.

Transforme uma frase em um diretor de áudio — sem necessidade de pós-produção.
Anteriormente, criar áudio de alta qualidade exigia gerar diálogos, efeitos sonoros e música separadamente, para depois alinhar e mixar as faixas manualmente — um processo complexo que dependia de conhecimento especializado em pós-produção. O Modelo de Geração de Áudio Doubao 1.0 consolida tudo isso em um único comando: os usuários podem definir as falas, o tom e o ritmo emocional de vários personagens em uma única instrução, incorporar detalhes como risadas, suspiros, pausas e sotaques dialetais, além de gerar música de fundo e efeitos sonoros ambientais simultaneamente, produzindo um produto finalizado diretamente. Um criador pode digitar uma descrição e receber imediatamente um podcast, audiolivro ou áudio de marca pronto para lançamento.
Vozes de personagens consistentes ao longo de áudios longos, sem perda de qualidade.
O maior desafio na criação de áudios longos é a consistência — garantir que um personagem soe da mesma forma no primeiro minuto e no décimo minuto. O Doubao Audio Generation Model 1.0 integra profundamente a conversão de texto em áudio com o áudio de referência, mantendo a qualidade consistente da voz em segmentos longos, para que os criadores não precisem comparar e revisar cada parte. O modelo atual suporta até 2 minutos de áudio por geração e, com o recurso de extensão, preserva a consistência da voz para produções mais longas, sendo adequado para audiolivros, podcasts e séries longas.
Além disso, o modelo oferece controle independente de voz e estilo, permitindo que a mesma voz se adapte a várias emoções e contextos — possibilitando até mesmo que uma única voz interprete vários papéis com expressões diferentes. Isso aumenta significativamente a flexibilidade para a dublagem de personagens e a produção criativa de áudio. Atualmente, o Volc Ark iniciou os testes da API, e usuários individuais podem obter uma cota de 30 minutos para criação no Experience Center. O Doubao Audio Generation Model 1.0 também será lançado em produtos como CapCut, Jiemod e Tomato.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (1)
Ontem, a Volc Engine lançou oficialmente o Modelo de Geração de Áudio Doubao 1.0 (Doubao-Seed-Audio 1.0), que aceita entradas de texto ou áudio para produzir obras de áudio completas de ponta a ponta. Sua principal inovação é que um único comando pode lidar com diálogos, efeitos sonoros e música de fundo ao mesmo tempo, eliminando a necessidade de edição manual em múltiplas faixas.

Transforme uma frase em um diretor de áudio — sem necessidade de pós-produção.
Anteriormente, criar áudio de alta qualidade exigia gerar diálogos, efeitos sonoros e música separadamente, para depois alinhar e mixar as faixas manualmente — um processo complexo que dependia de conhecimento especializado em pós-produção. O Modelo de Geração de Áudio Doubao 1.0 consolida tudo isso em um único comando: os usuários podem definir as falas, o tom e o ritmo emocional de vários personagens em uma única instrução, incorporar detalhes como risadas, suspiros, pausas e sotaques dialetais, além de gerar música de fundo e efeitos sonoros ambientais simultaneamente, produzindo um produto finalizado diretamente. Um criador pode digitar uma descrição e receber imediatamente um podcast, audiolivro ou áudio de marca pronto para lançamento.
Vozes de personagens consistentes ao longo de áudios longos, sem perda de qualidade.
O maior desafio na criação de áudios longos é a consistência — garantir que um personagem soe da mesma forma no primeiro minuto e no décimo minuto. O Doubao Audio Generation Model 1.0 integra profundamente a conversão de texto em áudio com o áudio de referência, mantendo a qualidade consistente da voz em segmentos longos, para que os criadores não precisem comparar e revisar cada parte. O modelo atual suporta até 2 minutos de áudio por geração e, com o recurso de extensão, preserva a consistência da voz para produções mais longas, sendo adequado para audiolivros, podcasts e séries longas.
Além disso, o modelo oferece controle independente de voz e estilo, permitindo que a mesma voz se adapte a várias emoções e contextos — possibilitando até mesmo que uma única voz interprete vários papéis com expressões diferentes. Isso aumenta significativamente a flexibilidade para a dublagem de personagens e a produção criativa de áudio. Atualmente, o Volc Ark iniciou os testes da API, e usuários individuais podem obter uma cota de 30 minutos para criação no Experience Center. O Doubao Audio Generation Model 1.0 também será lançado em produtos como CapCut, Jiemod e Tomato.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











