볼케이노 엔진, ‘두바오 오디오 모델 1.0’ 출시: 한 문장으로 완성되는 영화 같은 오디오, 10분 분량의 일관된 캐릭터 목소리
어제, Volc Engine은 텍스트나 오디오 입력을 받아 엔드투엔드 방식으로 완성된 오디오 작품을 생성하는 ‘Doubao 오디오 생성 모델 1.0(Doubao-Seed-Audio 1.0)’을 공식 출시했습니다. 이 모델의 핵심적인 혁신은 단 하나의 프롬프트만으로 대사, 음향 효과, 배경 음악을 동시에 처리할 수 있어 수동으로 멀티트랙 편집을 할 필요가 없다는 점입니다.

한 문장으로 오디오 감독이 되어보세요. 후반 작업이 필요 없습니다.
이전에는 고품질 오디오를 제작하려면 대사, 음향 효과, 음악을 별도로 생성한 다음 수동으로 트랙을 정렬하고 믹싱해야 했으며, 이는 후반 작업 전문 지식에 의존하는 복잡한 과정이었습니다. Doubao 오디오 생성 모델 1.0은 이 모든 과정을 하나의 프롬프트로 통합합니다. 사용자는 하나의 지시어로 여러 등장인물의 대사, 어조, 감정적 리듬을 정의하고, 웃음, 한숨, 멈춤, 방언 억양과 같은 세부 사항을 포함시킬 수 있으며, 배경 음악과 주변 음향 효과를 동시에 생성하여 완성된 결과물을 바로 출력할 수 있습니다. 제작자는 설명을 입력하기만 하면 즉시 공개 가능한 팟캐스트, 오디오북 또는 브랜드 오디오를 받을 수 있습니다.
긴 오디오 전반에 걸쳐 품질 저하 없이 일관된 캐릭터 목소리를 구현합니다.
긴 오디오 제작에서 가장 큰 과제는 일관성, 즉 1분 지점과 10분 지점에서 캐릭터의 목소리가 동일하게 들리도록 하는 것입니다. Doubao 오디오 생성 모델 1.0은 텍스트-오디오 변환 기능을 참조 오디오와 깊이 통합하여 긴 구간 전반에 걸쳐 일관된 음질을 유지하므로, 제작자는 각 부분을 비교하고 수정할 필요가 없습니다. 현재 모델은 생성당 최대 2분 길이의 오디오를 지원하며, 확장 기능을 통해 더 긴 출력물에서도 목소리의 일관성을 유지하므로 오디오북, 팟캐스트 및 장편 시리즈에 적합합니다.
또한, 이 모델은 목소리와 스타일을 분리하여 제어할 수 있어, 동일한 목소리가 다양한 감정과 맥락에 적응할 수 있으며, 심지어 하나의 목소리로 서로 다른 표현을 가진 여러 역할을 연기할 수도 있습니다. 이는 캐릭터 성우 연기와 창의적인 오디오 제작의 유연성을 크게 높여줍니다. 현재 Volc Ark는 API 테스트를 시작했으며, 개인 사용자는 Experience Center에서 30분의 생성 할당량을 받을 수 있습니다. 또한 Doubao 오디오 생성 모델 1.0은 CapCut, Jiemod, Tomato와 같은 제품에도 출시될 예정입니다.
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (1)
0/500
어제, Volc Engine은 텍스트나 오디오 입력을 받아 엔드투엔드 방식으로 완성된 오디오 작품을 생성하는 ‘Doubao 오디오 생성 모델 1.0(Doubao-Seed-Audio 1.0)’을 공식 출시했습니다. 이 모델의 핵심적인 혁신은 단 하나의 프롬프트만으로 대사, 음향 효과, 배경 음악을 동시에 처리할 수 있어 수동으로 멀티트랙 편집을 할 필요가 없다는 점입니다.

한 문장으로 오디오 감독이 되어보세요. 후반 작업이 필요 없습니다.
이전에는 고품질 오디오를 제작하려면 대사, 음향 효과, 음악을 별도로 생성한 다음 수동으로 트랙을 정렬하고 믹싱해야 했으며, 이는 후반 작업 전문 지식에 의존하는 복잡한 과정이었습니다. Doubao 오디오 생성 모델 1.0은 이 모든 과정을 하나의 프롬프트로 통합합니다. 사용자는 하나의 지시어로 여러 등장인물의 대사, 어조, 감정적 리듬을 정의하고, 웃음, 한숨, 멈춤, 방언 억양과 같은 세부 사항을 포함시킬 수 있으며, 배경 음악과 주변 음향 효과를 동시에 생성하여 완성된 결과물을 바로 출력할 수 있습니다. 제작자는 설명을 입력하기만 하면 즉시 공개 가능한 팟캐스트, 오디오북 또는 브랜드 오디오를 받을 수 있습니다.
긴 오디오 전반에 걸쳐 품질 저하 없이 일관된 캐릭터 목소리를 구현합니다.
긴 오디오 제작에서 가장 큰 과제는 일관성, 즉 1분 지점과 10분 지점에서 캐릭터의 목소리가 동일하게 들리도록 하는 것입니다. Doubao 오디오 생성 모델 1.0은 텍스트-오디오 변환 기능을 참조 오디오와 깊이 통합하여 긴 구간 전반에 걸쳐 일관된 음질을 유지하므로, 제작자는 각 부분을 비교하고 수정할 필요가 없습니다. 현재 모델은 생성당 최대 2분 길이의 오디오를 지원하며, 확장 기능을 통해 더 긴 출력물에서도 목소리의 일관성을 유지하므로 오디오북, 팟캐스트 및 장편 시리즈에 적합합니다.
또한, 이 모델은 목소리와 스타일을 분리하여 제어할 수 있어, 동일한 목소리가 다양한 감정과 맥락에 적응할 수 있으며, 심지어 하나의 목소리로 서로 다른 표현을 가진 여러 역할을 연기할 수도 있습니다. 이는 캐릭터 성우 연기와 창의적인 오디오 제작의 유연성을 크게 높여줍니다. 현재 Volc Ark는 API 테스트를 시작했으며, 개인 사용자는 Experience Center에서 30분의 생성 할당량을 받을 수 있습니다. 또한 Doubao 오디오 생성 모델 1.0은 CapCut, Jiemod, Tomato와 같은 제품에도 출시될 예정입니다.
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






