알리바바 통이, '프리스타일' 자연어 제어 기능 탑재 음성 모델 공개
오늘 알리바바 통이 연구소 음성 팀은 두 가지 혁신적인 음성 생성 모델인 Fun-CosyVoice3.5와 Fun-AudioGen-VD를 공개했습니다. 이 모델들의 가장 큰 특징은 '자유형(FreeStyle)' 명령어 지원입니다. 복잡한 매개변수 조정 대신, 사용자는 간단한 자연어 설명만으로 보컬 표현 스타일을 정밀하게 제어하거나 복잡한 오디오 장면을 처음부터 구축할 수 있습니다.

각 모델은 다음과 같은 고유한 목적을 수행합니다:
Fun-CosyVoice3.5: 다국어 복제 및 정밀 제어
CosyVoice의 향상된 버전으로 음성 표현의 미묘한 차이를 이해하는 데 핵심적인 돌파구를 마련했습니다.
명령 기반 생성: "더 자신 있게 말하기" 또는 "감정 변화를 주며 속도를 늦추기"와 같은 지시를 입력하여 실시간 음성 조정 가능
언어 확장: 태국어, 인도네시아어, 포르투갈어, 베트남어 지원이 추가되어 13개 언어에서 업계 최고의 음성 인식 정확도(WER) 및 음성 유사성 성능을 유지합니다.
희귀 문자 최적화: 특수 훈련을 통해 비표준 문자 오류율을 15.2%에서 5.3%로 감소시켰습니다.
성능 향상: 첫 패킷 지연 시간이 35% 감소하여 실시간 상호작용의 유동성이 크게 향상되었습니다.
Fun-AudioGen-VD: 종합 사운드 디자인
이 모델은 "오디오 디렉터" 역할을 수행하며 "캐릭터 + 환경"을 결합한 통합 오디오를 생성합니다.
음성 커스터마이징: 성별, 연령, 억양 및 "쉰 목소리, 깊은 목소리, 낮은 음조"와 같은 세부 특성을 지정할 수 있습니다.
감정 및 역할 연기: 고객 서비스 상담원, 방송인, 어린이 등의 역할을 시뮬레이션하며, "겉으로는 차분하지만 내면은 긴장된" 것과 같은 복잡한 상태도 전달합니다.
몰입형 환경: 배경음(전장의 혼란, 카페의 속삭임)과 공간 효과(대성당의 잔향, 수중 음향)를 추가하여 완전한 공간 시뮬레이션을 구현합니다.
통이 랩은 이 모델들이 고품질 음성 제작을 대중화하여 팟캐스팅, 게임 개발, 영화 후반 작업에 강력한 AI 지원을 제공할 것이라고 밝혔습니다.
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (0)
0/500
오늘 알리바바 통이 연구소 음성 팀은 두 가지 혁신적인 음성 생성 모델인 Fun-CosyVoice3.5와 Fun-AudioGen-VD를 공개했습니다. 이 모델들의 가장 큰 특징은 '자유형(FreeStyle)' 명령어 지원입니다. 복잡한 매개변수 조정 대신, 사용자는 간단한 자연어 설명만으로 보컬 표현 스타일을 정밀하게 제어하거나 복잡한 오디오 장면을 처음부터 구축할 수 있습니다.

각 모델은 다음과 같은 고유한 목적을 수행합니다:
Fun-CosyVoice3.5: 다국어 복제 및 정밀 제어
CosyVoice의 향상된 버전으로 음성 표현의 미묘한 차이를 이해하는 데 핵심적인 돌파구를 마련했습니다.
명령 기반 생성: "더 자신 있게 말하기" 또는 "감정 변화를 주며 속도를 늦추기"와 같은 지시를 입력하여 실시간 음성 조정 가능
언어 확장: 태국어, 인도네시아어, 포르투갈어, 베트남어 지원이 추가되어 13개 언어에서 업계 최고의 음성 인식 정확도(WER) 및 음성 유사성 성능을 유지합니다.
희귀 문자 최적화: 특수 훈련을 통해 비표준 문자 오류율을 15.2%에서 5.3%로 감소시켰습니다.
성능 향상: 첫 패킷 지연 시간이 35% 감소하여 실시간 상호작용의 유동성이 크게 향상되었습니다.
Fun-AudioGen-VD: 종합 사운드 디자인
이 모델은 "오디오 디렉터" 역할을 수행하며 "캐릭터 + 환경"을 결합한 통합 오디오를 생성합니다.
음성 커스터마이징: 성별, 연령, 억양 및 "쉰 목소리, 깊은 목소리, 낮은 음조"와 같은 세부 특성을 지정할 수 있습니다.
감정 및 역할 연기: 고객 서비스 상담원, 방송인, 어린이 등의 역할을 시뮬레이션하며, "겉으로는 차분하지만 내면은 긴장된" 것과 같은 복잡한 상태도 전달합니다.
몰입형 환경: 배경음(전장의 혼란, 카페의 속삭임)과 공간 효과(대성당의 잔향, 수중 음향)를 추가하여 완전한 공간 시뮬레이션을 구현합니다.
통이 랩은 이 모델들이 고품질 음성 제작을 대중화하여 팟캐스팅, 게임 개발, 영화 후반 작업에 강력한 AI 지원을 제공할 것이라고 밝혔습니다.
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






