‘Tongyi Qianwen Qwen-Audio-3.0-TTS’가 첫 패킷 지연 시간 300ms, 20개 방언 지원으로 정식 출시되었습니다.
알리바바 Qwen 팀은 새로운 실시간 음성 합성 모델인 ‘Qwen-Audio-3.0-TTS’를 출시하며, 음성 합성을 단순한 생성 단계에서 진정한 표현의 단계로 끌어올렸습니다. Plus 버전은 Artificial Analysis가 선정한 권위 있는 벤치마크인 Speech Arena에서 전 세계 1위를 차지하며, Gemini 3.1 TTS, ElevenLabs v3 및 기타 주요 모델들을 제쳤습니다.

두 가지 버전이 제공됩니다. ‘플래시(Flash)’ 버전은 초기 지연 시간이 약 300ms로 실시간 상호작용을 목표로 하며, 스마트 어시스턴트 및 기타 저지연 사용 사례에 이상적입니다. ‘플러스(Plus)’ 버전은 고품질 생성을 우선시하여 향상된 자연스러움과 음성 유사성을 제공합니다.
핵심 기능에서 달성한 네 가지 주요 혁신:
첫째, 다국어 및 방언 지원이 16개 언어로 확대되었으며, 플러스 버전은 16개 언어 전체에서 평균 82.75%의 화자 유사도를 달성해 업계 최고 수준을 기록했습니다. 또한 20개의 중국 방언을 지원하며, 방언의 특성을 약화시키지 않고 그대로 유지함으로써 더욱 원어민 같은 표현을 구현합니다.
둘째, 유연한 자연어 지시 기능을 통해 사용자는 전문적인 주석이 없어도 “친절한 고객 서비스 어조”나 “라이브 스트리밍 진행자 스타일”과 같은 프롬프트만으로 정확한 음성을 생성할 수 있습니다.
셋째, 세밀한 태그 제어 기능을 통해 [gasp] 및 [angry]와 같은 구조화된 태그를 지원하여, 호흡이나 웃음과 같은 비언어적 세부 사항을 정밀하게 관리할 수 있어 게임, 오디오북 및 이와 유사한 시나리오에 적합합니다.
넷째, 뛰어난 음향적 견고성: 참조 오디오에 높은 수준의 잡음이나 잔향이 포함되어 있더라도, 모델은 음성 품질을 유지하면서 배경 잡음을 자동으로 걸러내어 안정적인 합성 출력을 보장합니다.
함께 제공되는 프리미엄 음성 라이브러리에는 지시어, 방언, 덜 사용되는 언어 등 다양한 음성 유형이 포함되어 있으며, 48K 고해상도 오디오 출력을 지원하고(7월 24일 공개 예정), 세션당 최대 3분 길이의 긴 텍스트를 합성할 수 있습니다. 이 모델은 현재 알리바바 클라우드 바이리안(BaiLian) 플랫폼에서 완전히 이용 가능하며, 개발자들은 이곳에서 모델에 접근하여 직접 체험해 볼 수 있어 음성 상호작용의 새로운 가능성을 열어줍니다.

관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (0)
0/500
알리바바 Qwen 팀은 새로운 실시간 음성 합성 모델인 ‘Qwen-Audio-3.0-TTS’를 출시하며, 음성 합성을 단순한 생성 단계에서 진정한 표현의 단계로 끌어올렸습니다. Plus 버전은 Artificial Analysis가 선정한 권위 있는 벤치마크인 Speech Arena에서 전 세계 1위를 차지하며, Gemini 3.1 TTS, ElevenLabs v3 및 기타 주요 모델들을 제쳤습니다.

두 가지 버전이 제공됩니다. ‘플래시(Flash)’ 버전은 초기 지연 시간이 약 300ms로 실시간 상호작용을 목표로 하며, 스마트 어시스턴트 및 기타 저지연 사용 사례에 이상적입니다. ‘플러스(Plus)’ 버전은 고품질 생성을 우선시하여 향상된 자연스러움과 음성 유사성을 제공합니다.
핵심 기능에서 달성한 네 가지 주요 혁신:
첫째, 다국어 및 방언 지원이 16개 언어로 확대되었으며, 플러스 버전은 16개 언어 전체에서 평균 82.75%의 화자 유사도를 달성해 업계 최고 수준을 기록했습니다. 또한 20개의 중국 방언을 지원하며, 방언의 특성을 약화시키지 않고 그대로 유지함으로써 더욱 원어민 같은 표현을 구현합니다.
둘째, 유연한 자연어 지시 기능을 통해 사용자는 전문적인 주석이 없어도 “친절한 고객 서비스 어조”나 “라이브 스트리밍 진행자 스타일”과 같은 프롬프트만으로 정확한 음성을 생성할 수 있습니다.
셋째, 세밀한 태그 제어 기능을 통해 [gasp] 및 [angry]와 같은 구조화된 태그를 지원하여, 호흡이나 웃음과 같은 비언어적 세부 사항을 정밀하게 관리할 수 있어 게임, 오디오북 및 이와 유사한 시나리오에 적합합니다.
넷째, 뛰어난 음향적 견고성: 참조 오디오에 높은 수준의 잡음이나 잔향이 포함되어 있더라도, 모델은 음성 품질을 유지하면서 배경 잡음을 자동으로 걸러내어 안정적인 합성 출력을 보장합니다.
함께 제공되는 프리미엄 음성 라이브러리에는 지시어, 방언, 덜 사용되는 언어 등 다양한 음성 유형이 포함되어 있으며, 48K 고해상도 오디오 출력을 지원하고(7월 24일 공개 예정), 세션당 최대 3분 길이의 긴 텍스트를 합성할 수 있습니다. 이 모델은 현재 알리바바 클라우드 바이리안(BaiLian) 플랫폼에서 완전히 이용 가능하며, 개발자들은 이곳에서 모델에 접근하여 직접 체험해 볼 수 있어 음성 상호작용의 새로운 가능성을 열어줍니다.

미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






