메이투안의 오픈소스 오디오 모델, 음성 복제 분야의 새로운 기준을 제시하다
오디오 생성 분야는 다단계 캐스케이드 아키텍처에서 엔드투엔드 모델로 근본적인 변화를 겪고 있습니다. TTS 시스템에서 사용되는 기존의 "멜 스펙트로그램" 중간 표현 방식에 내재된 정보 손실과 오류 누적을 극복하기 위해, 메이투안 LongCat 팀은 LongCat-AudioDiT(10억 및 35억 파라미터 버전 제공)를 공식 출시하고 오픈소스로 공개했습니다. 이 모델은 직접적인 파형 잠재 공간 모델링을 수행함으로써 제로샷 음성 복제 분야의 기존 성능 한계를 성공적으로 뛰어넘었습니다.

핵심 아키텍처: 멜 스펙트로그램을 넘어
LongCat-AudioDiT는 기존의 "음향 특징 예측 + 신경 보코더" 다단계 파이프라인을 배제하고, 대신 Wav-VAE(파형 변분 자동 인코더)와 DiT(확산 트랜스포머)를 기반으로 한 간소화된 최소 아키텍처를 구축합니다.
효율적인 Wav-VAE: 완전 컨볼루션 설계를 활용하여 24kHz 파형을 2000배 압축하여 11.7Hz 프레임 레이트로 변환합니다. 비모수적 쇼트컷 분기 및 다중 목표 적대적 훈련을 통해 재구성된 파형이 정밀한 시공간 구조를 유지하면서 탁월한 자연스러운 청취 품질을 제공하도록 보장합니다.
의미 강화형 DiT: 이 모델은 UMT5 텍스트 인코더의 원본 단어 임베딩을 상위 레벨 숨겨진 상태와 혁신적으로 융합합니다. 이를 통해 상위 레벨 의미 표현에서 손실된 음성학적 세부 정보를 보완하여, 생성된 음성의 명료도를 크게 향상시킵니다.
추론 최적화: 음성 드리프트의 정밀한 보정
생성 품질을 더욱 향상시키기 위해 연구팀은 두 가지 핵심적인 기술적 개선 사항을 구현했습니다:
이중 제약 메커니즘: 이 기술은 플로우 매칭 TTS에서 지속적으로 발생하는 "훈련-추론 불일치" 문제를 식별하고 교정합니다. 추론 단계에서 프롬프트 영역의 잠재 변수를 강제 초기화함으로써, 화자의 음성 드리프트 및 불안정성 문제를 완전히 해결합니다.
적응형 투영 가이드(APG): APG는 기존의 분류기 없는 가이드(CFG)를 대체합니다. 이는 가이드 신호 내에서 유익한 구성 요소를 정확하게 필터링하는 동시에 음질 저하를 유발하는 구성 요소를 억제하여, 스펙트럼 "과포화"를 유발하지 않으면서도 음성 자연도를 크게 향상시킵니다.
성능: 최첨단 수준의 복제 정확도
Seed 데이터셋에 대한 벤치마크 테스트에서 LongCat-AudioDiT는 압도적인 성능을 보여주었습니다:
유사도(SIM): 35억 파라미터 모델은 Seed-ZH 테스트 세트에서 0.818, 난이도가 높은 Seed-Hard 문장 세트에서 0.797의 점수를 기록하며, Seed-TTS, CosyVoice3.5, MiniMax-Speech와 같은 주요 모델들을 능가했습니다.
정확도: 영어 WER 1.50%, 중국어 난이도 높은 문장 CER 6.04%를 포함하여 주요 지표 전반에서 업계 최고 수준의 성능을 기록했습니다.
특히 LongCat-AudioDiT는 전처리된 ASR 전사 데이터에 대해 단일 단계 훈련만을 수행했음에도 불구하고, 다단계 훈련을 거친 모델들에 비해 우수한 결과를 달성했습니다. 관련 연구 논문, 소스 코드 및 모델 가중치는 현재 GitHub와 HuggingFace에서 완전히 오픈소스로 공개되어 있습니다.
프로젝트 링크:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
관련 기사
Slackbot이 AI 에이전트가 됩니다
Salesforce의 기업용 메시징 플랫폼인 Slack에 내장된 자동 비서 Slackbot이 AI 에이전트로 진화하고 있습니다. Salesforce의 CTO인 Parker Harris는 이것이 OpenAI의 ChatGPT에 버금가는 바이럴 현상을 달성할 것으로 전망합니다.클라우드 소프트웨어 거대 기업인 Salesforce는 화요일 업데이트된 Slackbot을 출시했습니다. Business+ 및 Enterprise+ 고객에게 제공되는 이 새로운
ByteDance, Doubao 14.6% 급증에 핵심 AI 인센티브 강화
ByteDance는 최근 DouBao 지주 설명회를 소집하여 DouBao 부서에 종사하는 직원들을 위한 새로운 인센티브 정책을 공개했다. DouBao 주식의 행사가액은 2026년 6월의 14.85달러에서 17.02달러로 인상되었으며, 이는 약 14.6%의 증가를 의미한다.이번 개정은 DouBao 주식의 가치를 높일 뿐만 아니라 그 분배 범위를 크게 확대한다. 개인의 역할에 따라 일부 직원은 총 보상액의 약 5%에 해당하는 DouBao 주식을
MiniMax, 전 세계 AI 전문가들을 장려하기 위해 10배 팀 프로그램을 공개합니다
MiniMax(시위 테크놀로지)의 범용 인공지능 연구소는 글로벌 인재 협력 프로그램인 '10x 팀'을 공식적으로 출시했습니다. 이 프로그램은 다양한 산업 분야의 최고 전문가들을 모집하여 대형 모델의 전문 수직 분야에 대한 심층적인 응용을 탐구하는 것을 목표로 합니다. 심층적인 산업 지식과 최첨단 AI를 통합함으로써 MiniMax는 대형 모델의 생산성을 일반적인 사용에서 전문적인 시나리오로 확장하여 궁극적으로 산업 효율성의 '10배 증가'를 주도
관련 특별 주제 추천
의견 (1)
0/500
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
오디오 생성 분야는 다단계 캐스케이드 아키텍처에서 엔드투엔드 모델로 근본적인 변화를 겪고 있습니다. TTS 시스템에서 사용되는 기존의 "멜 스펙트로그램" 중간 표현 방식에 내재된 정보 손실과 오류 누적을 극복하기 위해, 메이투안 LongCat 팀은 LongCat-AudioDiT(10억 및 35억 파라미터 버전 제공)를 공식 출시하고 오픈소스로 공개했습니다. 이 모델은 직접적인 파형 잠재 공간 모델링을 수행함으로써 제로샷 음성 복제 분야의 기존 성능 한계를 성공적으로 뛰어넘었습니다.

핵심 아키텍처: 멜 스펙트로그램을 넘어
LongCat-AudioDiT는 기존의 "음향 특징 예측 + 신경 보코더" 다단계 파이프라인을 배제하고, 대신 Wav-VAE(파형 변분 자동 인코더)와 DiT(확산 트랜스포머)를 기반으로 한 간소화된 최소 아키텍처를 구축합니다.
효율적인 Wav-VAE: 완전 컨볼루션 설계를 활용하여 24kHz 파형을 2000배 압축하여 11.7Hz 프레임 레이트로 변환합니다. 비모수적 쇼트컷 분기 및 다중 목표 적대적 훈련을 통해 재구성된 파형이 정밀한 시공간 구조를 유지하면서 탁월한 자연스러운 청취 품질을 제공하도록 보장합니다.
의미 강화형 DiT: 이 모델은 UMT5 텍스트 인코더의 원본 단어 임베딩을 상위 레벨 숨겨진 상태와 혁신적으로 융합합니다. 이를 통해 상위 레벨 의미 표현에서 손실된 음성학적 세부 정보를 보완하여, 생성된 음성의 명료도를 크게 향상시킵니다.
추론 최적화: 음성 드리프트의 정밀한 보정
생성 품질을 더욱 향상시키기 위해 연구팀은 두 가지 핵심적인 기술적 개선 사항을 구현했습니다:
이중 제약 메커니즘: 이 기술은 플로우 매칭 TTS에서 지속적으로 발생하는 "훈련-추론 불일치" 문제를 식별하고 교정합니다. 추론 단계에서 프롬프트 영역의 잠재 변수를 강제 초기화함으로써, 화자의 음성 드리프트 및 불안정성 문제를 완전히 해결합니다.
적응형 투영 가이드(APG): APG는 기존의 분류기 없는 가이드(CFG)를 대체합니다. 이는 가이드 신호 내에서 유익한 구성 요소를 정확하게 필터링하는 동시에 음질 저하를 유발하는 구성 요소를 억제하여, 스펙트럼 "과포화"를 유발하지 않으면서도 음성 자연도를 크게 향상시킵니다.
성능: 최첨단 수준의 복제 정확도
Seed 데이터셋에 대한 벤치마크 테스트에서 LongCat-AudioDiT는 압도적인 성능을 보여주었습니다:
유사도(SIM): 35억 파라미터 모델은 Seed-ZH 테스트 세트에서 0.818, 난이도가 높은 Seed-Hard 문장 세트에서 0.797의 점수를 기록하며, Seed-TTS, CosyVoice3.5, MiniMax-Speech와 같은 주요 모델들을 능가했습니다.
정확도: 영어 WER 1.50%, 중국어 난이도 높은 문장 CER 6.04%를 포함하여 주요 지표 전반에서 업계 최고 수준의 성능을 기록했습니다.
특히 LongCat-AudioDiT는 전처리된 ASR 전사 데이터에 대해 단일 단계 훈련만을 수행했음에도 불구하고, 다단계 훈련을 거친 모델들에 비해 우수한 결과를 달성했습니다. 관련 연구 논문, 소스 코드 및 모델 가중치는 현재 GitHub와 HuggingFace에서 완전히 오픈소스로 공개되어 있습니다.
프로젝트 링크:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Slackbot이 AI 에이전트가 됩니다
Salesforce의 기업용 메시징 플랫폼인 Slack에 내장된 자동 비서 Slackbot이 AI 에이전트로 진화하고 있습니다. Salesforce의 CTO인 Parker Harris는 이것이 OpenAI의 ChatGPT에 버금가는 바이럴 현상을 달성할 것으로 전망합니다.클라우드 소프트웨어 거대 기업인 Salesforce는 화요일 업데이트된 Slackbot을 출시했습니다. Business+ 및 Enterprise+ 고객에게 제공되는 이 새로운
ByteDance, Doubao 14.6% 급증에 핵심 AI 인센티브 강화
ByteDance는 최근 DouBao 지주 설명회를 소집하여 DouBao 부서에 종사하는 직원들을 위한 새로운 인센티브 정책을 공개했다. DouBao 주식의 행사가액은 2026년 6월의 14.85달러에서 17.02달러로 인상되었으며, 이는 약 14.6%의 증가를 의미한다.이번 개정은 DouBao 주식의 가치를 높일 뿐만 아니라 그 분배 범위를 크게 확대한다. 개인의 역할에 따라 일부 직원은 총 보상액의 약 5%에 해당하는 DouBao 주식을
MiniMax, 전 세계 AI 전문가들을 장려하기 위해 10배 팀 프로그램을 공개합니다
MiniMax(시위 테크놀로지)의 범용 인공지능 연구소는 글로벌 인재 협력 프로그램인 '10x 팀'을 공식적으로 출시했습니다. 이 프로그램은 다양한 산업 분야의 최고 전문가들을 모집하여 대형 모델의 전문 수직 분야에 대한 심층적인 응용을 탐구하는 것을 목표로 합니다. 심층적인 산업 지식과 최첨단 AI를 통합함으로써 MiniMax는 대형 모델의 생산성을 일반적인 사용에서 전문적인 시나리오로 확장하여 궁극적으로 산업 효율성의 '10배 증가'를 주도
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅





집






