微软的VibeVoice AI系列开源,支持长达90分钟的对话,GitHub星标数突破2.7万
微软最近开源了一套名为VibeVoice 的尖端语音 AI 模型系列,具备自动语音识别(ASR)和文本转语音(TTS)等功能。 得益于其强大的长音频处理能力、自然的多说话者对话生成以及实时低延迟的性能表现,该项目迅速吸引了开发者社区的关注,目前已在GitHub上收获了约27,000个星标。
VibeVoice作为基于MIT许可证的开源研究框架发布,支持本地部署且无需支付云订阅费用,旨在促进语音合成领域的协作与创新。该模型系列包含三个核心成员,分别针对传统语音AI中的特定挑战,例如长序列处理、说话人一致性以及自然流畅性。

VibeVoice-ASR-7B:强大的结构化语音转文本工具,支持处理长达 60 分钟的音频
VibeVoice-ASR-7B是一款统一的语音转文本模型,能够单次处理长达 60 分钟的音频文件,并直接输出结构化转录文本。其输出结果可识别说话者、提供精确的时间戳并详细记录语音内容,同时支持自定义热词以提高专有名词或技术术语的识别准确率。 该模型支持 50 多种语言,非常适合处理长篇会议录音和播客转录等复杂场景。
社区开发者已基于该模型开发出实用工具,例如适用于 macOS 和 Windows 的语音输入法Vibing。用户反馈显示其在速度和准确性方面表现优异,显著提升了日常语音输入效率。
VibeVoice-TTS-1.5B:支持多达 90 分钟、多说话人的富有表现力的语音生成
VibeVoice-TTS-1.5B是核心文本转语音模型,能够一次性生成长达 90 分钟的连续音频,并支持多达四位不同说话者进行自然的对话模拟。生成的语音富有表现力,听起来自然流畅,包含真实的停顿、重音和情感变化,非常适合播客、长篇叙述、有声读物或多角色对话。
与许多仅支持1-2名说话者的传统TTS模型不同,VibeVoice-TTS在长篇内容和多说话者一致性方面实现了重大突破。其架构将连续语音分词器(声学和语义)与低帧率(7.5Hz)相结合,显著提升了长序列的计算效率。
VibeVoice-Realtime-0.5B:延迟约 300 毫秒的实时语音合成
VibeVoice-Realtime-0.5B专为实时应用设计,支持流式文本输入,首次音频输出延迟约为300毫秒,同时仍能生成长达10分钟的音频。该模型特别适用于需要即时反馈的交互式应用,例如实时语音助手或直播配音。
此外,该项目引入了实验性的发音人支持功能,涵盖多语言语音及多种英语风格变体,为开发者提供了更丰富的定制选项。
AIbase 评测:微软将 VibeVoice 开源不仅降低了高性能语音 AI 的入门门槛,还提供了一套完整的本地部署解决方案。该项目曾因潜在的滥用风险而短暂下线,但在实施了音频水印和可听见的免责声明等安全措施后重新上线,体现了负责任的 AI 开发原则。开发者现在可以从 GitHub 和 Hugging Face 获取模型权重,并通过 Colab 等平台快速进行测试。
随着开源社区持续贡献(包括针对 Apple Silicon 的优化),VibeVoice 有望加速其在内容创作、辅助技术及语音交互领域的应用。感兴趣的开发者可访问微软官方项目页面进行进一步探索。
项目地址:https://github.com/microsoft/VibeVoice
相关文章
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (0)
0/500
微软最近开源了一套名为VibeVoice 的尖端语音 AI 模型系列,具备自动语音识别(ASR)和文本转语音(TTS)等功能。 得益于其强大的长音频处理能力、自然的多说话者对话生成以及实时低延迟的性能表现,该项目迅速吸引了开发者社区的关注,目前已在GitHub上收获了约27,000个星标。
VibeVoice作为基于MIT许可证的开源研究框架发布,支持本地部署且无需支付云订阅费用,旨在促进语音合成领域的协作与创新。该模型系列包含三个核心成员,分别针对传统语音AI中的特定挑战,例如长序列处理、说话人一致性以及自然流畅性。

VibeVoice-ASR-7B:强大的结构化语音转文本工具,支持处理长达 60 分钟的音频
VibeVoice-ASR-7B是一款统一的语音转文本模型,能够单次处理长达 60 分钟的音频文件,并直接输出结构化转录文本。其输出结果可识别说话者、提供精确的时间戳并详细记录语音内容,同时支持自定义热词以提高专有名词或技术术语的识别准确率。 该模型支持 50 多种语言,非常适合处理长篇会议录音和播客转录等复杂场景。
社区开发者已基于该模型开发出实用工具,例如适用于 macOS 和 Windows 的语音输入法Vibing。用户反馈显示其在速度和准确性方面表现优异,显著提升了日常语音输入效率。
VibeVoice-TTS-1.5B:支持多达 90 分钟、多说话人的富有表现力的语音生成
VibeVoice-TTS-1.5B是核心文本转语音模型,能够一次性生成长达 90 分钟的连续音频,并支持多达四位不同说话者进行自然的对话模拟。生成的语音富有表现力,听起来自然流畅,包含真实的停顿、重音和情感变化,非常适合播客、长篇叙述、有声读物或多角色对话。
与许多仅支持1-2名说话者的传统TTS模型不同,VibeVoice-TTS在长篇内容和多说话者一致性方面实现了重大突破。其架构将连续语音分词器(声学和语义)与低帧率(7.5Hz)相结合,显著提升了长序列的计算效率。
VibeVoice-Realtime-0.5B:延迟约 300 毫秒的实时语音合成
VibeVoice-Realtime-0.5B专为实时应用设计,支持流式文本输入,首次音频输出延迟约为300毫秒,同时仍能生成长达10分钟的音频。该模型特别适用于需要即时反馈的交互式应用,例如实时语音助手或直播配音。
此外,该项目引入了实验性的发音人支持功能,涵盖多语言语音及多种英语风格变体,为开发者提供了更丰富的定制选项。
AIbase 评测:微软将 VibeVoice 开源不仅降低了高性能语音 AI 的入门门槛,还提供了一套完整的本地部署解决方案。该项目曾因潜在的滥用风险而短暂下线,但在实施了音频水印和可听见的免责声明等安全措施后重新上线,体现了负责任的 AI 开发原则。开发者现在可以从 GitHub 和 Hugging Face 获取模型权重,并通过 Colab 等平台快速进行测试。
随着开源社区持续贡献(包括针对 Apple Silicon 的优化),VibeVoice 有望加速其在内容创作、辅助技术及语音交互领域的应用。感兴趣的开发者可访问微软官方项目页面进行进一步探索。
项目地址:https://github.com/microsoft/VibeVoice
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径





首页






