一年后,Openai尚未发布语音克隆工具
OpenAI的语音引擎:期待已久的发布?
去年三月底,OpenAI推出了其AI服务“语音引擎”的“小规模预览”,承诺仅用15秒语音即可克隆一个人的声音。一年后,该工具仍处于预览模式,没有明确的全面发布计划,甚至不确定是否会正式推出。
广泛推出语音引擎的犹豫可能源于对滥用的担忧,或试图规避监管审查。OpenAI过去因优先考虑炫目产品而忽视安全,以及急于在竞争对手之前上市而受到批评。
一位OpenAI发言人告诉TechCrunch,公司仍在与一小群“可信合作伙伴”测试语音引擎。“我们正在学习合作伙伴如何使用该技术,以提升模型的实用性和安全性,”发言人解释说。“看到它的应用范围,从语音治疗、语言学习到客户支持、视频游戏角色和AI头像,都令人兴奋。”
语音引擎:迄今的历程
语音引擎为OpenAI的文本转语音API和ChatGPT的语音模式提供支持,生成的声音极其自然,高度模仿原始说话者。它将文本转换为语音,仅受某些内容指南的限制。然而,从一开始,推出就受到延迟和发布日期变更的困扰。
在2024年6月的博客文章中,OpenAI详细介绍了语音引擎模型如何预测给定文本的说话者可能发出的声音,考虑不同声音、口音和说话风格。这使模型不仅能从文本生成语音,还能生成反映不同说话者朗读文本的“口述话语”。
最初,语音引擎(当时称为自定义语音)计划于2024年3月7日加入OpenAI的API,根据TechCrunch看到的博客草稿。计划最初向最多100名“可信开发者”提供访问权限,优先考虑开发具有社会效益或展示创新和负责任技术使用的应用。OpenAI已为该服务注册商标,并为“标准”声音设定每百万字符15美元的定价,为“高清质量”声音设定每百万字符30美元。
但在最后时刻,公告被推迟。几周后,OpenAI公布了语音引擎,但没有提供注册选项,仅限2023年底以来合作的小部分开发者访问。
“我们希望就负责任部署合成语音展开对话,探讨社会如何适应这些新能力,”OpenAI在2024年3月底的公告博客中表示。“基于这些对话和这些小规模测试的结果,我们将更明智地决定是否以及如何大规模部署这项技术。”
漫长的发展之路
语音引擎自2022年开始开发,OpenAI在2023年夏季向全球政策制定者展示了其潜力与风险。目前,几个合作伙伴可访问语音引擎,包括初创公司Livox,旨在帮助残疾人更自然地沟通。然而,Livox首席执行官Carlos Pereira指出,他们无法将语音引擎集成到产品中,因为它需要网络连接,而许多客户缺乏这种条件。“语音的质量和支持不同语言的能力是独特的——特别是对我们的残疾客户,”Pereira通过电子邮件告诉TechCrunch。“这是我见过的最令人印象深刻且易于使用的语音创建工具……我们希望OpenAI尽快开发离线版本。”
Pereira未从OpenAI获悉可能的发布日期或收费计划,目前Livox尚未需要为其使用付费。
在2024年6月的帖子中,OpenAI暗示推迟语音引擎的原因之一是美国选举周期中可能的滥用风险。公司已实施安全措施,包括水印以追踪生成音频的来源。开发者必须获得原始说话者的“明确同意”,并向受众“清楚披露”声音为AI生成。然而,OpenAI尚未详细说明如何大规模执行这些政策,这可能是一个重大挑战。
OpenAI还暗示正在构建“语音认证体验”以验证说话者,并设立“禁止名单”以防止创建类似知名人物的声音。这些是雄心勃勃的项目,任何失误都可能进一步损害OpenAI在安全举措方面的声誉。
有效的过滤和身份验证对于负责任发布语音克隆技术变得至关重要。AI语音克隆是2024年第三快增长的诈骗,导致欺诈和绕过银行安全检查,而隐私和版权法律难以跟上步伐。恶意行为者使用语音克隆创建名人及政客的深伪内容,这些内容在社交媒体上迅速传播。
OpenAI可能下周发布语音引擎,也可能永远不会发布。公司提到考虑保持服务的小规模。但有一点是肯定的:无论是为了形象、安全还是两者兼顾,语音引擎的有限预览已成为OpenAI历史上最长的之一。
相关文章
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
相关专题推荐
评论 (15)
0/500
これ、もう1年も経つのにまだプレビュー版なんだね。音声クローン技術って倫理的にすごくデリケートな問題だから、慎重に進めるのは理解できるけど、市場の期待はずっと先送りされてる感じ。他のAI企業はどんどん類似機能をリリースしてるのに、OpenAIは何を待ってるんだろう?🤔 もしかしたら、悪用防止の仕組みを完璧にしたいのかな。でも、待たされるユーザーとしては少しイライラするかも…
Ça fait un an qu'ils promettent cette technologie et toujours rien ? 😅 Moi qui voulais créer une voix IA de mon chat, je crois que je vais devoir attendre encore longtemps. C'est bizarre cette absence de calendrier, peut-être qu'ils ont des problèmes éthiques à régler ?
これ、去年発表されたまま音沙汰ないんですね🤔 声の合成技術は確かにすごいけど、どんな懸念があって公開をためらっているのか気になります。もしかして悪用されそうで怖いからかな?早く使ってみたいけど、慎重になる気持ちもわかる…
¿Un año y todavía no han soltado esa herramienta de clonación de voz? 🤔 Me pregunto si será por problemas técnicos o por miedo al mal uso. Suena a que tiene mucho potencial, pero también da un poco de miedo pensando en el deepfake.
Why's OpenAI dragging their feet on Voice Engine? A year later and still just a preview? Sounds like they're scared of the ethical mess this could stir up. 😬
OpenAI的语音引擎:期待已久的发布?
去年三月底,OpenAI推出了其AI服务“语音引擎”的“小规模预览”,承诺仅用15秒语音即可克隆一个人的声音。一年后,该工具仍处于预览模式,没有明确的全面发布计划,甚至不确定是否会正式推出。
广泛推出语音引擎的犹豫可能源于对滥用的担忧,或试图规避监管审查。OpenAI过去因优先考虑炫目产品而忽视安全,以及急于在竞争对手之前上市而受到批评。
一位OpenAI发言人告诉TechCrunch,公司仍在与一小群“可信合作伙伴”测试语音引擎。“我们正在学习合作伙伴如何使用该技术,以提升模型的实用性和安全性,”发言人解释说。“看到它的应用范围,从语音治疗、语言学习到客户支持、视频游戏角色和AI头像,都令人兴奋。”
语音引擎:迄今的历程
语音引擎为OpenAI的文本转语音API和ChatGPT的语音模式提供支持,生成的声音极其自然,高度模仿原始说话者。它将文本转换为语音,仅受某些内容指南的限制。然而,从一开始,推出就受到延迟和发布日期变更的困扰。
在2024年6月的博客文章中,OpenAI详细介绍了语音引擎模型如何预测给定文本的说话者可能发出的声音,考虑不同声音、口音和说话风格。这使模型不仅能从文本生成语音,还能生成反映不同说话者朗读文本的“口述话语”。
最初,语音引擎(当时称为自定义语音)计划于2024年3月7日加入OpenAI的API,根据TechCrunch看到的博客草稿。计划最初向最多100名“可信开发者”提供访问权限,优先考虑开发具有社会效益或展示创新和负责任技术使用的应用。OpenAI已为该服务注册商标,并为“标准”声音设定每百万字符15美元的定价,为“高清质量”声音设定每百万字符30美元。
但在最后时刻,公告被推迟。几周后,OpenAI公布了语音引擎,但没有提供注册选项,仅限2023年底以来合作的小部分开发者访问。
“我们希望就负责任部署合成语音展开对话,探讨社会如何适应这些新能力,”OpenAI在2024年3月底的公告博客中表示。“基于这些对话和这些小规模测试的结果,我们将更明智地决定是否以及如何大规模部署这项技术。”
漫长的发展之路
语音引擎自2022年开始开发,OpenAI在2023年夏季向全球政策制定者展示了其潜力与风险。目前,几个合作伙伴可访问语音引擎,包括初创公司Livox,旨在帮助残疾人更自然地沟通。然而,Livox首席执行官Carlos Pereira指出,他们无法将语音引擎集成到产品中,因为它需要网络连接,而许多客户缺乏这种条件。“语音的质量和支持不同语言的能力是独特的——特别是对我们的残疾客户,”Pereira通过电子邮件告诉TechCrunch。“这是我见过的最令人印象深刻且易于使用的语音创建工具……我们希望OpenAI尽快开发离线版本。”
Pereira未从OpenAI获悉可能的发布日期或收费计划,目前Livox尚未需要为其使用付费。
在2024年6月的帖子中,OpenAI暗示推迟语音引擎的原因之一是美国选举周期中可能的滥用风险。公司已实施安全措施,包括水印以追踪生成音频的来源。开发者必须获得原始说话者的“明确同意”,并向受众“清楚披露”声音为AI生成。然而,OpenAI尚未详细说明如何大规模执行这些政策,这可能是一个重大挑战。
OpenAI还暗示正在构建“语音认证体验”以验证说话者,并设立“禁止名单”以防止创建类似知名人物的声音。这些是雄心勃勃的项目,任何失误都可能进一步损害OpenAI在安全举措方面的声誉。
有效的过滤和身份验证对于负责任发布语音克隆技术变得至关重要。AI语音克隆是2024年第三快增长的诈骗,导致欺诈和绕过银行安全检查,而隐私和版权法律难以跟上步伐。恶意行为者使用语音克隆创建名人及政客的深伪内容,这些内容在社交媒体上迅速传播。
OpenAI可能下周发布语音引擎,也可能永远不会发布。公司提到考虑保持服务的小规模。但有一点是肯定的:无论是为了形象、安全还是两者兼顾,语音引擎的有限预览已成为OpenAI历史上最长的之一。
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
これ、もう1年も経つのにまだプレビュー版なんだね。音声クローン技術って倫理的にすごくデリケートな問題だから、慎重に進めるのは理解できるけど、市場の期待はずっと先送りされてる感じ。他のAI企業はどんどん類似機能をリリースしてるのに、OpenAIは何を待ってるんだろう?🤔 もしかしたら、悪用防止の仕組みを完璧にしたいのかな。でも、待たされるユーザーとしては少しイライラするかも…
Ça fait un an qu'ils promettent cette technologie et toujours rien ? 😅 Moi qui voulais créer une voix IA de mon chat, je crois que je vais devoir attendre encore longtemps. C'est bizarre cette absence de calendrier, peut-être qu'ils ont des problèmes éthiques à régler ?
これ、去年発表されたまま音沙汰ないんですね🤔 声の合成技術は確かにすごいけど、どんな懸念があって公開をためらっているのか気になります。もしかして悪用されそうで怖いからかな?早く使ってみたいけど、慎重になる気持ちもわかる…
¿Un año y todavía no han soltado esa herramienta de clonación de voz? 🤔 Me pregunto si será por problemas técnicos o por miedo al mal uso. Suena a que tiene mucho potencial, pero también da un poco de miedo pensando en el deepfake.
Why's OpenAI dragging their feet on Voice Engine? A year later and still just a preview? Sounds like they're scared of the ethical mess this could stir up. 😬





首页






