人工智能心理健康工具意外发现有效深度伪造检测方法

随着科技巨头OpenAI于2025年9月发布其旗舰产品Sora 2视频音频生成模型,深度伪造视频已席卷社交媒体,使观众对潜在有害的超现实内容日益习以为常。
尽管OpenAI强调将负责任地部署Sora 2作为核心目标——承诺为用户提供"管理信息流内容的工具与选择"并确保其肖像权的完全控制权——但2025年10月的研究显示该模型80%的时间都在生成误导性视频。
从伪造摩尔多瓦选举官员销毁选票的新闻片段,到虚构幼儿遭移民当局拘留的影像,乃至可口可乐发言人宣布公司将不赞助超级碗的假新闻——在这个互联世界中,虚假信息的危害性已达到空前程度。
超越Sora:语音钓鱼的崛起
早在OpenAI工具问世前,深度伪造内容的制造与传播已呈加速态势。网络安全公司DeepStrike的2025年9月报告指出,此类内容从2023年的50万例激增至2025年的800万例,其中大量用于诈骗。
这一趋势未见减缓迹象:美国AI相关欺诈案预计到2027年将造成400亿美元损失。
增长不仅体现在数量上。得益于Sora 2和谷歌Veo 3等工具,AI生成的面部、声音及全身表演效果比以往更具说服力。计算机科学家兼深度伪造专家吕思伟指出,当前模型能生成稳定无失真的面部图像,而声音克隆技术已达到"难以辨别"的水平。
现实情况是,深度伪造技术的演进速度远超检测手段。科技公司宣传的奥运体操动作创作工具或丰富音频背景功能,正被犯罪分子用于针对企业和个人的诈骗。仅2025年上半年,深度伪造诈骗就造成企业损失3.56亿美元,个人损失5.41亿美元。
传统深度伪造检测手段——如检查水印、修饰过的面部及元数据——已显力不从心。与此同时,语音深度伪造已成为第二大常见的人工智能欺诈手段,2025年语音钓鱼攻击激增442%,其影响已遍及各领域。
吕博士指出:"如今仅需几秒钟的音频,就能生成具有自然语调、节奏、重音、情感、停顿甚至呼吸声的逼真克隆体。"
倾听人类声音
健康科技初创企业Kintsugi开发了基于人工智能的语音生物标志物技术,用于识别临床抑郁和焦虑的征兆。他们的研究始于一个简单理念:我们需要真正倾听人们的声音。
"创立Kintsugi源于亲身经历。我耗费近五个月反复致电医疗机构才预约上首次治疗,期间无人回电。我坚持尝试——但当时就意识到,若是父亲或兄弟遭遇此境,他们早就会放弃了。"首席执行官Grace Chang向Unite.AI透露。
这家加州公司于2019年成立,旨在解决张所说的"分诊瓶颈"。她认为通过早期被动检测病情严重程度,能更快引导患者获得适当治疗。Kintsugi Voice技术利用语音生物标志物识别临床抑郁和焦虑症状。
多项研究证实人工智能语音分析可作为心理健康生物标志物。例如2025年5月发表的论文表明,声学生物标志物能识别心理健康问题及神经多样性的早期征兆,并倡导在临床环境中运用歌唱分析评估潜在认知衰退。
美国精神病学协会数据显示,语音分析技术对抑郁症患者的识别准确率达78%至96%。另有研究采用一分钟语言流畅性测试(要求受试者尽可能多地列举某类词汇),在检测抑郁与焦虑共病方面的准确率达到70%至83%。
为评估心理健康状况,Kintsugi仅需采集简短语音样本。其声学生物标记技术通过分析音高、语调、声线及停顿等特征——这些特征与抑郁症、焦虑症、双相情感障碍及痴呆症密切相关。
张博士未曾预料的是,这项技术还解决了安全领域的一个关键难题:精准识别声音是否真正源自人类。
从心理健康到网络安全
2025年末纽约峰会期间,张女士向一位网络安全界的朋友提及,其团队对合成语音的测试效果令人失望。
"我们尝试用合成数据增强心理健康模型的训练,但生成的声音与真人语音差异巨大,几乎每次都能被识破,"她解释道。
"他突然打断我说:'格蕾丝——这可是安全领域未解的难题。'那一刻我豁然开朗。此后与安全、金融、电信企业的交流中,我们发现深度伪造语音攻击正呈爆发式增长——在实时通话中区分真人与合成声音至关重要。"这位CEO补充道。
去年四月,联邦调查局曾警示公众:有不法分子冒充美国高官,针对前政府雇员及其联系人实施恶意短信和语音诈骗。美国大型银行平均每天遭遇5.5次语音欺诈企图,范德堡大学医学中心员工也报告遭遇冒充朋友、上司和同事的语音钓鱼攻击。
最初,深度伪造技术并非Kintsugi的关注重点。尽管团队使用Cartesia、Sesame和ElevenLabs等模型为呼叫中心代理和工作流程模拟合成语音,但在充斥着Sora等易用工具的市场中,深度伪造欺诈并非优先事项。
然而,验证语音真实性的关键线索恰是定义人类语言的生物标志物。无论语言或语义如何,Kintsugi Voice通过分析信号处理与物理发声延迟,捕捉微妙的时间差、韵律变化、认知负荷及生理特征——关注发声机制而非内容本身。
"合成语音或许流畅,却缺乏生物与认知层面的细微差别,"Chang指出。该公司的模型检测准确率位列前10%,仅需3至5秒音频即可完成识别。
金继创新技术为心理健康困境群体带来希望,尤其在专业医疗资源匮乏地区。该技术还能通过验证真实性而非识别伪造内容,彻底改变深度伪造检测与网络安全领域。
以人为本的技术展望
传统网络安全聚焦恶意用途或攻击者。而金继的突破性创新却立足于人性本质。
"我们开辟了全新领域:人类真实性验证。大型语言模型无法稳定识别自身生成的内容,而基于特征的技术又脆弱不堪。收集涵盖真实人类差异的大型临床标注数据集成本高昂、耗时漫长,更超出多数安全公司的专业能力——这使得我们的方法难以被复制,"张解释道。
该初创企业的战略还指向更广泛的变革趋势:跨行业创新。医疗领域的领军者可率先开发基于AI的语音钓鱼检测技术,正如航天科技创新者可能助力应急响应系统,游戏架构设计或将影响城市规划。
至于张女士,她致力于通过语音交互确立验证真实人类存在——进而验证真实意图——的行业标准。
"正如HTTPS成为网络信任基准,我们相信'人类存在证明'将成为语音系统的核心要素。信号处理正是构建该框架的起点。"她如是说。
随着生成式人工智能的进步,最强大的防护或许源于对人类本质的深刻理解。
相关文章
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
相关专题推荐
评论 (1)
0/500

随着科技巨头OpenAI于2025年9月发布其旗舰产品Sora 2视频音频生成模型,深度伪造视频已席卷社交媒体,使观众对潜在有害的超现实内容日益习以为常。
尽管OpenAI强调将负责任地部署Sora 2作为核心目标——承诺为用户提供"管理信息流内容的工具与选择"并确保其肖像权的完全控制权——但2025年10月的研究显示该模型80%的时间都在生成误导性视频。
从伪造摩尔多瓦选举官员销毁选票的新闻片段,到虚构幼儿遭移民当局拘留的影像,乃至可口可乐发言人宣布公司将不赞助超级碗的假新闻——在这个互联世界中,虚假信息的危害性已达到空前程度。
超越Sora:语音钓鱼的崛起
早在OpenAI工具问世前,深度伪造内容的制造与传播已呈加速态势。网络安全公司DeepStrike的2025年9月报告指出,此类内容从2023年的50万例激增至2025年的800万例,其中大量用于诈骗。
这一趋势未见减缓迹象:美国AI相关欺诈案预计到2027年将造成400亿美元损失。
增长不仅体现在数量上。得益于Sora 2和谷歌Veo 3等工具,AI生成的面部、声音及全身表演效果比以往更具说服力。计算机科学家兼深度伪造专家吕思伟指出,当前模型能生成稳定无失真的面部图像,而声音克隆技术已达到"难以辨别"的水平。
现实情况是,深度伪造技术的演进速度远超检测手段。科技公司宣传的奥运体操动作创作工具或丰富音频背景功能,正被犯罪分子用于针对企业和个人的诈骗。仅2025年上半年,深度伪造诈骗就造成企业损失3.56亿美元,个人损失5.41亿美元。
传统深度伪造检测手段——如检查水印、修饰过的面部及元数据——已显力不从心。与此同时,语音深度伪造已成为第二大常见的人工智能欺诈手段,2025年语音钓鱼攻击激增442%,其影响已遍及各领域。
吕博士指出:"如今仅需几秒钟的音频,就能生成具有自然语调、节奏、重音、情感、停顿甚至呼吸声的逼真克隆体。"
倾听人类声音
健康科技初创企业Kintsugi开发了基于人工智能的语音生物标志物技术,用于识别临床抑郁和焦虑的征兆。他们的研究始于一个简单理念:我们需要真正倾听人们的声音。
"创立Kintsugi源于亲身经历。我耗费近五个月反复致电医疗机构才预约上首次治疗,期间无人回电。我坚持尝试——但当时就意识到,若是父亲或兄弟遭遇此境,他们早就会放弃了。"首席执行官Grace Chang向Unite.AI透露。
这家加州公司于2019年成立,旨在解决张所说的"分诊瓶颈"。她认为通过早期被动检测病情严重程度,能更快引导患者获得适当治疗。Kintsugi Voice技术利用语音生物标志物识别临床抑郁和焦虑症状。
多项研究证实人工智能语音分析可作为心理健康生物标志物。例如2025年5月发表的论文表明,声学生物标志物能识别心理健康问题及神经多样性的早期征兆,并倡导在临床环境中运用歌唱分析评估潜在认知衰退。
美国精神病学协会数据显示,语音分析技术对抑郁症患者的识别准确率达78%至96%。另有研究采用一分钟语言流畅性测试(要求受试者尽可能多地列举某类词汇),在检测抑郁与焦虑共病方面的准确率达到70%至83%。
为评估心理健康状况,Kintsugi仅需采集简短语音样本。其声学生物标记技术通过分析音高、语调、声线及停顿等特征——这些特征与抑郁症、焦虑症、双相情感障碍及痴呆症密切相关。
张博士未曾预料的是,这项技术还解决了安全领域的一个关键难题:精准识别声音是否真正源自人类。
从心理健康到网络安全
2025年末纽约峰会期间,张女士向一位网络安全界的朋友提及,其团队对合成语音的测试效果令人失望。
"我们尝试用合成数据增强心理健康模型的训练,但生成的声音与真人语音差异巨大,几乎每次都能被识破,"她解释道。
"他突然打断我说:'格蕾丝——这可是安全领域未解的难题。'那一刻我豁然开朗。此后与安全、金融、电信企业的交流中,我们发现深度伪造语音攻击正呈爆发式增长——在实时通话中区分真人与合成声音至关重要。"这位CEO补充道。
去年四月,联邦调查局曾警示公众:有不法分子冒充美国高官,针对前政府雇员及其联系人实施恶意短信和语音诈骗。美国大型银行平均每天遭遇5.5次语音欺诈企图,范德堡大学医学中心员工也报告遭遇冒充朋友、上司和同事的语音钓鱼攻击。
最初,深度伪造技术并非Kintsugi的关注重点。尽管团队使用Cartesia、Sesame和ElevenLabs等模型为呼叫中心代理和工作流程模拟合成语音,但在充斥着Sora等易用工具的市场中,深度伪造欺诈并非优先事项。
然而,验证语音真实性的关键线索恰是定义人类语言的生物标志物。无论语言或语义如何,Kintsugi Voice通过分析信号处理与物理发声延迟,捕捉微妙的时间差、韵律变化、认知负荷及生理特征——关注发声机制而非内容本身。
"合成语音或许流畅,却缺乏生物与认知层面的细微差别,"Chang指出。该公司的模型检测准确率位列前10%,仅需3至5秒音频即可完成识别。
金继创新技术为心理健康困境群体带来希望,尤其在专业医疗资源匮乏地区。该技术还能通过验证真实性而非识别伪造内容,彻底改变深度伪造检测与网络安全领域。
以人为本的技术展望
传统网络安全聚焦恶意用途或攻击者。而金继的突破性创新却立足于人性本质。
"我们开辟了全新领域:人类真实性验证。大型语言模型无法稳定识别自身生成的内容,而基于特征的技术又脆弱不堪。收集涵盖真实人类差异的大型临床标注数据集成本高昂、耗时漫长,更超出多数安全公司的专业能力——这使得我们的方法难以被复制,"张解释道。
该初创企业的战略还指向更广泛的变革趋势:跨行业创新。医疗领域的领军者可率先开发基于AI的语音钓鱼检测技术,正如航天科技创新者可能助力应急响应系统,游戏架构设计或将影响城市规划。
至于张女士,她致力于通过语音交互确立验证真实人类存在——进而验证真实意图——的行业标准。
"正如HTTPS成为网络信任基准,我们相信'人类存在证明'将成为语音系统的核心要素。信号处理正是构建该框架的起点。"她如是说。
随着生成式人工智能的进步,最强大的防护或许源于对人类本质的深刻理解。
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码





首页






