OpenAI的音频雄心挑战硅谷的屏幕霸权

OpenAI 正大力进军音频人工智能领域,其目标远不止于提升 ChatGPT 的语音质量。据《The Information》最近的一份报道披露,在过去两个月里,该公司已整合了多个工程、产品和研究团队,以全面升级其音频模型。此举旨在为一款预计在一年左右后推出的“音频优先”个人设备做准备。
这一战略转变反映了科技行业的整体趋势——即迈向一个屏幕退居幕后、音频成为主要交互界面的未来。智能音箱已使语音助手进入超过三分之一的美国家庭。 Meta近期为其雷朋智能眼镜推出了一项新功能,利用五麦克风阵列帮助用户在嘈杂环境中听清对话,从而将佩戴者的面部转化为定向聆听设备。与此同时,谷歌于6月开始测试“音频概览”功能,将搜索结果转化为语音摘要;特斯拉则正在将xAI的Grok聊天机器人集成到其车辆中,打造一款能够通过自然语音管理从导航到气候控制等各项功能的对话式助手。
下注于此的不仅是行业巨头。众多初创企业也怀揣着同样的核心信念涌现,尽管成果参差不齐。Humane AI Pin的开发者曾投入数亿美元,但这款无屏幕可穿戴设备最终却成了广为引用的警示案例。 Friend AI项链号称能记录生活并提供陪伴,却引发了严重的隐私担忧和存在主义焦虑。如今,包括Sandbar以及由Pebble创始人埃里克·米吉科夫斯基(Eric Migicovsky)领导的一家公司在内的至少两家企业,正在开发计划于2026年推出的AI戒指,届时用户将能真正实现“对自己的手说话”。
尽管设计各异,但其核心理念始终如一:音频将是未来的交互界面。每一个环境——你的家、你的车,甚至你自身——都在被转化为一个控制界面。
据报道,OpenAI预计于2026年初推出的新款语音模型将具备更自然的语音效果,能像真实的对话伙伴一样应对插话,甚至能在用户说话时同步回应——这是当前模型所不具备的能力。据悉,该公司还计划推出一系列设备,可能包括智能眼镜或无屏幕扬声器,旨在让这些设备更像伴侣而非单纯的工具。
这一发展并非完全出人意料。正如《The Information》所指出的,前苹果设计主管乔尼·艾维(Jony Ive)——他在OpenAI于5月以65亿美元收购其公司io后加入了OpenAI的硬件项目——一直致力于降低对设备的依赖。他将“音频优先”的设计视为弥补以往消费电子产品缺陷的契机。
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (1)
0/500

OpenAI 正大力进军音频人工智能领域,其目标远不止于提升 ChatGPT 的语音质量。据《The Information》最近的一份报道披露,在过去两个月里,该公司已整合了多个工程、产品和研究团队,以全面升级其音频模型。此举旨在为一款预计在一年左右后推出的“音频优先”个人设备做准备。
这一战略转变反映了科技行业的整体趋势——即迈向一个屏幕退居幕后、音频成为主要交互界面的未来。智能音箱已使语音助手进入超过三分之一的美国家庭。 Meta近期为其雷朋智能眼镜推出了一项新功能,利用五麦克风阵列帮助用户在嘈杂环境中听清对话,从而将佩戴者的面部转化为定向聆听设备。与此同时,谷歌于6月开始测试“音频概览”功能,将搜索结果转化为语音摘要;特斯拉则正在将xAI的Grok聊天机器人集成到其车辆中,打造一款能够通过自然语音管理从导航到气候控制等各项功能的对话式助手。
下注于此的不仅是行业巨头。众多初创企业也怀揣着同样的核心信念涌现,尽管成果参差不齐。Humane AI Pin的开发者曾投入数亿美元,但这款无屏幕可穿戴设备最终却成了广为引用的警示案例。 Friend AI项链号称能记录生活并提供陪伴,却引发了严重的隐私担忧和存在主义焦虑。如今,包括Sandbar以及由Pebble创始人埃里克·米吉科夫斯基(Eric Migicovsky)领导的一家公司在内的至少两家企业,正在开发计划于2026年推出的AI戒指,届时用户将能真正实现“对自己的手说话”。
尽管设计各异,但其核心理念始终如一:音频将是未来的交互界面。每一个环境——你的家、你的车,甚至你自身——都在被转化为一个控制界面。
据报道,OpenAI预计于2026年初推出的新款语音模型将具备更自然的语音效果,能像真实的对话伙伴一样应对插话,甚至能在用户说话时同步回应——这是当前模型所不具备的能力。据悉,该公司还计划推出一系列设备,可能包括智能眼镜或无屏幕扬声器,旨在让这些设备更像伴侣而非单纯的工具。
这一发展并非完全出人意料。正如《The Information》所指出的,前苹果设计主管乔尼·艾维(Jony Ive)——他在OpenAI于5月以65亿美元收购其公司io后加入了OpenAI的硬件项目——一直致力于降低对设备的依赖。他将“音频优先”的设计视为弥补以往消费电子产品缺陷的契机。
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






