Visko 发布 Orbis Live 原型机并获得种子前轮融资

Orbis 是一个实时、交互式的长视频生成系统。来源:Visko
Visko 还有更多工作要做
该报告还披露了 Orbis 在某些方面落后于其他系统的具体情况,并公布了完整的研究方法和结果。尹承认,还有更多工作需要完成。
“在研究方面,我们需要对记忆结构进行更优化的设计,”他表示,“例如,视频在生成过程中可以保持更佳的一致性。”
“其次,我们希望在数据采集过程中加入更详细的动作描述,就像训练那些视频模型一样,”尹补充道。 “目前,我可以要求机械臂执行某项任务,但缺乏非常详细的描述。如果给出非常具体的指令,比如将手臂抬高45度,我们希望将更精确的动作描述数据纳入该模型的训练中。”
“在工程层面,我们必须在模型和数据规模上进行扩展,”他表示。“目前我们主要关注音频和视频数据。 我们仍在探索引入其他传感器数据,例如触觉数据。对于许多可变形物体,我们可以从视频中解读作用力,但我们正在寻找专注于机器人传感器和应用的合作伙伴。目前我们正在与一些硬件公司接洽。”

上图:基于1至3分钟事件驱动型基准测试的质量、对齐和运动测量结果。下图:基于人类偏好研究得出的长视频Arena点估计的总体结果。Orbis 1.0获得了最高综合得分;该表格提供了所有基线的维度级比较及引用信息。来源:Visko
顾问指出潜在应用
顾问团队包括加州大学伯克利分校的迈克尔·I·乔丹(Michael I. Jordan)、哥伦比亚大学的史蒂夫·韦清·孙(Steve WaiChing Sun)以及纽约大学的任梦叶。分发工作由Visko的合作伙伴Reactor负责。
“Visko正在探索视频AI领域中最具雄心的方向之一:实时、带状态的模型,这些模型在保持物理一致性的同时,能够持续感知、预测并与世界实时交互,”Visko顾问委员会主席乔丹表示。
“Visko 提供了一种最先进的架构,其技术领先优势远超传统的短视频生成领域,”他补充道,“这一核心能力可支持极其广泛的商业机遇,涵盖机器人、物理模拟、游戏、直播电商、教育以及实时创意媒体等领域。”
尹表示,Orbis 还能帮助提供测试环境,用于验证极端边界情况,从而提升自动驾驶汽车和类人机器人的安全性。
“有人估计,通用机器人将在五到十年内进入家庭,但根据我与该领域人士的交流,这可能还需要一段时间,就像自动驾驶一样,”他指出,“我的目标是在这一过程中寻找商业化机会。”

用于测试Orbis 1.0的数据包括现实世界和生成场景的原始视频素材。来源:Visko
相关文章
谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗
谷歌周二宣布,Android将推出虚假来电检测功能,以防范利用AI深度伪造技术实施的冒充诈骗。该功能将于本月通过“Phone by Google”在全球范围内面向Android 12及以上版本的设备逐步推出,首先适用于Pixel设备。随着人们越来越不愿接听陌生号码的来电,诈骗分子正改变策略,通过伪造可信的电话号码,并利用AI深度伪造技术模仿权威人士、家人或雇主的语气进行诈骗。例如,某人可能会接到一
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
谷歌在2026年IO大会上推出基于音频技术的智能眼镜,此举与Meta的战略如出一辙
谷歌正战略性地重返智能眼镜市场。在周二举行的谷歌I/O大会上,这家科技巨头宣布与Warby Parker和Gentle Monster合作,推出一系列搭载人工智能的新款眼镜。这些设备由谷歌与三星联合设计,经过优化可与Android和iOS平台无缝集成,计划于今年晚些时候发布。谷歌将这些设备称为“音频眼镜”,用户可通过语音指令进行交互,并利用包括Gemini在内的一系列应用和服务来完成各项任务。图片
相关专题推荐
评论 (0)
0/500

Orbis 是一个实时、交互式的长视频生成系统。来源:Visko
Visko 还有更多工作要做
该报告还披露了 Orbis 在某些方面落后于其他系统的具体情况,并公布了完整的研究方法和结果。尹承认,还有更多工作需要完成。
“在研究方面,我们需要对记忆结构进行更优化的设计,”他表示,“例如,视频在生成过程中可以保持更佳的一致性。”
“其次,我们希望在数据采集过程中加入更详细的动作描述,就像训练那些视频模型一样,”尹补充道。 “目前,我可以要求机械臂执行某项任务,但缺乏非常详细的描述。如果给出非常具体的指令,比如将手臂抬高45度,我们希望将更精确的动作描述数据纳入该模型的训练中。”
“在工程层面,我们必须在模型和数据规模上进行扩展,”他表示。“目前我们主要关注音频和视频数据。 我们仍在探索引入其他传感器数据,例如触觉数据。对于许多可变形物体,我们可以从视频中解读作用力,但我们正在寻找专注于机器人传感器和应用的合作伙伴。目前我们正在与一些硬件公司接洽。”

上图:基于1至3分钟事件驱动型基准测试的质量、对齐和运动测量结果。下图:基于人类偏好研究得出的长视频Arena点估计的总体结果。Orbis 1.0获得了最高综合得分;该表格提供了所有基线的维度级比较及引用信息。来源:Visko
顾问指出潜在应用
顾问团队包括加州大学伯克利分校的迈克尔·I·乔丹(Michael I. Jordan)、哥伦比亚大学的史蒂夫·韦清·孙(Steve WaiChing Sun)以及纽约大学的任梦叶。分发工作由Visko的合作伙伴Reactor负责。
“Visko正在探索视频AI领域中最具雄心的方向之一:实时、带状态的模型,这些模型在保持物理一致性的同时,能够持续感知、预测并与世界实时交互,”Visko顾问委员会主席乔丹表示。
“Visko 提供了一种最先进的架构,其技术领先优势远超传统的短视频生成领域,”他补充道,“这一核心能力可支持极其广泛的商业机遇,涵盖机器人、物理模拟、游戏、直播电商、教育以及实时创意媒体等领域。”
尹表示,Orbis 还能帮助提供测试环境,用于验证极端边界情况,从而提升自动驾驶汽车和类人机器人的安全性。
“有人估计,通用机器人将在五到十年内进入家庭,但根据我与该领域人士的交流,这可能还需要一段时间,就像自动驾驶一样,”他指出,“我的目标是在这一过程中寻找商业化机会。”

用于测试Orbis 1.0的数据包括现实世界和生成场景的原始视频素材。来源:Visko
谷歌推出虚假来电检测功能,以防范AI深度伪造冒充诈骗
谷歌周二宣布,Android将推出虚假来电检测功能,以防范利用AI深度伪造技术实施的冒充诈骗。该功能将于本月通过“Phone by Google”在全球范围内面向Android 12及以上版本的设备逐步推出,首先适用于Pixel设备。随着人们越来越不愿接听陌生号码的来电,诈骗分子正改变策略,通过伪造可信的电话号码,并利用AI深度伪造技术模仿权威人士、家人或雇主的语气进行诈骗。例如,某人可能会接到一
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
谷歌在2026年IO大会上推出基于音频技术的智能眼镜,此举与Meta的战略如出一辙
谷歌正战略性地重返智能眼镜市场。在周二举行的谷歌I/O大会上,这家科技巨头宣布与Warby Parker和Gentle Monster合作,推出一系列搭载人工智能的新款眼镜。这些设备由谷歌与三星联合设计,经过优化可与Android和iOS平台无缝集成,计划于今年晚些时候发布。谷歌将这些设备称为“音频眼镜”,用户可通过语音指令进行交互,并利用包括Gemini在内的一系列应用和服务来完成各项任务。图片





首页






