李飞飞团队发布AI空间智能模型Marble

李飞飞团队发布AI空间智能模型Marble

快速阅读: 据World Labs消息,该公司发布多模态3D世界模型“Marble”,由李飞飞领衔研发,旨在赋予AI空间智能与具身化想象力,可生成一致、可交互的三维场景,有望变革影视、建筑、教育及机器人等领域。

近日,初创企业World Labs发布其前沿多模态3D世界模型“Marble”,标志着人工智能在空间智能领域取得重要进展。该模型使AI能够超越语言和二维图像,与物理三维世界进行交互。

该项目由斯坦福大学计算机科学教授李飞飞领衔。她目前暂离教职,专注于此项研究。作为斯坦福以人为本人工智能研究院联合创始主任,以及World Labs联合创始人兼首席执行官,李飞飞曾于2006年创建大规模视觉学习数据集ImageNet,显著推动了深度学习与计算机视觉的发展。她出生于北京,早年家庭经营干洗店,后因其在人工智能领域的奠基性贡献被广泛誉为“AI教母”。

李飞飞指出,当前主流人工智能虽在提升创造力与生产力方面成效显著,但在感知、导航及响应物理世界方面仍存在明显短板。她认为,关键在于缺乏人类所具备的空间智能——即流畅地与物理环境互动的能力,以及由此激发的具身化想象力。她举例称,从古希腊埃拉托色尼通过影子测算地球周长,到哈格里夫斯发明“珍妮纺纱机”提升纺织效率八倍,再到沃森与克里克借助三维分子模型揭示DNA结构,历史上的重大突破均依赖于对空间关系的深刻理解。

Marble模型可精准捕捉环境中的位置、光照、物体布局及运动状态,确保从不同视角观察时的空间一致性,并生成可探索、编辑、扩展或模拟的三维场景。该技术有望在多个领域带来变革:影视与游戏创作者可低成本构建逼真场景;建筑师能快速迭代设计并模拟人流动线;保险业可依托更精确的物理世界建模优化风险评估;城市规划者则可融合真实与合成数据,模拟灾害应对与城市发展。

此外,科研人员可突破实验室限制开展多维仿真,机器人可在高保真3D环境中训练以提升适应性,教育领域亦能实现沉浸式历史重现或高危操作实训。与仅预测文本序列的大语言模型不同,此类大型世界模型(LWMs)还能预测空间几何与物理规律,推动AI向“具身智能”演进。尽管自动驾驶汽车已应用空间感知技术,但其依赖激光雷达、摄像头等专用硬件,功能局限于驾驶任务;而LWMs旨在构建通用三维表征,支持跨室内外乃至想象空间的多领域推理与行动。

与此同时,人工智能领域迎来新动向。即将卸任的Meta首席人工智能科学家杨立昆正致力于研发具备空间感知能力的AI助手,使其能够感知、理解并在物理环境中自主移动。这一技术方向有望推动“多模态元宇宙”的实现——即在经历十余年发展后,将元宇宙从静态的三维资产集合,转变为由世界模型驱动的沉浸式、交互性生态系统。

目前,随着渲染效果日益逼真、交互行为趋于自主、延迟显著降低,相关技术或可支持构建一个个性化、持续演化的共享虚拟空间,供用户与亲友、同事及合作伙伴共同体验。有观点认为,世界模型未来可能对人类经验产生深远影响,其意义或可类比互联网数十年前对信息传播的变革作用。

然而,上述场景仍属前瞻性设想。杨立昆已宣布将离开Meta,其后续研究路径尚不明确。尽管如此,随着人工智能在环境理解与空间建模方面取得实质性进展,业界开始关注:这是否标志着技术重心正从语言模型向世界模型转移?该问题的答案,或将深刻影响下一代人工智能系统的发展方向。

(以上内容均由Ai生成)

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注