MIT等推出全自动“运动数据工厂”

MIT等推出全自动“运动数据工厂”

快速阅读: 记者获悉,麻省理工学院、英伟达及加州大学伯克利分校联合推出FoundationMotion自动化数据生成管线,无需人工标注即可生成高精度运动问答数据,使150亿参数视频模型在物理理解任务中的准确率达到90.6%,显著超越更大规模的开源与商业系统。

当前,尽管数字化视频处理系统发展迅速,但在应对复杂空间移动与物理规律时仍存在明显的“理解缺失”。这类系统虽能描述画面内容,却难以准确回答涉及精细物理逻辑的问题,例如“红车是否在蓝车转弯前通过路口”或“皮球运行轨迹的最高点在哪”。

究其原因,在于高质量运动参考数据极度匮乏。现有数据规模有限,且高度依赖成本高昂的人工标注,难以支撑计算系统学习真实世界中的细粒度物理运动。

针对这一瓶颈,麻省理工学院、英伟达(NVIDIA)及加州大学伯克利分校等机构的研究团队提出了FoundationMotion——一套完全无需人工参与的自动化数据生成管线。该管线如同全自动“运动数据工厂”,分三阶段运行:首先利用先进目标追踪技术,将视频中行人、车辆或机械臂等物体转化为连续的时空坐标轨迹;随后将这些抽象坐标转化为结构化文本说明,并结合视频帧生成详尽的“运动说明书”;最后通过逻辑整合,产出包含速度、方向、时序关系及空间位置的精细化问答数据。

实验显示,仅使用该管线生成的数据进行优化后,一个150亿参数的视频分析系统在运动理解任务上的准确率达到90.6%。其表现不仅超越了720亿参数的大型开源模型,甚至优于当前主流的商业闭源系统。

研究人员指出,性能提升完全源于数据的高纯净度与准确性。这表明,自动驾驶、机器人协作等领域可通过海量高质量自动化数据训练,使系统逐步建立对物理世界的直觉。此举标志着数字系统在迈向具备“物理常识”的具身智能道路上迈出了关键一步。

(以上内容均由Ai生成)

引用自:AIbase人工智能资讯平台

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注