快速阅读: 据英伟达消息,该公司发布通用人工智能模型NitroGen,基于OpenVision架构,利用超4万小时游戏视频训练,可跨多种虚拟环境运行,在陌生游戏中任务成功率比从头训练模型高52%,相关成果已开源以推动具身智能研究。
英伟达近日发布其在通用人工智能(AGI)领域的新成果——游戏智能体基础模型NitroGen。该模型基于OpenVision动作架构,旨在成为可跨多种虚拟环境运行的“通用代理”,突破传统AI单一用途的局限。
为让NitroGen掌握复杂操作逻辑,研究团队另辟蹊径,利用YouTube和Twitch平台上带有控制器叠加层的游戏视频作为训练数据。通过分析1000余款游戏、总计超4万小时的玩家录像,模型学会了根据视觉反馈直接生成操作指令。研究人员结合模板匹配与微调后的SegFormer模型,从海量视频中精准提取玩家的实时按键输入。
在技术层面,NitroGen深度集成英伟达此前发布的GR00TN 1.5机器人模型,显著提升其跨平台适应能力。测试显示,该模型可胜任动作角色扮演、平台跳跃、Roguelike等多种风格迥异的游戏类型。即使面对完全陌生的游戏环境,其任务成功率仍比从头训练的模型高出52%,验证了机器人基础模型在虚拟场景中的通用潜力。
目前,由英伟达联合斯坦福大学、加州理工学院等机构组成的研究团队,已将NitroGen的论文、代码及数据集全面开源。此举旨在推动全球AI社区在具身智能与通用代理方向的协同探索,为通用人工智能发展提供重要技术基础。
(以上内容均由Ai生成)
引用自:AIbase人工智能资讯平台