AI

苹果推出AI训练新方法 用任务清单替代人工评分显著提升模型性能

发布时间:2025年8月26日    来源:szf
苹果推出AI训练新方法 用任务清单替代人工评分显著提升模型性能

快速阅读: 苹果研究团队提出基于清单反馈的强化学习方法RLCF,替代传统点赞评分机制,大幅提升大语言模型执行复杂指令能力,测试显示性能显著提升,但需更强计算资源且专为复杂任务设计。

苹果公司研究团队近日在 最新 论文中提出了一种名为”基于清单反馈的强化学习”(RLCF)的创新训练方法,通过用具体任务清单替代传统的人工点赞评分机制,大幅提升了大语言模型执行复杂指令的能力。

据了解,RLCF全称为Reinforcement Learning from Checklist Feedback,与目前广泛采用的”人类反馈强化学习”(RLHF)方法形成鲜明对比。传统RLHF方法主要依赖人工进行简单的点赞或点踩评价,而RLCF则为每条用户指令生成详细的检查清单,并按0-100分的标准对各项内容进行精确评分,以此作为模型优化的指导依据。

苹果研究团队选择了强指令跟随模型Qwen2.5-7B-Instruct作为测试对象,并在五个常用评测基准上进行了全面验证。测试结果显示,RLCF是 唯一 在所有测试项目中都取得性能提升的训练方案。

具体数据显示,在FollowBench测试中,硬性满意率提升了4个百分点。InFoBench评分提高6点,Arena-Hard胜率增加3点。在某些特定任务中,性能提升幅度 最高 达到8.2%。这些数据表明,清单反馈方法在处理复杂多步骤任务时表现尤为突出。

在技术实现方面,苹果团队的清单生成过程颇具创新性。他们采用更大规模的Qwen2.5-72B-Instruct模型,结合现有研究方法,为13万条指令构建了名为”WildChecklists”的专用数据集。清单内容设计为明确的二元判断项,例如”是否翻译成西班牙语”等具体要求。随后,大模型对候选回答进行逐项评分,通过综合加权处理后形成训练奖励信号,指导小模型的学习优化过程。

不过,苹果研究人员也坦率承认了该方法的局限性。首先,RLCF需要依赖更强大的模型作为评判标准,这在计算资源受限的场景下可能面临实施困难。其次,该方法专门针对复杂指令执行能力的提升而设计,并非用于安全对齐目的,因此无法替代现有的安全性评估和调优机制。对于其他类型的AI任务,RLCF方法的适用性还需要进一步的实验验证。

业界专家认为,苹果此次提出的RLCF方法为AI模型训练提供了新的思路,特别是在处理复杂多步骤任务方面展现出明显优势。随着技术的进一步完善,这一方法有望在实际应用中发挥更大作用。

(以上内容均由Ai生成)

你可能还想读

TCS推AI机器狗进军航空业

TCS推AI机器狗进军航空业

快速阅读: 据印度塔塔咨询服务公司(TCS)发布消息称,全球航空航天业加速绿色智能化转型,40%企业预计五年内实现“熄灯工厂”,数字孪生与eVTOL成重点方向,物理AI机器人有望获批用于高危场景。 日前,全球航空航天产业加速向绿色化、智能化 […]

发布时间:2025年12月8日
Meta签约多家媒体,为AI提供实时新闻

Meta签约多家媒体,为AI提供实时新闻

快速阅读: 据媒体报道,Meta与CNN、福克斯新闻等多家国际媒体签署AI数据合作协议,重启付费合作以提升Meta AI在新闻时效性与准确性方面的表现,并引导用户访问合作方网站。 日前,美国科技企业Meta宣布与多家国际新闻机构签署商业人工 […]

发布时间:2025年12月8日
Semaverse推AI平台赋能并购决策

Semaverse推AI平台赋能并购决策

快速阅读: 据最新消息,人工智能初创企业Semaverse近日推出“并购智能基础设施”平台,依托多智能体架构与智能记忆系统,为私募股权基金等提供覆盖交易全周期的五大智能化功能,助力数据驱动决策。 近日,人工智能初创企业Semaverse正式 […]

发布时间:2025年12月8日
Gartner建议全面禁用AI浏览器

Gartner建议全面禁用AI浏览器

快速阅读: 据Gartner发布消息称,AI浏览器存在严重数据安全与隐私风险,其侧边栏功能可能自动上传敏感信息至云端,企业部署前须严格评估后端安全机制并限制高危操作场景。 日前,国际知名研究机构Gartner发布风险警示,指出当前流行的AI […]

发布时间:2025年12月8日
利雅得航空携手IBM打造全球首家AI原生航司

利雅得航空携手IBM打造全球首家AI原生航司

快速阅读: 据最新消息,IBM依托混合云与红帽OpenShift技术,为175国客户提供AI及量子计算等创新方案,加速金融、医疗等关键领域数字化转型,深化本地化服务以提升全球产业链智能化水平。 国际商业机器公司(IBM)日前宣布,其作为全球 […]

发布时间:2025年12月8日
英语国家民众对AI更悲观

英语国家民众对AI更悲观

快速阅读: 据YouGov发布消息称,其2025年8月对九国调查显示,西欧民众对AI态度较积极,英语国家更悲观,就业影响最受担忧,而医疗、办公等领域获普遍认可。 日前,国际民调机构YouGov发布一项涵盖九国的调查报告显示,公众对人工智能( […]

发布时间:2025年12月8日
AI无法替代税务专家的判断与质疑

AI无法替代税务专家的判断与质疑

快速阅读: 12月8日消息,专家警示AI在税务申报中存在合规与伦理风险,强调其无法替代专业判断,呼吁合理界定应用边界,防范不法机构借智能算法诱导激进申报,确保人机协同、合法合规。 近日,有关人工智能在税务申报领域应用的讨论引发关注。专家指出 […]

发布时间:2025年12月8日
德州法学院以伦理先行培养AI时代律师

德州法学院以伦理先行培养AI时代律师

快速阅读: 据彭博法律报道,美国得州多所法学院以伦理为先推动AI审慎融入法律教育,要求明确使用规范并强调人类判断不可替代,呼应州律师协会第705号伦理准则。 近日,美国得克萨斯州在人工智能时代积极探索法律教育的务实路径,强调以伦理为先、审慎 […]

发布时间:2025年12月8日