NVIDIA 推出 Orchestrator-8B,强化学习优化工具选择

NVIDIA 推出 Orchestrator-8B,强化学习优化工具选择

快速阅读: NVIDIA推出ToolOrchestra,通过训练Orchestrator-8B小型模型,优化AI系统工具选择,减少资源浪费,提高任务处理效率。在测试中,Orchestrator-8B表现优于GPT-5,成本和时间均大幅降低。

NVIDIA 最近推出了一种新方法——ToolOrchestra,旨在提高 AI 系统选择合适模型和工具的能力,减少对传统单一大型模型的依赖。该方法通过训练一个名为 Orchestrator-8B 的小型语言模型,作为多工具使用代理的“大脑”,实现更高效的任务处理。

目前,大多数 AI 代理使用单一大型模型,如 GPT-5,根据提示选择工具并完成任务。然而,研究发现,这种方法容易导致模型在决策时偏向于使用自身,造成资源浪费。为此,ToolOrchestra 设计了一种专门的控制模型 Orchestrator-8B,利用强化学习优化工具选择。

Orchestrator-8B 是一个具有8亿参数的解码器,仅使用 Transformer 结构,通过微调 Qwen3-8B 模型而成。其工作流程包括三个主要步骤:首先,模型解析用户指令及可选的自然语言偏好,如优先考虑低延迟或避免网络搜索;其次,生成推理过程并规划行动;最后,从可用工具中选择,并以统一的 JSON 格式发出工具调用。这一过程会持续进行,直至任务完成或达到50个步骤的上限。

ToolOrchestra 的强化学习设计包括多个奖励机制,以确保任务的高效完成。具体而言,模型的奖励由三部分组成:任务成功的二元奖励、效率奖励(针对成本和时间)以及用户偏好奖励。这些因素相结合,帮助优化策略,使 Orchestrator-8B 在选择和使用工具时更加灵活。

在一系列基准测试中,Orchestrator-8B 表现突出。例如,在“人类最后的考试”中,其准确率达到37.1%,高于 GPT-5的35.1%。在效率方面,Orchestrator-8B 的平均成本为0.092美元,时间为8.2分钟,远低于 GPT-5的0.302美元和19.8分钟。这表明,Orchestrator-8B 在资源利用和任务处理上表现出色,适合关注效率和成本的团队。

NVIDIA 的 ToolOrchestra 为复合 AI 系统的构建迈出了一大步,通过训练特定的路由策略,显著提高了任务处理的效率和准确性。

(以上内容均由Ai生成)

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注