快手发布新多模态模型,实现复杂推理新突破

快手发布新多模态模型,实现复杂推理新突破

快速阅读: 快手发布新一代多模态模型Keye-VL-671B-A37B,开放代码,提升视觉理解、视频分析和数学推理能力,增强响应准确性和稳定性,推动人工智能技术发展。

快手近日发布了其新一代旗舰多模态模型 Keye-VL-671B-A37B,并同步开放了代码。该模型凭借“善看会想”的特点,在通用视觉理解、视频分析和数学推理等多个核心基准测试中表现出色,进一步巩固了快手在人工智能领域的技术实力。

Keye-VL-671B-A37B 的设计旨在实现更高层次的多模态理解和复杂推理。在基础模型强大通用能力的基础上,该模型对视觉感知、跨模态对齐及复杂推理链路进行了系统升级,提高了其在各种应用场景中的响应准确性和稳定性。这表明,无论是在日常应用还是在高难度任务中,Keye-VL-671B-A37B 都能提供更加精确的结果。

在技术架构上,Keye-VL-671B-A37B 采用了 DeepSeek-V3-Terminus 作为大语言模型的基础,并通过 MLP 层与视觉模型 KeyeViT 进行连接,而 KeyeViT 则基于 Keye-VL-1.5 初始化。模型的预训练过程分为三个阶段,系统地构建了其多模态理解和推理能力。通过精心挑选的300B高质量预训练数据,Keye-VL-671B-A37B 在确保视觉理解能力的同时,有效控制了计算成本。

具体训练流程包括:首先冻结视觉与语言模型的参数,进行初步对齐训练;然后开放所有参数进行全面预训练;最后在更高质量的数据集上进行退火训练,显著提升了模型的细粒度感知能力。此外,模型的后续训练过程涵盖了监督微调、冷启动和强化学习等步骤,训练任务涉及视觉问答、图表理解、富文本 OCR 等领域。

快手表示,未来 Keye-VL 将继续提升基础模型的能力,同时进一步融合多模态 Agent 的能力,向更“会用工具、能解复杂问题”的智能形态发展。模型的多轮工具调用能力将得到加强,使其能够在实际任务中自主调用外部工具,完成复杂的搜索、推理和信息整合。此外,Keye-VL 还将在“以图思考”和“以视频思考”等关键方向上深入探索,使模型不仅能够理解图像和视频,还能围绕这些内容进行深度思考和链式推理。

通过基础能力和 Agent 能力的双重驱动,快手的 Keye-VL 目标是不断扩展多模态智能的边界,迈向更加通用、可靠且具有更强推理能力的下一代多模态系统。这一创新将为多模态 AI 的发展带来新的机遇与挑战。

(以上内容均由Ai生成)

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注