AI

阿里开源Qwen-Image-Edit,中文渲染超GPT-4o,精准编辑双控

发布时间:2025年8月19日    来源:szf
阿里开源Qwen-Image-Edit,中文渲染超GPT-4o,精准编辑双控

快速阅读: 阿里通义千问团队发布Qwen-Image-Edit图像编辑模型,基于20B参数MMDiT,支持精准文本编辑和语义外观编辑,中文渲染准确率97.29%,适用于广告设计、IP创作等场景。

阿里通义千问团队正式开源最新图像编辑模型 Qwen-Image-Edit,这是继 Qwen-Image 之后,通义千问系列在图像生成与编辑领域的又一力作。Qwen-Image-Edit 是一个基于20B参数多模态扩散变换器(MMDiT)的图像编辑基础模型,在精准文本编辑、语义与外观编辑方面表现出色,尤其在中文文本渲染上实现了行业领先的表现。

Qwen-Image-Edit 继承了 Qwen-Image 的核心优势,进一步提升了文本渲染能力。无论是英文还是中文,它都能实现高保真的文本编辑,支持直接在图像中添加、删除或修改文本,同时保留原有字体、大小和风格。特别是在中文场景下,模型能够处理多行布局、段落级文本生成以及书法对联等复杂排版需求,单字渲染准确率高达97.29%,远超其他顶级模型如 Seedream3.0(53.48%)和 GPT Image1(68.37%)。

例如,Qwen-Image-Edit 可以轻松将海报上的“Hope”替换为“Qwen”,或在书法作品中修正错误字符,同时保持图像整体的视觉一致性。这种精准的文本编辑能力使其在广告设计、品牌宣传和内容创作中具有巨大潜力。

Qwen-Image-Edit 的核心技术创新在于其双重编码机制。在图像编辑过程中,输入图像同时经过 Qwen2.5-VL 模型进行语义编码,提取高层场景和对象关系特征;以及变分自编码器(VAE)进行重建编码,保留底层视觉细节如纹理和颜色。这种机制确保了模型在执行复杂编辑指令时,既能理解语义意图,又能保持视觉保真度。

例如,在语义编辑中,Qwen-Image-Edit 可以将图像中的人物姿态调整为“弯腰牵狗爪”,同时保持人物身份和背景一致;在外观编辑中,它能精确添加元素(如带有真实反射的标牌)或移除细微细节(如头发丝),而其他区域保持不变。这种“语义+外观”的双重控制使其在 IP 创作、风格迁移和新视角合成等场景中表现尤为出色。

通过增强的多任务训练范式,Qwen-Image-Edit 支持文本到图像(T2I)、图像到图像(I2I)以及文本引导图像编辑(TI2I)等多种任务。模型在 GEdit、ImgEdit 和 GSO 等图像编辑基准测试中均取得 SOTA 性能,综合评分分别达到7.56(英文)和7.52(中文),超越 GPT Image1 和 FLUX.1Kontext 等竞争对手。

值得一提的是,Qwen-Image-Edit 的“链式编辑”能力尤为突出。例如,在书法纠错场景中,模型能够通过多轮迭代逐步修正错误字符,同时保持整体风格一致。这种能力大幅提升了创作效率,降低了专业视觉内容创作的门槛。

Qwen-Image-Edit 基于 Apache2.0 协议完全开源,用户可通过 Hugging Face、ModelScope 等平台免费获取模型权重,或通过 Qwen Chat 的“Image Editing”功能在线体验。阿里还在 ComfyUI 中提供原生支持,并发布了详细的技术报告和快速上手指南,助力开发者快速集成。

社交媒体上,开发者对 Qwen-Image-Edit 的发布反响热烈,称其“将中文渲染和图像编辑能力提升至商用水平”,甚至有用户表示其效果“媲美甚至超越 GPT-4o 和 FLUX.1”。此外,模型支持多种 LoRA 模型(如 MajicBeauty LoRA),进一步扩展了其在高真实感图像生成中的应用场景。

Qwen-Image-Edit 的多功能特性使其适用于多种场景,包括但不限于:海报与广告设计,生成具有视觉冲击力的宣传海报,支持复杂文本排版和风格迁移;IP 内容创作,基于品牌吉祥物(如 Qwen 的 Capybara)生成 MBTI 主题表情包,保持角色一致性;教育与培训,快速生成高质量插图和图表,提升课程内容的视觉吸引力;游戏与影视,支持角色设计、背景生成和新视角合成,优化资产开发流程。

用户反馈显示,Qwen-Image-Edit 的直观操作和高质量输出使其成为非专业设计者的理想工具。例如,一位内容创作者表示:“Qwen-Image-Edit 让我在几分钟内完成营销视觉设计,文本渲染精准,效果堪比专业软件。”

作为阿里通义千问团队的最新力作,Qwen-Image-Edit 以其强大的文本编辑能力、双重编码机制和开源特性,为 AI 图像生成与编辑领域树立了新标杆。无论是中文渲染的断层式领先,还是语义与外观编辑的平衡表现,Qwen-Image-Edit 都展现了其作为行业顶尖模型的实力。

GitHub 地址:https://github.com/QwenLM/Qwen-Image

(以上内容均由Ai生成)

你可能还想读

美国科技未来需投资人才与科研

美国科技未来需投资人才与科研

快速阅读: 据最新消息,美国政府拟持股英特尔10%,以强化半导体战略,但专家强调需同步加大基础科研投入并解决STEM人才短缺,方能维系科技领先地位。 近日,美国政府宣布将持有英特尔公司10%的股权,引发广泛关注。此举被视为对本国半导体制造业 […]

发布时间:2025年12月8日
康宁押注AI数据中心光纤需求激增

康宁押注AI数据中心光纤需求激增

快速阅读: 据康宁公司介绍,AI数据中心加速转向光纤互联,单节点集成72颗GPU,布线长达两英里;因算力激增与带宽需求,光通信将推动AI硬件生态结构性变革,市场或扩至三倍。 近日,人工智能硬件基础设施加速升级,数据中心内部连接技术正经历重要 […]

发布时间:2025年12月8日
智能体AI重塑政府与民众服务关系

智能体AI重塑政府与民众服务关系

快速阅读: 据最新消息,AI代理技术在能源、环保、医疗和教育等领域试点成效显著,提升地震解释准确率70%,优化垃圾清运与课程设置,推动公共服务向智能优化转型。 近日,人工智能代理技术在公共服务领域展现出显著应用潜力。今年1月,阿布扎比国家石 […]

发布时间:2025年12月8日
英警方呼吁中央统筹AI应用

英警方呼吁中央统筹AI应用

快速阅读: 据techUK发布消息称,英格兰和威尔士警方需建立中央统筹机制并加大投入,以释放AI在执法中的潜力,解决应用不均、数据质量及算法偏见等问题,推动全国协调与透明治理。 英国信息技术行业组织techUK近日发布报告指出,英格兰和威尔 […]

发布时间:2025年12月8日
Viam携手优傲机器人推AI自动化方案

Viam携手优傲机器人推AI自动化方案

快速阅读: 据最新消息,美国Viam公司与优傲机器人达成合作,基于UR系列协作机器人开发AI驱动的表面处理系统,已应用于船舶打磨,并拓展至家具、建筑等行业,推动制造智能化转型。 近日,美国纽约企业Viam宣布与泰瑞达集团旗下优傲机器人公司( […]

发布时间:2025年12月8日
AI智能体破解医疗沟通困局

AI智能体破解医疗沟通困局

快速阅读: 据最新消息,美国医疗系统因信息孤岛问题导致患者沟通受阻,AI智能体技术正通过代理式通信提升诊疗协同效率,企业Infinitus已推动该方案在随访与用药管理等场景落地。 近日,美国医疗系统在信息互通方面面临的严峻挑战引发广泛关注。 […]

发布时间:2025年12月8日
AI虚拟演员Tilly Norwood引行业争议

AI虚拟演员Tilly Norwood引行业争议

快速阅读: 据美联社报道,AI虚拟演员蒂莉·诺伍德由Particle6公司打造,旨在探索影视AI应用,团队正优化其自然表现并计划明年推出互动功能,但遭部分经纪公司抵制。 近日,人工智能虚拟演员“蒂莉·诺伍德”(Tilly Norwood)再 […]

发布时间:2025年12月8日
苹果硬件主管或离职,芯片业务面临巨变

苹果硬件主管或离职,芯片业务面临巨变

快速阅读: 据彭博社报道,苹果硬件技术主管斯鲁吉考虑离职,其主导自研M系列与A19 Pro芯片,深度支撑全系产品,潜在出走或重创苹果芯片优势并撼动行业格局。 据彭博社日前报道,苹果公司高级副总裁、硬件技术主管约翰尼·斯鲁吉正考虑离职。斯鲁吉 […]

发布时间:2025年12月8日