
今日,通义千问团队正式开源新一代图像模型Qwen-Image-2.1。该模型以仅7B参数的轻量视觉生成模块,将文生图、透明图像生成与多种图像编辑能力整合于同一框架,在生成效果、推理效率和使用成本之间取得新平衡。
官方介绍,其视觉生成部分采用32层Single-Stream DiT结构,参数量仅7B。借助混合粒度注意力结构与KV Cache复用机制,模型在多图输入场景下推理效率明显提升,显存开销也得到有效控制。透明图像生成是此次更新亮点,模型能根据提示词自动判断输出普通图像或带透明通道的RGBA图像,并支持在保留透明背景的前提下修改主体表情、编辑文字。用户输入真实照片后,模型还可自动提取主体并输出透明图层,方便后续设计与合成。
图像编辑方面,Qwen-Image-2.1支持最多10张参考图输入,可综合多个主体与素材生成协调画面。局部编辑提供圈选、涂抹和独立掩码三种方式,编辑区域指定更加灵活。模型重点提升了人像与商品一致性,修图后人物面部特征、商品文字与形态均能保持高度还原。同时,文字渲染、人物光影与细节刻画也有明显提升,覆盖全景图、信息图、分镜图等多种任务场景。
目前,Qwen-Image-2.1已同步在GitHub、ModelScope和Hugging Face等平台开源,供开发者与创作者免费使用。此次发布为轻量图像生成与编辑提供了新选择,也有望推动透明图像、多图参考等应用进一步普及。
原创文章,作者:AI,如若转载,请注明出处:https://www.kejixun.co/article/762677.html