阿里千问发布 Qwen-Image-3.0,文本输入长度提升 4.5 倍
7 月 21 日,阿里发布图像生成基础模型 Qwen-Image-3.0。新模型支持最长 4.5K Token 的文本输入,可根据详细提示词生成包含公式、几何图形、逻辑推导步骤的知识图解和复杂 UI 界面,并支持 12 种语言及 20 多种字体的原生渲染。相比前代,文本处理长度提升至 4.5 倍,显著减少多轮生成和后期人工调整。
文本输入长度提升 4.5 倍
Qwen-Image-3.0 是千问图像生成与编辑模型系列的第三代基础模型。阿里表示,新版本重点提升了复杂指令理解、文字渲染、空间布局以及多层信息组织能力。在影视分镜、数学试卷、网页界面、产品海报等场景中,用户可以用较长提示词描述画面结构、文字内容、视觉风格和排版要求,而不再需要把需求压缩成简短指令。
与前代模型相比,Qwen-Image-3.0 的文本输入长度提升至原来的 4.5 倍。这对于需要大量文字描述的复杂信息图、产品说明页和影视分镜等任务尤其有用——直接给出完整描述,模型一次生成,减少反复调整的成本。
复杂信息组织:一张图容纳多种元素
Qwen-Image-3.0 可在同一张图片中组合不同类型的视觉元素。例如,根据一条指令就能生成由多个领域内容组成的九宫格知识图解;也可以在同一画面中嵌套网页、软件界面、聊天窗口和海报等内容。

比如,用户要求生成一张包含 VS Code 编程界面、千问 App、聊天窗口和手冲咖啡海报的多层嵌套图片。生成结果按指令呈现了不同界面层级,并保留了截图时间、界面文字等较小尺寸文本。不过,当前效果主要来自企业展示,实际稳定性和不同场景下的生成质量仍需进一步测试。

图像生成与编辑一体化架构
Qwen-Image-3.0 采用图像生成与编辑一体化架构,将文字渲染、图像细节和知识理解能力同时用于生成和编辑任务。据介绍,该模型可处理古画修复、全景图扩展、手绘草图转演示文稿、多镜头视角生成等任务,也支持局部修改、内容扩展和风格转换。
一体化架构意味着用户可以在同一模型中连续完成初次生成和后续修改,不必在多个工具之间切换。其实际价值主要在于减少二次编辑过程中可能出现的文字变化、风格不一致和结构偏移。
开放情况
目前,阿里云百炼和千问 AI 平台已经开放 Qwen-Image-3.0 API 邀测。Qwen Studio 和千问 App 也计划上线相关体验功能。对于 AI 编程/氛围编程场景,更长的文本输入和多层信息组织能力有望帮助开发者直接生成复杂的 UI 界面和产品海报,减少从文本到视觉的反复迭代。