产品功能
通义 Qwen 演示单图多层嵌套「画中画」生成能力
通义 Qwen 在 X 平台展示模型在单张图像内层层嵌套多个真实 UI 界面的「富内容」生成能力。
2026.07.22 · 周三约 2 分钟阅读
通义千问(Qwen)近日在官方 X 账号上展示了其模型在「富内容」(Rich Content)生成方面的最新能力。与常见的水平铺陈式图像生成不同,本次演示聚焦于「深度」这一维度,即在同一张图像内层层嵌套多个语义完整的界面。
能力演示:单图多层嵌套
官方以一张示例图呈现了「画中画」的极致延伸效果。从最外层到最内层,画面依次嵌套了四个真实风格的 UI 界面:
- 最外层:VSCode 代码编辑器界面
- 第二层:Qwen Chat 对话界面
- 第三层:一款即时通讯应用的聊天窗口
- 最内层:一幅手冲咖啡海报
每一层都保留了对应应用真实的视觉风格、字体与排版细节,形成「画中画中的画中画」的纵深感,整体观感类似俄罗斯套娃式的屏幕叠层。
技术亮点:语义解构与逻辑嵌套
通义将这一能力视为「富内容」区别于一般图像生成的关键特征。其核心技术挑战体现在两个方面:
- 语义解构:模型需理解每个嵌套层所代表的真实应用场景,准确还原不同产品的视觉语言,而非仅做简单的视觉堆叠;
- 逻辑嵌套:保持从外到内的层级关系清晰,使每一层既独立成画,又能与整体构图协调统一。
官方认为,「深度」与「水平扩展」共同构成富内容生成的两大核心特质。
行业意义与当前局限
这一演示反映出多模态模型正从「生成单一画面」向「生成结构化复杂场景」逐步演进。对于 UI 设计稿、产品原型图、教程插图等需要多层信息叠加的应用场景,该能力具备一定的实用潜力。
不过,本次发布仅为社交媒体上的能力展示,官方尚未公布具体的模型版本、参数规模、benchmark 表现或可供开发者调用的入口,距离正式产品化与规模化落地仍有距离,后续值得关注 Qwen 是否会将其整合进 Qwen Chat 或相关 API 服务中。
