桃子桃子快讯
返回首页
产品功能

通义 Qwen 演示单图多层嵌套「画中画」生成能力

通义 Qwen 在 X 平台展示模型在单张图像内层层嵌套多个真实 UI 界面的「富内容」生成能力。

2026.07.22 · 周三2 分钟阅读

通义千问(Qwen)近日在官方 X 账号上展示了其模型在「富内容」(Rich Content)生成方面的最新能力。与常见的水平铺陈式图像生成不同,本次演示聚焦于「深度」这一维度,即在同一张图像内层层嵌套多个语义完整的界面。

能力演示:单图多层嵌套

官方以一张示例图呈现了「画中画」的极致延伸效果。从最外层到最内层,画面依次嵌套了四个真实风格的 UI 界面:

  • 最外层:VSCode 代码编辑器界面
  • 第二层:Qwen Chat 对话界面
  • 第三层:一款即时通讯应用的聊天窗口
  • 最内层:一幅手冲咖啡海报

每一层都保留了对应应用真实的视觉风格、字体与排版细节,形成「画中画中的画中画」的纵深感,整体观感类似俄罗斯套娃式的屏幕叠层。

技术亮点:语义解构与逻辑嵌套

通义将这一能力视为「富内容」区别于一般图像生成的关键特征。其核心技术挑战体现在两个方面:

  • 语义解构:模型需理解每个嵌套层所代表的真实应用场景,准确还原不同产品的视觉语言,而非仅做简单的视觉堆叠;
  • 逻辑嵌套:保持从外到内的层级关系清晰,使每一层既独立成画,又能与整体构图协调统一。

官方认为,「深度」与「水平扩展」共同构成富内容生成的两大核心特质。

行业意义与当前局限

这一演示反映出多模态模型正从「生成单一画面」向「生成结构化复杂场景」逐步演进。对于 UI 设计稿、产品原型图、教程插图等需要多层信息叠加的应用场景,该能力具备一定的实用潜力。

不过,本次发布仅为社交媒体上的能力展示,官方尚未公布具体的模型版本、参数规模、benchmark 表现或可供开发者调用的入口,距离正式产品化与规模化落地仍有距离,后续值得关注 Qwen 是否会将其整合进 Qwen Chat 或相关 API 服务中。

信源