阿里视频模型赛马遇阻,Wan 与 HappyHorse 合并呼声渐起
阿里同时维护 Wan 与 HappyHorse 两套高度重合的视频生成模型,组织合并后仍各自迭代;内部已讨论合流,更可能…
阿里旗下通义万相 3.0 与 HappyHorse 1.1 是两套功能高度重叠、定位直接对撞的视频生成模型,目前仍在阿里百炼平台上以不同价格争夺同一批客户。围绕二者是否合流以及由谁主导,阿里内部已展开讨论,更大概率会以 HappyHorse 为主线收编 Wan 体系。
两套视频模型的并行局面
今年 4 月,HappyHorse 以匿名模型身份空降 Artificial Analysis 文生视频、图生视频等多项榜单第一;几天后阿里正式认领这匹"欢乐马"。8 月 6 日,通义万相又推出 Wan 3.0,将单次生成时长从此前的 15 秒拉到 30 秒,并把文生视频、图生视频、参考生视频、视频编辑整合到同一模型中。
两款模型从产品定位到目标用户几乎完全重合:
- 价格:720P 视频 Wan 3.0 每秒 0.6 元,HappyHorse 1.1 每秒 0.9 元;1080P 均为每秒 1.2 元。
- 能力:HappyHorse 曾主打的原生音频、人物一致性与多镜头叙事,正在被 Wan 3.0 吸收;30 秒时长、全模态参考、视频编辑等新能力,又逐一进入 HappyHorse 的传统领地。
换言之,阿里在同一事业部下同时维护两套独立视频模型,使用两套独立的官网、API 与定价体系服务高度重合的用户群。
从差异化到高度重合
Wan 出身通义体系,更接近标准基础模型,强调通用能力、开发者生态与云端 API;HappyHorse 源自原淘天未来生活实验室,更贴近创作者与商业内容生产,主打广告、短剧等场景。两支团队一度可以靠差异化同时存在:基础模型团队拓展能力上限,产品团队负责寻找商业化路径。
但 HappyHorse 并不是调用 Wan 的上层应用,而是一套独立的视频生成模型。Wan 2.7 能做的事情,HappyHorse 1.1 大部分都能做;HappyHorse 的原生音频、人物一致性和多镜头叙事,也逐渐被 Wan 吸收。从 Artificial Analysis 榜单看,二者仍处在相近梯队,差异更像是同一水平线上的路线偏好,而不是足以划分市场、代际区隔的硬差距。
到了 Wan 3.0,原本就不算清晰的边界进一步消失。30 秒生成、全模态参考、原生音频、人物与场景一致性、视频编辑,以及面向短剧、广告和企业内容的应用方向,几乎每一项都覆盖到 HappyHorse 的传统领地。
组织合并之后,模型仍未合流
今年 6 月,阿里将通义大模型事业部和未来生活实验室合并,成立由吴泳铭直接负责的 Token Foundry 事业部,HappyHorse 团队一并进入新部门。调整本身已经说明,阿里意识到基础模型研发与商业场景探索各自为战的问题。
但组织合并并未带来模型合流。6 月下旬 HappyHorse 1.1 发布,一个多月后 Wan 3.0 开启公测,两套模型继续按各自的节奏分别完成数据准备、训练、后训练、评测和推理优化,产品端还要各自维护入口、文档、定价与用户认知。这种并行已经不是用少量资源做多路线探索,而是在最昂贵的模型类别之一上重复"造轮子"。
赛马的边际收益正在递减
更深层的问题在于,无论是 HappyHorse 还是 Wan 3.0,实际上都尚未撼动当前视频生成市场格局。HappyHorse 匿名登顶时的声量并未转化为稳定的市场位置,随着 Seedance、可凌、Kling 以及各类开源视频模型继续迭代,HappyHorse 很快回到追赶者行列;Wan 3.0 补齐了时长、音频、全模态输入与视频编辑,但同样未建立起改变市场认知的决定性优势。
视频模型真正能让用户记住的,往往不是功能列表有多长,而是在哪一件事上明显更好。Wan 3.0 看起来什么都能做,却尚未证明自己在哪一项上不可替代:30 秒视频、原生音频、支持 PDF、PPT、表格和网页输入固然是进步,但若人物运动、长时一致性、镜头理解和指令遵循没有显著领先,新增能力更多只是把产品清单拉长。
价格同样不是独立存在的优势。视频生成的真实成本不只是单次调用价格,而是得到一条可用视频需要尝试多少次。一段 30 秒 1080P 视频按现有定价需 36 元,若反复生成十次才得到可用结果,调用成本就会膨胀到 360 元,还不算筛选、剪辑与修改的时间。对专业用户来说,提高一次成功率远比每秒降价 0.3 元更重要。
在商业闭环尚未稳定之前,让两套模型分别扩展相似功能清单的边际收益只会越来越低。更合理的方式是让 Wan 成为统一的视频基础模型,吸收 HappyHorse 在人物表现、音画协同与商业场景上的积累;HappyHorse 保留为面向创作者的产品品牌,负责工作流、模板和行业方案。底层集中训练一套模型,上层保留多个入口,这比继续赛马更符合现实。
