姚顺雨重塑腾讯混元多模态:靠拢梁文锋
前xAI多模态负责人蔺旭东加入腾讯混元,混元多模态团队持续调整,组织路线向理解和Agent靠拢。
近日,腾讯混元多模态团队再度发生重要人事变动:曾任 xAI 多模态理解负责人的蔺旭东离开 xAI,加入腾讯混元,担任多模态内容生成算法负责人。这已是混元多模态团队近一年多以来一系列组织调整中的最新一环。
蔺旭东其人与加入背景
蔺旭东 2018 年毕业于清华大学,后赴哥伦比亚大学攻读博士,研究方向涵盖嵌入学习、视频分析与生成模型,参与过哥伦比亚大学与 Facebook AI 合作的 Vx2Text 项目。该项目将视频、声音等不同模态转换为类似「语言 token」的向量,再统一送入语言模型进行融合,最终通过自回归解码器生成文本——其核心难点在于「理解」。
博士毕业后,蔺旭东进入 DeepMind 参与 Gemini 的多模态预训练与后训练工作;2025 年加入 xAI,负责多模态理解方向。加入混元后,他将负责多模态内容生成算法。
此前,混元多模态团队已有多轮调整:
- 原多模态理解负责人胡瀚离职创业;
- 前 OpenAI 研究员田永龙于 2026 年 7 月加入腾讯,负责视觉语言模型方向;
- 混元多模态基础模型负责人钟钊(负责 HunyuanVideo 与 HunyuanImage)在朋友圈暗示即将告别;
- 原多模态模型部负责人 Linus 改为向姚顺雨汇报;
- 2026 年 3 月,成立近十年的腾讯 AI Lab 被撤销,部分人员并入混元大语言模型部。
腾讯多模态的组织与路线变迁
2025 年 1 月,腾讯杰出科学家胡瀚接替刘威,全面负责混元多模态大模型研发。2025 年下半年,混元内部将大语言模型部门与多模态模型部门整合,胡瀚调入大语言模型部旗下「Frontier」前沿技术研究组,改为向姚顺雨汇报。
此后,腾讯 TEG 正式撤销大语言模型部与多模态模型部,合并成立「基础模型部」,由姚顺雨任负责人,向 TEG 总裁卢山汇报。腾讯表示,此举旨在提升模型研发与协同效率,探索全模态模型的智能上限。
混元此前的多模态产品矩阵以生成方向为主:
- HunyuanVideo:2024 年 12 月首发,130 亿参数,支持 5 秒 720p 输出;2025 年 11 月发布 1.5 版本,参数压缩至 83 亿,支持原生 5–10 秒 480p/720p 视频,可超分辨率至 1080p。
- HunyuanImage:2024 年 5 月推出首个中文原生 DiT 架构图像模型,2026 年 1 月推出带推理能力的 Instruct 版本。
- Hy 3D:2024 年 11 月开源 1.0 版本,2025 年迭代至 3.1,建模精度较初版提升 3 倍。
- Hy World 1.0(2025 年 7 月):全球首个开源、支持仿真的沉浸式 3D 世界生成模型,采用先全景图后分层 3D 重建的技术路线,2025 年 9 月发布基于相机轨迹控制的 Voyager 版本,2026 年发布技术报告《HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds》。
姚顺雨的路线选择:靠拢梁文锋
蔺旭东的加入释放出明确信号:腾讯对多模态的研发方向已发生变化。在多模态路线上,业界存在两种思路:
- 李飞飞(World Labs)主张空间智能与世界模型是 AGI 的重要方向;
- 梁文锋(DeepSeek)则认为「3D、视频生成、世界模型,跟智能的主线没有太大关系」,DeepSeek 的多模态产品 DeepSeek OCR 将视觉模态定位为服务于语言模型的工具,通过「上下文光学压缩」将长文本渲染为图像,再用视觉编码器压缩为视觉 token。
姚顺雨此前在 OpenAI 工作,其加入腾讯后的首款旗舰产品 Hy3 聚焦推理、智能体、长上下文与生产力任务,官方称其在软件开发、办公生产、金融建模等场景进行了优化。在 2026 年 6 月的腾讯云 AI 产业应用大会上,姚顺雨判断 AI 下半场竞争壁垒不在参数量,而在 Context(上下文)。他还制作了测试上下文的基准 CL-bench 与 CL-bench life,验证模型脱离原有知识、从上下文中寻找答案的能力。
这一思路与梁文锋高度一致:将多模态基础转化为「理解」能力,融入语言模型与 Agent 主线,而非独立发展生成方向。蔺旭东在 Vx2Text 中积累的多模态「翻译」为语言模型可理解形式的经验,恰好契合这一方向。
混元多模态未来走向
将蔺旭东放到多模态内容生成的位置,核心意图可能在于解决生成模型「不稳定地记忆和理解世界」的瓶颈——长视频人物变形、物体前后不一致、摄像机运动违反空间关系等问题,并非生成能力不足,而是缺乏持续理解能力。
接入 Hy3 后,腾讯 WorkBuddy 任务解决率从 72% 提升至 90%,平均耗时缩短 34%,日均文字处理量较预览版增长 20 倍,排队率一度超过 50%。多模态理解能力若进一步增强,GUI Agent 场景下「感知屏幕 — 理解界面 — 决策操作 — 执行验证」的链路体验有望进一步提升。
腾讯混元的多模态路线正在从「以生成为核心」转向「以理解和 Agent 为核心」,但这一选择是否优于李飞飞的空间智能路径,仍有待产品与市场的长期验证。
