腾讯混元多模态理解负责人胡瀚离职,原团队或聚焦世界模型
腾讯混元多模态理解负责人胡瀚近期离职创业,其所在团队或将转向世界模型研究。
腾讯混元大语言模型部近期出现重要人事变动。多模态理解负责人胡瀚已提出离职并准备创业,而他此前所在的 Frontier 前沿技术研究组,可能将资源转向世界模型方向的前沿研究。截至发稿,腾讯官方未对上述信息做出回应。
核心人事变动与组织重组
胡瀚此前为微软亚洲研究院视觉计算组首席研究员,于 2025 年初加入腾讯,最初负责视觉大模型研究。随后他被调入大语言模型部旗下的「Frontier」前沿技术研究组,承担多模态理解相关研究,并向大语言模型部负责人姚顺雨汇报。在此期间,胡瀚还曾参与世界模型的研发工作。
接替胡瀚负责视觉语言模型(VLM)方向的是田永龙——前 OpenAI 研究员、麻省理工学院博士,于 2026 年 7 月初加入大语言模型部,同样汇报给姚顺雨。
据《智能涌现》了解,姚顺雨加入腾讯后,已对混元体系展开密集梳理:腾讯撤销 AI Lab 后,核心研发人员全部并入大语言模型部;来自字节 Seed Infra 团队和后训练团队的多名人才也被招入麾下。
大语言模型成为混元战略主线
自姚顺雨加入腾讯以来,「补全短板、将混元基模能力快速提升至第一梯队」便成为腾讯 AI 的核心任务。围绕这一目标,重新分配人才与算力资源、聚焦基础模型研发成为组织调整的主线。
在 2026 年 6 月 5 日的腾讯云 AI 产业应用大会上,腾讯集团高级执行副总裁汤道生替外界向姚顺雨追问:「很多人说腾讯在 AI 上慢了,你觉得我们真的慢了吗?」据混元内部研究员透露,姚顺雨本人比腾讯高层更加急切,曾多次为公司争取更多算力资源。在 Hy3 发布前一个月,一批数据出现问题时,姚顺雨曾以严厉措辞告诫团队:「数据非常重要。如果下次再出现这样的情况,直接走人。」
7 月 6 日,姚顺雨交出加入腾讯后的首份正式答卷——大模型 Hy3。在同等参数量的中等尺寸模型中,Hy3 已能与 GLM-5.2、DeepSeek V4 Pro 同台竞技。
多模态理解的收益重估
胡瀚所从事的多模态理解研究,目前已被内部视为趋于成熟的方向。一名多模态研究员表示:「在多模态理解研究中,文字、图像、视频识别准确率基本上能达到 85% 以上,难的其实是视觉推理——让模型理解图像和视频意味着什么。这一步靠多模态研究是不够的,而是要提升语言模型的推理能力。」
从商业角度看,多模态理解对应的「识图」「看图写话」等场景缺乏直接变现路径。一位元宝产品经理指出:「没有用户愿意为识图付费,市面上有大把免费可替代的产品。用户真正愿意付费的,是文档处理、PPT 制作、研报制作这些办公场景——背后对应的是模型的推理、Coding、Agentic 能力。」
过去,计算机视觉技术与腾讯的广告、游戏、影音等现金牛业务结合紧密,曾是多模态研究的核心驱动力。但相较于生成技术,理解类技术始终难以独立支撑商业化。
算力约束下的战略聚焦
腾讯面临的算力约束,是促使其调整资源配置的另一关键因素。
- 2025 年腾讯全年资本开支为 792 亿元;
- 截至 2026 年 3 月,阿里财年资本开支达到 1260 亿元;
- 据彭博社报道,2026 年字节计划将 AI 基础设施投入最高推至 700 亿美元。
在算力总量不占优势的情况下,混元内部难免陷入资源紧张的格局。暂缓技术红利趋减的多模态理解研究,将资源集中到更具前沿价值的方向上,成为腾讯权衡收益后的现实选择。从组织重组、基建体系重构到回归基模的战略,姚顺雨加入后的系列举措,正在让混元重新具备跻身第一梯队的竞争力。
