行业动态
MiniMax H3 亮相 RaySummit,33B 多模态音视频模型将做技术拆解
MiniMax 旗下 33B 开源权重多模态模型 H3 在旧金山 RaySummit 亮相,并在 vLLM 会议分享架构…
2026.08.27 · 周四约 2 分钟阅读
MiniMax 旗下的 H3 多模态模型日前出现在 AnyScale 主办的 RaySummit 旧金山现场,并将在随后的 vLLM Conference 上做更深度的技术拆解。这是该模型首次以独立专场形式进入海外主流 AI 工程会议议程。
模型概览
H3 定位为 33B 参数的开源权重(open-weight)模型,主打音视频与多模态融合:
- 统一上下文:在同一上下文中同时处理文本、图像、视频与音频
- 开源权重:发布 33B 参数版本,供开发者下载与二次研究
- 工程友好:与 vLLM 等主流推理框架兼容,便于部署与服务化
会议安排
在 RaySummit 主会场,MiniMax 团队成员 @VictorSuOrtiz 将于 vLLM Conference 分会场拆解 H3 的架构与实现细节,覆盖模型设计、训练方法与部署路径。同一时间,@VoidAsuka 将围绕开发者社区如何基于 H3 进行微调、评测与服务化展开分享,体现「从模型到社区」的完整链路。
生态合作
本次分享由多家生态伙伴共同参与:
- 算力与平台:DigitalOcean
- 硬件与加速:NVIDIA
- 推理服务:Inferact
- 社区研究:NousResearch
行业观察
音视频与文本的统一多模态建模是当前大模型的重要方向之一,33B 这一参数规模在效果与部署成本之间寻求平衡。从官方表述看,H3 试图把四类模态纳入同一上下文窗口;若后续披露的 benchmark 与社区评测能验证这一设计,开源权重阵营中将新增一款具备全模态能力的大模型选项。但目前公开信息仅停留在会议预告层面,具体能力指标、权重下载入口与发布日期尚未给出。
