Vivix A1发布:首个实时交互多模态基础模型
Vivix 推出实时交互多模态模型 A1 与世界观模型 W1,近30B 激活参数,消费级 GPU 单卡推理吞吐破万 to…
Vivix(灵动时刻)正式发布其首个实时交互多模态基础模型 A1,以及配套的世界观模型 W1。A1 被官方定位为「全球首个在一套原生流式架构中,统一多模态参考、实时交互和流式生成的基础模型」,强调让屏幕中的虚拟角色拥有身体,能够行动、转身、与环境持续互动,而非仅停留在口播层面。W1 则进一步让用户可以介入叙事,改变角色选择与剧情走向。
围绕 A1 的工程化落地,Vivix 在模型层与基础设施层同时给出了多项技术披露。
模型架构:统一流式架构与多模态联合建模
A1 面向流式生成的本质难题——角色身份、场景与物体关系在长时间 rollout 中容易漂移——将图片、视频、声音、交互历史与已生成内容共同写入持续状态,通过因果时序建模与流式状态维护保持局部动作连续与全局一致性。
在交互信号建模上,A1 不再以 ASR 文本作为唯一的中间表示,而是直接建模语言语义、声学特征、非语言声音、环境事件、手势与动态视觉信号。最短约 300 ms 的最小时间片内即可推理出对上下文的最新响应 token(被官方称为「快思考」),上层的 Director Agent 异步承担长时序宏观行为控制(「慢思考」),从而让语气变化、环境声响、画面动作都能实时触发新的生成。
MJD:把 8 步视频扩散压缩到 2 步
为支撑实时性,A1 采用 Vivix 提出的多维联合蒸馏(MJD),以 8 步版本作为质量基线,将不同去噪阶段承担的能力共同压缩进 2 步模型,而不是只优化单帧画质。MJD 同时优化三个目标:
- Short-Horizon Generation Quality:保留快速采样下的视觉细节与运动表现;
- Long-Horizon Temporal Consistency:抑制连续 rollout 中的漂移与累计误差;
- Multimodal Distribution Alignment:对齐 latent 空间、像素空间及语义、动作分布。
MJD 还要求学生模型学习教师模型更完整的动作分布,并在 latent 空间与原始数据空间同时优化,避免模型通过「少动」换取稳定。最终在保持接近 8 步版本短时画质、指令遵循与长时稳定性的同时,将推理步数压缩至 2 步。
VMI:把近30B 模型塞进消费级显卡
A1 有效激活参数近 30 B,采用 8×8×4 高质量压缩率,每秒 token 吞吐需达同类实时视频方案的数十倍。Vivix 同步推出 VMI(Vivix Model Infra),从三个方向压缩推理成本:
- Encoder 与 Decoder 解耦:多模态 Encoder 走大 Batch 高吞吐路线,Real-Time Decoder Loop 走低延迟路线,二者拆成独立服务、独立扩缩容;推理阶段进一步引入 prefill/decode 分离与 KV Cache 传输层重设计。
- 原生 NVFP4 训推协同:将 Blackwell GPU 的 NVFP4 GEMM 设为目标推理路径,在训练与蒸馏阶段引入 low-precision-aware distillation,并加入针对视频生成的去噪误差校正,对齐训练精度与 NVFP4 推理 Kernel 的分布。
- 计算、通信、显存协同调度与 mega-kernel:构建 Compute-Communication-Memory Co-Scheduling Engine,将 Attention 通信、显存 Offload 与跨服务数据传输放入不同 CUDA Stream;将计算与通信融合进 Mega Kernel;通过 CUDA Graphs 把数百次 Kernel Launch 压缩为少量统一提交。
实测数据显示,VMI 单卡吞吐超过 10000 video tokens/s,多卡链路 PCIe 带宽利用率达 88% 以上;流式调度器响应新输入最短 300 ms,用户输入到画面出现可见反应的平均延迟低于 0.6 秒。
落地与边界
A1 与 W1 已开放内测,可通过官网及 API 开放平台申请体验。从官方披露来看,A1 的核心贡献是把「统一流式架构」「MJD 蒸馏」「原生 NVFP4」「计算-通信-显存协同调度」等模块拼成了一条端到端可实时运行的链路,使近 30 B 激活参数的多模态模型在消费级 GPU 上以近无损画质完成实时生成与交互。
与此同时,官方也坦承这仍距真正的「平行世界」很远,但「这通电话已经传来了第一声回音」。
