桃子桃子快讯
返回首页
开源

llama.cpp 合并 Ling-3.0-flash-VL 支持:124B 总参数的多模态 MoE 模型可本地推理

llama.cpp 新增 Ling-3.0-flash-VL 多模态模型支持,该模型总参数 124B、激活 5.5B,支…

2026.09.24 · 周四3 分钟阅读

llama.cpp 项目近期合并了一项 Pull Request,正式加入对 Ling-3.0-flash-VL 多模态模型的支持。这意味着开发者可以在本地推理框架中直接加载并运行该模型,覆盖文本、图像与视频输入,进一步丰富了 llama.cpp 生态中的多模态选项。

模型基本规格

Ling-3.0-flash-VL 在其前代语言模型 Ling-3.0-flash 的基础上扩展而来,主要变化是引入原生的图像与视频理解能力。模型整体规模较大但采用稀疏激活设计:

  • 总参数:124B
  • 每 token 激活参数:5.5B
  • 上下文窗口:最高 256K tokens
  • 支持模态:文本、图像、视频

稀疏 MoE 结构使得模型在保持多模态能力的同时,单次推理仅需激活约 5.5B 参数,对本地部署的显存和算力压力相对可控。

关键架构组件

PR 描述中列出了该模型的多项架构设计要点,主要围绕视觉信息的编码与长上下文处理展开:

  • 视觉编码:采用 ViT 视觉编码器抽取图像与视频特征,再通过一个两层 MLP projector 将视觉特征对齐到文本表征空间,实现统一的多模态理解与推理。
  • 时空位置编码:使用 VideoRoPE 同时编码空间位置与时间顺序,使模型能够捕捉视觉信号随时间的变化,支撑事件定位、长视频问答与视频片段编辑等任务。
  • 混合骨干网络:包含 42 层混合 backbone,按 5:1 的比例交替排列 KDA 层与 Gated MLA 层,从而在文本、图像、视频以及长 agent 任务历史之间实现高效的长上下文处理。
  • 稀疏 MoE:维持 124B 的总模型容量,同时将单 token 激活量控制在 5.5B,兼顾多模态表现与推理效率。

设计目标与潜在用途

官方表述将视觉定位为「贯穿理解、推理、规划、行动与验证全流程的输入」,而非简单的预处理信号。这一定位使得 Ling-3.0-flash-VL 适用于需要长时序视觉理解的 agent 工作流,例如:

  • 长视频问答与事件定位
  • 视频片段的检索与编辑辅助
  • 多模态 agent 中的视觉规划与验证

对本地生态的意义

llama.cpp 作为使用最广泛的开源本地推理框架之一,其支持的模型清单直接决定了社区可本地运行的能力范围。Ling-3.0-flash-VL 的加入,为希望在本地或私有环境中部署多模态长上下文模型的开发者提供了一项新选择,尤其是在其稀疏激活结构使得实际推理成本低于 124B 稠密模型的前提下。后续该模型在 llama.cpp 上的实际推理速度、显存占用与多模态效果,仍有待社区进一步测试与反馈。

信源