桃子桃子快讯
返回首页
模型发布

通义 Qwen 推出全模态代理模型 Qwen3.8-Omni-Flash

Qwen 发布首个全模态模型 Qwen3.8-Omni-Flash,支持音视频理解、推理与工具调用,1M 上下文,视频成…

2026.09.18 · 周五2 分钟阅读

通义千问 Qwen 正式发布其首个全模态代理模型 Qwen3.8-Omni-Flash,将原生音视频理解、推理与工具调用能力整合在单一模型中,覆盖「理解内容—规划任务—调用工具—交付结果」的完整链路。围绕该模型,Qwen 团队还同步开源了 Qwen-MM-Plugins 与 Qwen-Live Harness 两项配套工具,供开发者构建长流程音视频应用。

核心能力:音视频联合推理与代理编排

Qwen3.8-Omni-Flash 的定位是「能完成任务的音视频智能」,模型可以同时对画面与声音进行联合推理,并在长链路工作流中调度外部工具。官方给出的典型应用场景包括:

  • 自动剪辑 Vlog
  • 短视频翻译
  • 将长影片浓缩为剧情回顾

在音视频能力上,Qwen 表示该模型已接近 Gemini 3.8 Flash 的水平;在代理能力上,在 WildClawBench-MM 与 UniClawBench 两个评测上平均提升 19.5 分。

1M 上下文与代理式感知

模型支持 1M token 上下文,并引入「代理式感知」(agentic perception)机制:面对长视频时主动探索内容、定位关键片段,而非被动地逐帧理解。官方数据显示,在 OmniVideoBench 上该方式相比静态理解减少 51.8% 的 token 消耗,显著降低长视频处理开销。

成本大幅下降

相比上一代 Qwen3.5-Omni-Plus,Qwen3.8-Omni-Flash 的视频输入成本下降约 89%,官方称这使得长篇音视频理解与代理工作流的部署成本进入更可承受的区间。

接入与生态

新模型及配套工具已通过以下渠道开放:

  • Blog:官方技术博客已上线
  • Qwencloud:云端推理服务
  • Qwen Studio:在线体验环境
  • API:开发者接口
  • Qwen-MM-Plugins:插件集合,已开源
  • Qwen-Live Harness:即将上线

Qwen 团队在公告中表示,期待开发者基于 Qwen3.8-Omni-Flash 构建音视频驱动的代理应用。

信源