桃子桃子快讯
返回首页
模型发布

通义发布 Qwen3.8-Omni-Flash:首款全模态智能体模型

阿里通义推出首款全模态智能体模型,支持音视频理解与工具调用,1M 上下文,性能接近 Gemini 3.8 Flash。

2026.09.18 · 周五2 分钟阅读

阿里通义千问团队近日发布 Qwen3.8-Omni-Flash,官方将其定位为「Qwen 首款围绕智能体能力打造的全模态模型」。该模型原生支持音视频理解、推理与工具调用,可在单一模型内完成「理解内容—规划任务—调用工具—交付结果」的全链路工作流,瞄准长视频自动化处理、跨模态内容生产等场景。

核心能力与性能表现

根据官方披露,Qwen3.8-Omni-Flash 在音视频综合能力上「接近 Gemini 3.8 Flash」,并在智能体相关评测中实现明显跃升:

  • 在 WildClawBench-MM 与 UniClawBench 上,智能体性能平均提升 +19.5 分;
  • 支持 1M token 上下文窗口,配合智能体感知机制,可在长视频中主动探索并精确定位关键片段;
  • 在 OmniVideoBench 上,相比静态理解方式节省 51.8% 的 token 使用量。

官方介绍,该模型能够对所见所听内容进行联合推理,并在长流程任务中编排多种工具,典型用例包括自动剪辑 vlog、翻译短视频、将长片转为剧情摘要等。

成本与效率改进

在新模型上,通义重点优化了长音频视频场景下的推理与使用成本:

  • 视频输入成本相较上一代 Qwen3.5-Omni-Plus 降低约 89%;
  • 1M token 长上下文与智能体感知能力结合,使长视频理解与多步骤工作流在经济性上更易落地。

配套开源工具

为帮助开发者基于 Omni 能力构建应用,通义同步开源了 Qwen-MM-Plugins 与 Qwen-Live Harness 两项配套工具:

  • Qwen-MM-Plugins:用于扩展多模态处理能力的插件集合;
  • Qwen-Live Harness:面向实时/长流程音视频智能体应用的评测与运行框架。

此次发布延续了通义在开源权重模型与多模态方向的密集投入,结合 1M 长上下文与工具调用能力,进一步丰富了 Qwen 系列在智能体赛道的布局。

信源