桃子桃子快讯
返回首页
工具

Intel 发布 LLM Scaler:在 Arc Pro B60/B70 上加速大模型与多模态推理

Intel 开源 LLM Scaler 推理栈,支持在 Arc Pro B60/B70 GPU 上运行 vLLM、Com…

2026.08.10 · 周一5 分钟阅读

Intel 近日持续更新其面向 Arc Pro B60 与 B70 工作站 GPU 的开源推理栈 LLM Scaler,目标是为这一代 Intel 显卡提供与主流框架兼容的生成式 AI 运行方案。LLM Scaler 通过标准化框架 vLLM、ComfyUI、SGLang Diffusion、Xinference 等承载文本生成、图像生成与视频生成任务,并在 Arc Pro B60/B70 上对当前主流开源大模型进行性能调优。

两条主线:vLLM 文本推理与 Omni 多模态

LLM Scaler 拆分为两条独立产品线分发。llm-scaler-vllm 面向文本与多模态大模型的 vLLM 推理;llm-scaler-omni 则面向基于 ComfyUI 的图像/视频生成工作流以及 Xinference 等分布式推理框架。两者均以 Docker 镜像形式发布,遵循 Intel 开源仓库的版本号管理。

最新一波更新集中在 2026 年上半年:vLLM 主线升级至 0.21.0-b2,正式支持 Multi-token Prediction(MTP)与 LoRA Serving,可用于 Qwen3.6-27B、Qwen3.6-35B-A3B、gemma-4-31B-it、gemma-4-26B-A4B-it 等模型;同期引入 Qwen3.6-27B-FP8、Qwen3.6-35B-A3B-FP8 等块级预量化模型,进一步压低显存占用。Omni 主线同步升级至 0.1.0-b8,ComfyUI 升级到 0.27.0,并扩展了 Z-Image-Turbo、Hunyuan-Video-1.5 文生视频/图生视频等多 XPU 工作流。

支持的模型清单与量化精度

LLM Scaler vLLM 维护了一份详尽的模型兼容矩阵,覆盖主流开源权重。核心覆盖范围包括:

  • DeepSeek 系列:DeepSeek-R1(1.5B/7B/14B/32B/70B 的 Llama 与 Qwen 蒸馏版)、DeepSeek-V2-Lite、DeepSeek-Coder-33B;
  • Qwen 系列:Qwen3 全系(8B/14B/32B/30B-A3B/235B-A22B)、Qwen3-Coder-30B-A3B-Instruct、Qwen3-Coder-Next、Qwen3.5/3.6-27B、Qwen3.5/3.6-35B-A3B、Qwen3.5-122B-A10B、QwQ-32B;
  • Gemma 系列:gemma-4(12B/31B/26B-A4B)及 diffusiongemma(26B-A4B);
  • Llama 3.1 系列(8B/70B)、Mistral / Ministral / Mixtral、GLM-4 系列(9B/32B/4.5-Air/4.7-Flash);
  • 多模态模型:Qwen2-VL、Qwen2.5-VL、Qwen3-VL 全系、MiniCPM-V-2.6/4/4.5、MinerU 2.5;
  • 其他:Hunyuan-0.5B/7B-Instruct、Seed-OSS-36B-Instruct、MiroThinker-v1.5-30B、CodeGeex4-All-9B、ERNIE-4.5-vl 等。

在量化方面,LLM Scaler 提供 FP16 推理、动态在线 FP8 与 INT4 量化、外加预量化 FP8 模型加载,并对 Qwen3.5-122B-A10B 支持 MXFP4 与 GPTQ 离线量化。其中 DeepSeek-V2-Lite、GLM-4 等模型在使用上附有额外环境变量与精度限制,需要按文档提示配置。

关键能力概览

LLM Scaler vLLM 主线的能力包括:基于 CCL(Collective Communication Library)的 P2P 或 USM 多卡通信;INT4/FP8 在线量化与预量化模型支持;Embedding 与 Reranker 模型原生支持;文本与多模态模型同栈运行;Omni(语音+图像+文本)模型实验性支持;Tensor Parallel、Pipeline Parallel、Data Parallel 三种并行策略;自动探测最大可用 Context Length;内置 Multi-Modal WebUI;并提供 BPE-Qwen 分词器以提升 Qwen 系模型的兼容度。

适用场景与局限

LLM Scaler 的目标用户是采购或持有 Intel Arc Pro B60/B70 工作站 GPU、需要在 x86 + Intel GPU 平台上运行开源大模型的开发者与小型工作室。框架层的选择面与 NVIDIA CUDA 生态相比仍偏窄,模型覆盖以 LLM 与多模态扩散模型为主,社区使用门槛也高于 NVIDIA 官方 vLLM 镜像。但对于希望摆脱单一 CUDA 依赖、或已有 Intel 工作站硬件的团队,LLM Scaler 是当前 Intel 官方维护的最完整的推理栈方案。

信源