桃子桃子快讯
返回首页
工具

社区推出 Qwen 3.8 在 Intel Arc B70 上的 Helm 部署方案

用户基于现有 Intel Arc B70 推理方案,将其封装为 Helm chart,通过 vLLM 运行 Qwen 3…

2026.08.22 · 周六2 分钟阅读

近日,r/LocalLLaMA 社区用户 dtandersen 将 Sergiiob 此前发布的 Intel Arc Pro B70 推理 Cookbook 进一步封装为 Helm chart,使 Qwen 3.8 27B 能够在 Kubernetes 环境中便捷部署,目标硬件为 Intel Arc Pro B70 GPU。该方案在固定版本的 vLLM 上应用了相应补丁,目前可在 128K 上下文下获得稳定的推理性能。

性能表现

根据作者实测,在 128K 上下文长度下,推理吞吐大约在 40–70 tokens/s 之间波动,具体取决于负载是处于轻量空闲(spam)还是高强度运算(working hard)。当前观测到的稳定值约为 63 tokens/s。该数字可作为 Intel Arc Pro B70 消费级/专业级 GPU 运行 27B 级模型的参考基准。

技术构成

  • 基于 vLLM 推理框架,运行 Qwen 3.8 27B 模型权重。
  • 继承 Sergiiob 发布的 Intel Arc Pro B70 Inference Cookbook 中的驱动与补丁。
  • 通过 Helm chart 形式打包,支持在 Kubernetes 上一键拉起推理服务。
  • GitHub 仓库路径:vllm-charts / charts / vllm-qwen38-27b-xe。

适用场景与局限

该方案面向已配备 Intel Arc Pro B70、并希望以容器化方式管理大模型推理节点的用户;对于 NVIDIA GPU 用户并无直接价值,也并非通用生产级部署模板,更像是社区层面的实验性整合。

小结

整体而言,这是一次小而具体的开源工具整合:在现有 Cookbook 之上补齐了 Kubernetes 编排的拼图,方便 B70 用户更省心地启动 Qwen 3.8 27B 服务。其意义更多在于降低该特定硬件组合的部署门槛,而非推动模型或推理框架本身的演进。

信源