2026.08.12 · 周三工具
←返回首页话题 · Topic
#vLLM
共 22 条相关资讯
2026.08.11 · 周二工具
Muse Glimmer 30B 启用 DFlash 推测解码需打 6 个补丁,速度提升约 2.3 倍
2026.08.10 · 周一工具
Intel 发布 LLM Scaler:在 Arc Pro B60/B70 上加速大模型与多模态推理
2026.08.10 · 周一工具
Ling-3.0-flash INT4 在 DGX Spark 上提速近一倍
2026.08.08 · 周六工具
KerasHub 集成 vLLM,可原生用于模型推理服务
2026.07.27 · 周一工具
开发者推出 llmux:统一管理 vLLM 与 llama.cpp 的模型参数切换
2026.07.24 · 周五行业动态
模型架构膨胀叠加国产算力崛起,AI Infra 该如何解题
2026.07.24 · 周五工具
Netflix 揭秘自研 LLM 推理平台:从 TensorRT-LLM 转向 vLLM
2026.07.21 · 周二开源
Qwen3.6-27B 推测解码横评:DFlash 领先,EAGLE3 在 vLLM 报错
2026.07.21 · 周二工具
NVFP4 KV 缓存在双 5060 Ti 上成功运行
2026.07.19 · 周日行业动态
Netflix 自建 LLM 推理平台:从 TensorRT-LLM 转向 vLLM 的生产实践
2026.07.07 · 周二研究论文
Ekka:自动定位 LLM 推理框架中的「静默错误」
2026.07.06 · 周一工具
AKM-CLR:为 vLLM 等 LLM 服务增加租户级治理层
2026.07.05 · 周日工具
Qwen 3.6 27B VLLM 基准测试:BF16 / FP8 / NVFP4 量化对比
2026.07.05 · 周日工具
Blackwell 实测 Qwen3.5 35B MoE NVFP4 量化
2026.07.03 · 周五研究论文
ELDR:面向 PD 分离 MoE 推理的专家局部性感知路由
2026.07.03 · 周五工具
GLM-5.2 128K 推理提速近 60%:vLLM 的 DCP 配置拷贝 bug 被揪出并修复
2026.07.02 · 周四工具
社区开发者为 Ornith 35B 引入 MTP 推测解码,推理提速约 18%
2026.06.30 · 周二开源
vLLM Semantic Router:把多模型协作搬进推理服务层
2026.06.29 · 周一工具
Llama 3.1 405B 单节点 8xA100 多 LoRA 部署实测
2026.06.29 · 周一开源
GLM-5.2 NVFP4 量化在 4×DGX Spark 跑通 128K 推理
2026.06.28 · 周日工具
