Hetzner 推出 LLM 推理实验服务,仅支持单一开源模型
德国云服务商 Hetzner 上线 OpenAI 兼容的推理 API 实验项目,目前仅提供 Qwen3.6-35B-A3…
德国独立云服务商 Hetzner 悄然上线了一个名为「Hetzner Inference」的 LLM 推理实验项目。该项目以 OpenAI 兼容 API 的形式向用户开放,但官方明确强调:目前没有计费体系、没有 SLA、没有生产可用性保证,模型也仅有一款。其意图更像是「先把东西摆出来,看用户怎么用」,而非正式发布。
服务形态与可用模型
Hetzner Inference 部署在 Hetzner 自有基础设施之上,用户在 Experiments 控制台创建 API Token 后,将 OpenAI 客户端的 base URL 指向 Hetzner 即可像调用其他推理服务一样使用。
目前唯一可选模型是 Qwen/Qwen3.6-35B-A3B-FP8:
- 总参数 350 亿(Mixture-of-Experts 架构),激活参数 30 亿;
- 支持文本与图像输入,上下文窗口 262K;
- 权重采用 FP8 量化。
这是一个体积适中、便于单机部署的模型,适合作为 API 实验的起点。Hetzner 还发布了一个简短的教程,指导用户把 OpenCode 连接到该 API,无需编写代码即可试用。
实测表现
由于 API 与 OpenAI 协议兼容,集成几乎零门槛。一位开发者于 2026 年 7 月 23 日进行了一轮小型测试,关键数据如下:
- 在已建立的连接上,7 次短请求的首 token 中位延迟约为 153 毫秒;
- 5 次较长生成(上限 512 token)平均输出速度约为 224 token/s。
这一速度相当可观,但作者也指出,单次单客户端的测试不能等同于 SLA,也无法反映高并发场景下的表现。模型本身的能力测试中:格式与检索指令大体能遵循,图像处理正确,但在两道简单算术题上翻车——属于「略弱但可用」的小型 LLM。
值得注意的是,请求中可以使用一个未在官方文档中出现的 enable_thinking 选项,开启后可抑制模型在生成可见回答前消耗大量预算进行推理。作者建议暂勿围绕该参数构建关键功能。
战略意图的推测
作者认为,比当前模型本身更值得关注的,是 Hetzner 为什么要试水推理业务。
开权重模型的推理已成商品化市场:各家厂商可以下载相同权重、运行相似的服务框架、暴露兼容 API,用户也可以借助 OpenRouter、LiteLLM 等工具在不同供应商之间无缝切换。这意味着利润空间被压缩,只有具备显著优势的厂商才能站稳脚跟——例如:能够低成本采购与运营 GPU 硬件;具备出色的资源调度能力以维持高利用率;或本就拥有闲置算力可以变现。
Hetzner 的核心竞争力正是「低价买硬件、自建数据中心、用极致的运营效率压低成本」。如果它愿意把推理做成又一个低毛利的基建产品,从能力上完全说得通。同时,推理 API 可以把原本独占给单客户的裸金属 GPU 容量分摊给众多用户,提升整体利用率,这对一家以裸金属租赁为主营业务的公司而言是顺理成章的延伸。
以上均为作者基于产品形态的推断,并无任何内部信息佐证。
硬件能力仍是关键疑问
Hetzner 当前公开的独立 GPU 服务器仅使用两类显卡:
- NVIDIA RTX 4000 SFF Ada Generation(20 GB 显存);
- NVIDIA RTX PRO 6000 Blackwell Max-Q(96 GB 显存)。
其中 96 GB 版本足以胜任中小规模模型的推理。当前 Qwen 模型的 FP8 文件约 38 GB,再加上上下文缓存与服务端开销,单卡可覆盖。但这些都属于工作站级 GPU,而非运行真正大型开源模型所需的「密集多卡系统」。
以 GLM-5 为例:总参数 7540 亿,官方部署方案需拆分到 8 张 GPU 上。即便激进量化,所需显存也在数百 GB 级别,只能依靠 B200/B300 级别的高速互联多机方案。Hetzner 目前并未公开提供此类硬件。
当然,实验性 API 后端完全可以采用与公开裸金属产品线不同的硬件配置,这一点无法从外部判断。
后续看点
- 若 Hetzner 始终仅服务一两个小模型,则难以成为具有分量的推理供应商;
- 若该实验是更大规模 GPU 部署与推理业务的起点,则可能改变欧洲低成本 AI 推理的市场格局。
文章原帖在此处被截断,未给出最终判断。读者可持续关注 Hetzner 是否会扩展模型覆盖、引入计费以及公开更大规模的 GPU 配置。
