研究论文
跨厂商字节一致推理:72B 模型在 AMD 与英伟达上输出可验证
研究者发布协议,可让 72B 稠密 / 47B MoE 活跃参数的大模型在英伟达 H100 与 AMD MI300X 上…
2026.08.26 · 周三约 3 分钟阅读
一项于 2026 年 4 月发布在 Hacker News 的研究白皮书提出了一套面向前沿大模型的「跨厂商字节一致推理 + 可验证收据」协议。该方案在英伟达 H100 与 AMD Instinct MI300X 上对 720 亿稠密参数 / 470 亿 MoE 活跃参数规模的模型执行推理时,可以产出完全字节一致的输出,并附带由 Ed25519 签名、可离线核验的标准化收据,旨在为 AI 推理结果提供与硬件厂商无关的「伪造抗性」(fabrication soundness)。
核心构造
方案由三部分组成:
- 推理底座:同一模型可在 H100 与 MI300X 上运行,并在每次启动新进程后仍保持输出哈希逐字节一致;在单卡 bf16 + eager attention 配置下,AMD 与英伟达 50 个 token 以上的连续生成结果哈希完全一致。
- CBOR 收据模式:采用 Canonical CBOR 编码,对域分离后的消息生成 Ed25519 签名;Go、Python、Rust 三种实现间也保持端到端字节一致,AMD 上产出的收据可在 x86 英伟达硬件上的 Rust 验证器中逐字节核验通过。
- 概率抽检验证:对收据进行小样本重放并比对,不一致即拒收;理论正确性由形如 1−(1−f)^k 的引理给出,并在 70 组对抗–验证者配置上跑 70 万次蒙特卡洛实验进行实证。
跨硬件一致性的边界
在所有测试配置中,单进程内的输出哈希都能与重新启动进程的结果对齐。但在大规模张量并行的拓扑差异下,二者按预期出现分歧:
- 双卡张量并行时,英伟达侧的 NCCL ring all-reduce 与 AMD 侧的 RCCL fabric all-reduce 路径不同,导致哈希不再一致。
- 每种配置各自仍然「单独确定性」,即在同一硬件、同一拓扑下重复运行仍可复现。
这意味着该协议并不是「所有硬件全宇宙一致」,而是「单硬件拓扑内确定性 + 跨厂商少量配置下严格一致」的务实组合。
性能与稳健性数据
- 单核上一次收据验证耗时约 80 微秒。
- 11 000 次顺序模型推理(热启动)未出现一次字节一致性失败。
- 白皮书明确指出整套方案未使用零知识证明,目标是保持生产级推理成本的同时提供签发方独立的可验证性。
局限与适用面
该工作的重点并非发布新模型,而是提供一种「推理原语」。对于需要 AI 推理结果具备离线可追溯性与跨硬件可重现性的场景——例如受监管行业的审计、合作方之间的模型输出一致性约束——这套字节一致加签名收据的组合具有实用价值。但读者也应注意:当前披露的来源为 Hacker News 贴文与白皮书,作者团队与机构归属未在公开摘要中给出,结论的独立复现仍需等待社区验证。
