工具
Neural Drive:浏览器内运行的赛车世界模型
浏览器内运行的 SuperTuxKart 世界模型,基于 ConvVAE 与 DiT,参数 1.3 亿,支持 k=2 蒸…
2026.07.20 · 周一约 3 分钟阅读
Neural Drive 是一个完全在浏览器中运行的 SuperTuxKart 世界模型,由开发者 asankhs 发布在 Hugging Face Spaces。与传统游戏引擎不同,这一模型只根据过去 7 帧画面和玩家操作直接预测下一帧图像,推理过程中没有任何游戏引擎在背后支撑。
技术架构
模型沿用了当前世界模型研究中常见的「VAE 编解码 + DiT 动力学 + 蒸馏采样」组合:
- 视觉编解码器:ConvVAE,通道数 8,空间下采样 8 倍,负责图像与潜空间之间的转换
- 动力学模块:LatentDiT(dim 768、depth 12、patch 3),参数约 1.308 亿,负责在潜空间预测下一帧
- 采样策略:rectified flow 配合 per-frame diffusion forcing,再经过 few-step 蒸馏,最终仅需 k=2 步即可生成一帧
输入分辨率为 384×192,动作空间为 6 维,分别对应加速、刹车、左转、右转、氮气和漂移。训练在 PyTorch 中完成,动作标签从游戏回放中自动提取,无需人工标注。
两种运行时
项目以同一套权重发布两套推理入口:
- PyTorch 版本:CUDA/CPU 上运行,fp32 精度,用于训练和作为参考实现
- ONNX/WebGPU 版本:可在任意现代浏览器中加载,权重转换为 fp16,借助访问者本地 GPU 加速
其中 Web 版本将 7 帧上下文预填充一次后,把 k=2 步去噪内联到同一计算图,并通过图内 KV-cache 复用,避免在每一步重新构建上下文,从而把实时帧生成压到浏览器可接受的延迟之内。单图生成器大小约 262 MB,VAE 解码器则保留 fp32 以避免画面退化。
权重与文件
仓库随模型一并发出的关键文件包括:
dit.pt:动力学教师模型,训练 100k 步,使用 k=8 采样dit_distilled.pt:蒸馏后的 k=2 学生模型vae.pt:ConvVAE 编解码器decoder_big.pt:更大的 LPIPS 解码器web/genframe_fp16.onnx:浏览器内单图生成器(fp16)web/vae.onnx:fp32 的 VAE 解码器
演示已托管在 Hugging Face Spaces,开发者可直接打开浏览器试玩,体验以神经网络「替代」游戏引擎的实时效果。
