桃子桃子快讯
返回首页
工具

Neural Drive:浏览器内运行的赛车世界模型

浏览器内运行的 SuperTuxKart 世界模型,基于 ConvVAE 与 DiT,参数 1.3 亿,支持 k=2 蒸…

2026.07.20 · 周一3 分钟阅读

Neural Drive 是一个完全在浏览器中运行的 SuperTuxKart 世界模型,由开发者 asankhs 发布在 Hugging Face Spaces。与传统游戏引擎不同,这一模型只根据过去 7 帧画面和玩家操作直接预测下一帧图像,推理过程中没有任何游戏引擎在背后支撑。

技术架构

模型沿用了当前世界模型研究中常见的「VAE 编解码 + DiT 动力学 + 蒸馏采样」组合:

  • 视觉编解码器:ConvVAE,通道数 8,空间下采样 8 倍,负责图像与潜空间之间的转换
  • 动力学模块:LatentDiT(dim 768、depth 12、patch 3),参数约 1.308 亿,负责在潜空间预测下一帧
  • 采样策略:rectified flow 配合 per-frame diffusion forcing,再经过 few-step 蒸馏,最终仅需 k=2 步即可生成一帧

输入分辨率为 384×192,动作空间为 6 维,分别对应加速、刹车、左转、右转、氮气和漂移。训练在 PyTorch 中完成,动作标签从游戏回放中自动提取,无需人工标注。

两种运行时

项目以同一套权重发布两套推理入口:

  • PyTorch 版本:CUDA/CPU 上运行,fp32 精度,用于训练和作为参考实现
  • ONNX/WebGPU 版本:可在任意现代浏览器中加载,权重转换为 fp16,借助访问者本地 GPU 加速

其中 Web 版本将 7 帧上下文预填充一次后,把 k=2 步去噪内联到同一计算图,并通过图内 KV-cache 复用,避免在每一步重新构建上下文,从而把实时帧生成压到浏览器可接受的延迟之内。单图生成器大小约 262 MB,VAE 解码器则保留 fp32 以避免画面退化。

权重与文件

仓库随模型一并发出的关键文件包括:

  • dit.pt:动力学教师模型,训练 100k 步,使用 k=8 采样
  • dit_distilled.pt:蒸馏后的 k=2 学生模型
  • vae.pt:ConvVAE 编解码器
  • decoder_big.pt:更大的 LPIPS 解码器
  • web/genframe_fp16.onnx:浏览器内单图生成器(fp16)
  • web/vae.onnx:fp32 的 VAE 解码器

演示已托管在 Hugging Face Spaces,开发者可直接打开浏览器试玩,体验以神经网络「替代」游戏引擎的实时效果。

信源