桃子桃子快讯
返回首页
工具

免训练将 Python 计算图编译为 Transformer 权重

开发者开源 torchwright 编译器,可用 Python 计算图直接生成 Phi-3 架构权重,全程无需训练。

2026.07.25 · 周六3 分钟阅读

一位独立开发者近日在 Reddit r/MachineLearning 板块开源了一个名为「torchwright」的编译器:用户只需用普通 Python 定义计算图,编译器便会直接产出标准 Phi-3 架构的 Transformer 权重文件,整个过程不涉及任何训练步骤,生成的检查点可被原生 Hugging Face 接口直接加载。

项目核心思路

该项目聚焦于一个基础性问题——「Transformer 究竟能表达哪些算法」,并试图把「能表达的算法」与「能从数据中学会的算法」区分开来。开发者构建了一套编译器,将普通 Python 中的计算图映射为 Transformer 权重,最终输出一个标准 Phi-3 架构的检查点。其关键特性包括:

  • 使用原生 Hugging Face 加载,无需自定义代码或 trust_remote_code
  • 全流程零训练
  • 以 Phi-3 这类业界主流架构为编译目标,生态兼容性较好

与既有工作的区别

将算法直接编码进 Transformer 权重并非全新思路,开发者在原帖中明确提到了两项先驱工作:

  • RASP:一种可将编程原语映射到 Transformer 子层的编程语言
  • Tracr:可将 RASP 程序编译为实际权重的编译器

相较之下,torchwright 强调两点差异:一是直接用普通 Python 表达计算图,降低了使用门槛;二是以 Phi-3 这类现成架构为编译目标,使输出可被标准 Hugging Face 接口直接加载,而无需任何定制运行时。

资源与可复现性

作者提供了完整的配套材料,方便感兴趣的研究者自行复现与验证:

  • 技术博文(阐述构造原理与设计动机):ood.dev/posts/torchwright-intro/
  • GitHub 代码仓库,内含 12 个可直接运行示例:github.com/physicsrob/torchwright
  • 提交者署名为 Reddit 用户 /u/notforrob

研究价值与局限

该项目对机制可解释性、Transformer 表达能力研究等方向具有参考价值:研究者可以在不训练大模型的前提下,直接构造出执行特定算法的 Transformer 权重,从而更纯粹地研究「结构能做什么」这一议题。不过,作为一项个人项目,目前仍存在一些可改进之处:

  • 缺少与 Tracr 等既有工具的系统性基准对比
  • 尚无学术论文层面的同行评议
  • 在更大规模架构或更复杂计算图上的适用性数据暂未披露

对于关注「模型结构 vs. 学习内容」这一议题的研究者和工程师而言,torchwright 提供了一个轻量、可复现的实验入口。

信源