重度量化 Qwen3 在 16GB 显卡上完成光学 TMM 编码,近百分钟 10.8 万 token
用户在 16GB Quadro 上以 IQ3_XXS 量化运行 Qwen3-27B,历经 100 分钟产出 10.8 万…
一名用户在 Reddit r/LocalLLaMA 板块发布了一项技术测试:在仅有 16GB 显存的 NVIDIA Quadro RTX 5000(Turing 架构)上,以 IQ3_XXS 重度量化的 Qwen3-27B 模型,从零实现多层薄膜的相干光学传输矩阵法(TMM)。完整任务耗时 99 分 53 秒,模型共产生 107,594 个输出 token,最终提交的 tmm.py 在测试用例上输出了正确的反射率与透射率。
硬件与运行栈
测试平台是一台 Ubuntu 24.04.4 LTS 工作站,配置如下:
- GPU:NVIDIA Quadro RTX 5000,16 GB,SM 7.5(Turing)
- CPU:Intel Xeon Silver 4116,12 核 24 线程
- 系统内存:256 GB
- 驱动:NVIDIA 580.173.02
模型与推理栈:
- 目标模型:
unsloth/Qwen3.8-27B-GGUF,量化文件Qwen3.8-27B-UD-IQ3_XXS.gguf,约 10.93 GB - 投机解码 draft:
incoai/Qwen3.8-27B-DFlash2-GGUF(Q4_K_M,约 1.14 GB) - llama.cpp 分支:自定义实验性 DFlash2 构建,适配 SM 7.5
- 上下文:100,352 token,K/V 缓存均为 q4_0,Flash Attention 开启
- 速度:普通回答约 29–35 tok/s,规律性输出最高约 42 tok/s
- 加载后剩余显存约 0.8–1.1 GB
前端使用 DeepSeek Harness 0.1.1-rc.2 通过 OpenAI 兼容接口接入 llama.cpp,承担文件与 shell 工具调用并实时展示推理过程。
任务要求
提示词要求模型用纯 Python(仅 math 与 cmath)实现相干光学传输矩阵法,禁止调用光学库或 NumPy。具体功能包括:
- 复折射率
N = n + i*k - 复 Snell 角(含物理正确的平方根分支)
- TE/s 与 TM/p 两种偏振
- 任意吸收薄膜的特征矩阵
- 功率反射率与透射率
- 测试堆栈:Air | SiO₂ 100 nm | Au 30 nm | Si,波长 600 nm,入射角 45°
百分钟推理实录
整次 Agent 会话持续 99 分 53 秒,共 22 个模型步骤、21 次工具调用、107,594 个输出 token。其中首次模型调用单独产出 43,033 token,耗时约 27 分钟,才首次写出 tmm.py。
会话中共触发三次上下文压缩:前两次各花近 6 分钟生成 checkpoint,却因摘要自身触顶 token 上限而失败;第三次才成功。三次压缩累计耗时接近 18 分钟。
模型在反复调试自己的验证器
作者观察到一个值得关注的模式——模型的实现本身在很早就已经正确,但剩余绝大部分时间被花在修正其自行发明的多种验证方法上:
- 递归反射率验证器:先后出现 base case 差一错误、索引越界,最后写出
exp(2j*1j*delta),由于 Python 中2j*1j == -2,实际计算的是exp(-2*delta)而非exp(2i*delta)。第三次压缩曾定位到这一处错误,但恢复后模型并未沿用该修复,最终放弃该验证器。 - 正向场推进:最初完全遗漏传播因子
exp(±i*delta),修正后单层情况通过;多层仍失败,根源是矩阵乘法方向与边界方程约定的传播方向不一致。 - 四分之一波长增透膜测试:因验证器中预期折射率取值错误而一度被误判为失败,改为
n_layer = sqrt(n0*n_sub)后反射率收敛到约 1e-32。
作者也指出模型在分支与符号选择上给出了一种工程上足够、但不具完全普适性的做法:对被动正折射率材料,通过先取一个平方根分支、再根据正向波矢的虚部方向翻转符号来确定 cos_j,避免了复 arcsin 的复杂处理;不过该方法缺少容差与正向 Poynting 向量的 tie-break,也未处理增益介质与有吸收的入射介质。
意义与局限
测试显示,IQ3_XXS 这一档位的重量化 Qwen3-27B 仍能完成具有物理意义的数值实现任务,并在受限显存(16 GB)下借助投机解码保持可用生成速度。但模型在长程推理中表现出严重的自我验证脆弱性:实现先于自洽验证成熟,且多次压缩后丢失先前已识别的修复,体现重度量化与极长上下文场景下的稳定性短板。对于希望在消费级硬件上用本地大模型承担严肃数值计算工作的用户而言,这是一份有数据支撑的工程实测记录。
