Glimmer 30B 长上下文实测:仅改一行配置即可扩至 512K
社区研究者在 DGX Spark 上对 Glimmer 30B 进行长上下文测试,仅修改 max_position_em…
社区开发者近日对 Glimmer 30B 模型进行长上下文能力实测,发现该模型仅需修改一行配置即可将上下文窗口从默认 128K 扩展至 512K,并在多项检索类基准上保持接近 100% 的准确率。这一发现得益于该模型与众不同的注意力架构设计。
独特的架构设计
与多数主流大模型不同,Glimmer 30B 并不依赖传统的位置编码来实现长上下文。仅宽度为 2048 token 的 SWA(滑动窗口注意力)层使用 RoPE,而全注意力 GQA 层则完全没有位置编码。模型似乎是通过上下文内容与 SWA 层之间的配合,自主推断远距离 token 关系。这是一项相当大胆的架构赌注,但从实测结果看,研发团队(据开发者推测为 Meta)成功将其落地。
测试方法
测试者使用 DGX Spark 设备,累计投入约 70 小时算力,对全精度模型在不同上下文长度下进行了系统评测。扩展方法极其简单:将 config 中的 max_position_embeddings 从 131072 改为 524288 即可,无需 YaRN、LoRA 或其他微调手段——而这些往往是其他模型扩展上下文时不可或缺的步骤。
主要基准结果
测试覆盖了多个长上下文能力维度:
- 针在草堆中(1 针与 4 针):512K 以内准确率均为 100%
- 多跳检索:512K 以内准确率 100%
- 语义查找:512K 以内准确率 100%
- 跨上下文计数:从 32K 的 95% 逐步退化,385K 降至约 60%,512K 仅剩 22%
- 模拟智能体会话记忆:385K 以内稳定,随后略有回落
- NoLiMa:全程 512K 噪声较大但表现稳定
- LongBench v2、LongCodeQA:512K 内性能与基线持平
测试者还尝试了 InfBench 套件,但结果噪声较大,仍在进一步处理中。
开源与局限
完整的研究报告、脚本与原始数据已开源在 GitHub:https://github.com/lobanov/muse-glimmer-long-ctx 。需要指出的是,该模型在「跨上下文计数」任务上的退化较为明显,说明简单配置扩展并非万能,长程精确推理仍存在能力边界;同时单卡测试的硬件成本和算力门槛也提示,这一架构优势需要在更大规模部署中进一步验证。
