研究论文
新论文称 Qwen 小模型集成可在 LiveCodeBench 上接近 Fable 5
Reddit 用户讨论一篇新论文:多个 Qwen3.8-27B 集成据称在 LiveCodeBench Hard 上达到…
2026.08.28 · 周五约 2 分钟阅读
一篇新发布的论文提出,用若干个 Qwen3.8-27B 模型并行运行(ensemble),即可在 LiveCodeBench Hard 编码基准上达到与 Fable 5 相当的准确率。作者还表示,将该方案与 GPT Terra 搭配使用时,可在 LiveCodeBench 上以约五分之一的成本取得 Fable 5 级别的编码表现。论文与对应代码已分别在 arXiv(2608.26480)与 GitHub(slee-persis/GVS5H)公开。该帖在 r/LocalLLaMA 上引发讨论,原作者主要询问社区是否有人复现过类似方案,以及这一思路是否值得进一步尝试。
论文核心主张
- 在 LiveCodeBench Hard 上,多个 Qwen3.8-27B 集成后的准确率与 Fable 5 持平。
- 与 GPT Terra 组合后,可在保持同等准确率的前提下将成本压缩到约 1/5。
- 作者将代码以 GVS5H 的形式开源在 GitHub。
尚待验证之处
- 帖中并未提供具体数字(如 token 数、通过率提升幅度、单次推理成本对比),读者无法直接量化收益。
- 「Fable 5」与「GPT Terra」并非社区熟知的模型代号,作者未说明其具体来源与版本,结论的可比性有待厘清。
- 论文尚未经过同行评审,集成方案在更广泛基准与真实业务负载下的稳定性未知。
社区反馈方向
讨论中,用户普遍关心三方面:一是多个 27B 级模型同时跑所需的显存与延迟开销,是否会抵消成本优势;二是集成策略本身(投票、采样合并还是更复杂的路由机制);三是是否有人愿意复现并贴出 LiveCodeBench 实测分数。整体氛围偏向观望,少数人表示愿意在小规模任务上试跑。
