社区作者推出 LLM「智能密度」指标,整合主流编程基准
r/LocalLLaMA 用户构建 Agentic Coding Index 并提出 Intelligence/Para…
一位 Reddit 用户在 r/LocalLLaMA 社区发布了一套自研的 LLM 编程能力评估框架,核心主张是用「智能密度」(Intelligence Density)这一概念,把不同参数规模的模型放在同一张榜单上做横向比较。作者认为,仅看绝对成绩会让大模型天然占优,而只看小模型又会被「勉强能写代码」的水平拉高排名,因此需要一种按参数规模归一化的指标。
评估对象:Agentic Coding Index
作者并未使用单一基准,而是构建了一个被命名为「Agentic Coding Index」的复合指数,纳入六类与智能体编程相关的公开基准,并设定固定权重:
- DeepSWE v1.1:权重 20%
- Code Arena Elo:权重 20%
- Terminal-Bench v4.0:权重 15%
- SWE-bench Pro:权重 15%
- Terminal-Bench v3.0:权重 13%
- Terminal-Bench v2.1:权重 12%
- LiveCodeBench v6:权重 5%
权重分配上,综合性较强的 DeepSWE 与竞技场 Elo 占比最高,历史版本 Terminal-Bench 共同承担 40%,LiveCodeBench 仅占 5%。基线 Norm 取值 50,使得综合得分大致围绕该刻度展开。
归一化公式与超参数
智能密度的定义为「单位参数承载的编程智能」,具体公式为:
Intelligence/Parameter = Scale × (Agentic Index / Norm) ^ Super_Linear_Exponent / sqrt(PCount + PLowerBound)
关键超参数解释如下:
- Scale:缩放常数,默认 1。
- Norm:归一化分母,设为 50,作为「中性基线」。
- Super_Linear_Exponent:超线性指数,取值 2.5354。作者表示该值刻意取非线性,目的是防止过小模型因「分数低但参数更少」而被误判为高密度,同时让真正具备自主编程能力的模型获得更强奖励。
- PCount:模型参数量(单位为十亿)。
- PLowerBound:参数下限,正则项,取值 8B,避免 1B 以下模型因分母过小而虚高。
由于分母采用 sqrt(PCount + 8B),随参数量上升,密度得分呈次线性衰减,这意味着中大规模模型必须用显著更高的综合得分才能维持密度优势。
数据来源与局限
作者强调,所有基准分数均来自模型厂商、经过同行评审的官方评测报告等可核实公开渠道,未使用社区投票或私人复现结果。但需指出,这是一项来自社区的个人分析方法,而非同行评审论文,公式中的 Scale 与 Super_Linear_Exponent 均由作者自行设定,不同超参数选择可能显著改变最终排名。
对于关注 agentic coding 与小模型性价比的开发者而言,这种「按参数归一化」的视角提供了一个有别于传统榜单的参考维度,但在采用其结论时仍应结合具体使用场景判断。
