Jev 被指并非新技术:营销瞄准只知 LLM 的用户
Reddit 用户质疑 Jev 所谓「系统一模型」并非新范式,基准测试显示传统分类器在 Banking77 上优于 Je…
近日 Reddit r/LocalLLaMA 板块一则高赞贴文对初创产品 Jev(定位为「System One Models」)提出系统性质疑,指出其宣称的「新范式」实为现有零样本分类技术的重新包装,并给出了指向第三方仓库的对照实验数据。
核心行为并不新鲜
发帖人列举了 Jev 公开描述的特性:在受限选项上输出概率、不做自回归生成、不会输出无效类别、支持推理时定义标签。贴文认为,这些都是零样本分类器的常规能力,NLI 零样本分类器、embedding 模型、cross-encoder 以及 reranker 在过去多年中已实现这些能力的不同组合,并不构成新的模型类别。
与 LLM 对比不公平
贴文承认,把 Jev 拿来和 LLM 比较,分类任务上更快、更便宜并不令人意外——专用分类器在受限选项的判别任务上本就应该优于让大模型自回归生成答案。但若要论证「新范式」,理应与现有强分类器正面比较,而非仅以 LLM 为对手。该贴文认为,这种比较方式更适合面向把 AI 等同于 LLM 的受众。
基准数据不利
贴文引用 GitHub 仓库 ickma2311/jev-baselines-eval 中 Banking77 的实验结果:
- BGE-small + logistic regression:93.3%,本地推理约 9 ms
- Jev:83.2%
此外,文中提及被 ICLR 收录的 BTZSC 基准覆盖 22 个数据集,对数十种零样本分类器做过系统评估,但目前尚未见到 Jev 在这一基准上的完整表现。
结论:尚无证据支撑「范式转移」
发帖人明确表示,Jev 可能是一款不错的产品,其未公开的架构或 RLCD 训练方式或许确有创新,但现有公开证据至多只能说明「专用分类器在分类任务上比 LLM 更省更快」,这是已知结论。只有当读者把 AI 默认理解为 LLM 时,这一点才显得像新发现。
截至目前,Jev 团队尚未在公开渠道回应上述基准对比。
