桃子桃子快讯
返回首页
行业动态

撞名 Anthropic 的 DeepSeek「外挂」刷屏:无人复现,Token 反翻倍

社区项目 J-Space Cognition Suite 宣称通过 Harness 让 DeepSeek V4-Pro…

2026.08.19 · 周三7 分钟阅读

近期,一个名为 J-Space Cognition Suite 的社区项目在 X 上迅速传播。项目方声称,在完全不修改 DeepSeek V4-Pro-0813 模型权重的前提下,仅依靠一套推理时 Harness(运行框架),就能让模型在多项 Agent 基准测试上的成绩显著提升,甚至超过 Fable 5。然而,截至 8 月 18 日,这一结论仍缺少最关键的一环:第三方复现。所有公布的提升数字均来自项目方自测,尚无独立团队在相同条件下跑出近似结果。同时有开发者实测发现,J-Space 并未降低开销,Token 消耗反而达到基线的 2–4 倍。

项目在做什么:不改权重,靠 Harness「榨干」V4 Pro

J-Space Cognition Suite 并不是经过微调的新模型,也没有产出新的 checkpoint。它本质上是套在 DeepSeek V4-Pro 运行时外面的一层 Harness,通过调整 Agent 任务执行流程改善最终表现。项目方认为,V4 Pro 在长链路 Agent 任务中存在两个主要问题:表征漂移(长任务中模型逐渐偏离最初目标、重复已完成步骤)与过早停止(模型在尚未真正完成时便宣布任务结束)。

针对这两个痛点,J-Space 在 Harness 层改进了重试、验证、记忆、状态维护和停止条件等外围机制。其假设是:DeepSeek V4 Pro 的权重本身已经蕴含更强的能力,只是现有 Agent 运行框架没有充分释放它们。这与当下越来越受关注的议题一致——同一个模型,在不同 Harness 下,可能表现出相当大的能力差距。

官方成绩亮眼,但复现为零

项目方在 GitHub 上公布的一组数字颇具说服力。加入 J-Space Cognition Suite 后,DeepSeek V4-Pro-0813 在 Terminal-Bench 2.1 上的成绩从 87.9 提升至 90.1,NL2Repo 从 61.5 提升至 73.4,Toolathlon-Verified 从 74.1 最高提升至 79.5。对项目相对有利的一点是,其公布的改造前基线与 DeepSeek 官方成绩接近,意味着没有通过人为压低基线来制造夸张涨幅。

但真正的争议在「改造后」。所有提升后的数字都来自项目方自己运行的 Benchmark,包括 Terminal-Bench、NL2Repo 与 Toolathlon-Verified 在内,尚未有项目之外的独立团队在相同模型、Prompt、Harness、工具权限和推理预算下复现类似结果。在 Agent Benchmark 越来越依赖外围 Harness 的背景下,仅看最终分数已难以说明全部问题——模型是否允许重试、可执行多少轮工具调用、是否拥有额外记忆模块、任务停止由谁判断、验证失败后是否自动回滚,都会显著影响最终成绩。

更直接的质疑来自实测。一位开发者用 DeepSeek 官方 API 测试 V4 Flash 后反馈:PI(基线)+ J-Space 的成本大约是裸跑的 2–4 倍;DSH + J-Space 的 Token 消耗比基线高约 50%。他的结论是「没有观察到成本节省效果,相反 Token 消耗更高」。另一位尝试过的开发者直言:「这就是炒作,而且是假的。我没能复现其中任何一项说法。」

撞名 Anthropic:此 J-Space 非彼 J-space

此次事件中最容易引发误解的是「J-Space」这个名字。2026 年 7 月,Anthropic 曾发表一项关于 Claude 内部神经表征的研究,关注一组被称为 J-space 的特殊表征,并尝试从全局工作空间理论(Global Workspace Theory)的角度理解模型内部信息如何被读取与传递,属于模型可解释性研究。

而围绕 DeepSeek V4 Pro 传播的 J-Space Cognition Suite 则是完全不同的社区项目:它是一个运行在 V4 Pro 外部的推理时 Harness,与 Anthropic 没有官方关系,也不是将 Anthropic 的 J-space 移植到了 DeepSeek。J-Space Cognition Suite 使用了类似「global workspace」的语言描述自身机制,但前者研究的是模型内部表征,后者处理的是模型外部 Agent 执行流程。两者虽然名称相似,但技术对象与用途完全不同。

与此同时,OpenCode 同期宣布「Operation Cheepseek: Phase 1 Complete」,Go 用户据称可以以 10 美元获得 30 美元额度,同时将 DeepSeek V4 Flash 的请求限额从每 5 小时 31,650 次下调至 3,800 次,降幅约 88%。由于这些信息都集中在 DeepSeek、Agent Harness 与 OpenCode 相关社区中,部分传播内容开始将 Operation Cheepseek 与 J-Space Cognition Suite 联系起来。但目前没有证据表明两者属于同一项目或协调行动,将二者直接合并并不准确。

Harness 进入「补短板」阶段

抛开复现争议,J-Space 所触及的问题并不特殊:长任务状态如何保存、模型何时应继续、何时真正完成、工具失败后如何恢复、上下文过长后如何避免遗忘,以及这些机制需要付出多少额外 Token 成本,已成为几乎所有 Agent Harness 共同面对的挑战。

这种变化在 DeepSeek Harness 最近的更新中已有所体现。8 月 17 日发布的 v0.1.0-rc.7 增加了 Codex 和 Claude Code 子代理任务的 Job Panel 管理、MCP/ACP 图片附件持久化,并修复了极简模式下 Persistent Bash 卡顿、大历史消息分页栈溢出以及 max-token 截断后会话无法继续等问题,新增 low 推理强度选项。比起「增加一个新工具」,这些更新更集中在子 Agent 调度、长会话、状态恢复与推理成本控制等系统层议题上。

围绕这些议题,社区与厂商正在沿两条路线分化:一方面,OpenCode 这类通用 Harness 将 Build、Plan、General、Explore、Scout 等 Agent 拆开,并内置 Compaction(上下文压缩)Agent 自动生成更短摘要;另一方面,模型厂商开始主动开发更贴合自身模型特性的原生 Harness。可以预见,随着 Agent 越来越「会做事」,如何判断它「什么时候算真正做完」,以及验证、重试带来的成本与延迟权衡,将成为下一阶段 Harness 演进的核心命题。

信源