GPT-6 Luna 与 Opus 5.5 的中国影子
Anthropic 与 OpenAI 新模型在推理路径与缓存架构上分别借鉴姚顺雨与 DeepSeek 的思路,折射 AI…
Anthropic 近日发布的 Opus 5.5 与 OpenAI 推出的 GPT-6 Luna,在技术路线上呈现出与姚顺雨「推理即智能」理念、以及 DeepSeek 工程方案高度相似的特征。这并非巧合,而折射出 AI 行业从预训练堆算力向推理时算力与上下文效率优化的重心转移。
Opus 5.5:把智能搬进上下文
在 Artificial Analysis 智能指数的「跑完一题平均输出多少 token」统计中,Opus 5.5 在 max 档位下平均每题吐出 11.9 万个输出 token,其中 8.4 万个用于思考、3.5 万个为最终答案;同档位下,OpenAI 的 GPT-6 Astra 仅用 2.7 万 token。
Anthropic 官方声明显示,Opus 5.5 默认运行在「adaptive thinking at max effort」下,并取消关闭 thinking 的选项。这标志其路线转向 test-time compute:智能不再只来自权重,而来自每次调用时现场的推理过程。
这一思路与姚顺雨 2025 年 4 月发表的《The Second Half》高度一致。姚顺雨认为,AI 下半场增量来自「推理与行动」而非更大的参数与更多的数据;他早在 2023 年提出的 Tree of Thoughts 与 ReAct 架构,本质都是 test-time 范式。Opus 5.5 可视为这一理念在工业级模型上的工程化落地。
GPT-6 Luna:把「重复」变便宜
GPT-6 Luna 定价输入 0.1 美元 / 百万 token、输出 0.5 美元 / 百万 token,较上一代直接砍半;缓存命中价仅 0.01 美元 / 百万 token,比标准输入价便宜 90%。
核心机制是 prompt caching / KV cache 复用:同一段前缀上下文算过一次便存起来,下次直接读取,避免 Agent 每多走一步都要重读一遍长上下文。这与 DeepSeek 在 2026 年 8 月 2 日上线的「Context Caching on Disk」思路几乎一致——DeepSeek 将 KV cache 写入廉价大容量的磁盘阵列,命中时跳过重算;到了 V4 Flash,命中价 0.02 元 / 百万 token、未命中 1 元,价差达 50 倍。
上下文长度上,GPT-6 Luna 为 105 万 token,DeepSeek V4 为 100 万 token,两边几乎对齐。为扛住百万级上下文,两套方案都不约而同地采用了 MLA(多头潜在注意力)等架构:DeepSeek-V2 技术报告显示,MLA 将 KV cache 压缩 93.3%、吞吐提升至 5.76 倍。
推测解码:又一次「英雄所见略同」
OpenAI 在官方博客中披露,GPT-6 Luna 引入推测解码:让一个更小的 draft 模型与主模型并行「猜」接下来的 token,主模型再批量验收,一次前向可吐出多个 token,token 生成效率提升 15% 以上。
这一思路在 DeepSeek V3 的 MTP(Multi-Token Prediction)中已有体现:主干后挂一个 MTP 头、共享 hidden state,推理时小头先行猜测、主干验收。两者实现方式略有差异——OpenAI 外挂独立小模型、DeepSeek 在主干后接 MTP 头——但「小模型先猜、大模型并行验」的并行解码思想一致。
主战场到第二战场:中国方案的「逆袭」
过去几年,头部公司将资源集中于预训练,依 Scaling Law 堆数据、堆算力。但当优质数据见顶、预训练边际收益递减时,增量自然转移到推理与效率层面:test-time compute、context learning,以及长上下文场景下的 caching / MLA / 稀疏注意力。
一个反直觉的现象是:手里攥着最多算力与数据的头部公司,恰恰最缺乏抠成本的动力。DeepSeek 的 MLA、磁盘缓存、稀疏注意力,最初都是「穷则思变」的替代方案,却在全行业转向效率比拼时,变成了最硬的通货。
从这一轮迭代看,工程范式与学术范式的创新源头已部分转向中国公司,而美国巨头承担了「产品化、卖全球」的最后一步。这种攻守易形的趋势,是当前 AI 行业最值得关注的变化之一。
