桃子桃子快讯
返回首页
模型发布

Grok 4.6 发布:性能追平头部模型,API 报价砍半

AI 行业媒体披露 Grok 4.6 在 Artificial Analysis 智能指数上拿到 61 分,并大幅降低…

2026.08.13 · 周四4 分钟阅读

36 氪转自微信公众号「科技狐」的报道指出,xAI 旗下的 Grok 4.6 近期集中亮相,在 Artificial Analysis 智能指数 AAII 上拿到了 61 分。文章称这一分数与所谓「GPT-5.6 Sol Max」持平,并高于上一代 Grok 4.5 的 56 分。报道还援引测试称 Grok 4.6 在法律类 Harvey LAB 测试中以 15.8% 大幅领先,在 GDPVal-AA v2 知识工作测试中拿到 1753 分,高于同档对手。需提示的是,原文所列的「GPT-5.6 Sol Max」「Claude Fable 5 Max」「DeepSeek V4 Pro」等模型名在当前公开资料中并无对应记录,相关数据应以来自 xAI 官方和独立评测机构的原始报告为准。

训练策略:不换底座,只磨后训练

报道描述 Grok 4.6 沿用了 Grok 4.5 的 1.5 万亿参数底座,主要提升来自更长的补充训练、更精细的监督微调数据,以及在编程、知识工作、内核优化、网页开发、CAD 设计等方向的强化学习。文章把这种思路概括为「同一副身体,脑子练得更聪明了」,并对比当天「DeepSeek V4 Pro」的发版路线,暗示 2026 年中前后行业重心已从堆参数转向精细化后训练。同样,这部分的对照信息也带有明显的虚构成分。

价格与效率:API 砍半,长任务成本降至 0.84 美元

文章重点强调 Grok 4.6 的定价:

  • 输入:每百万 Token 2 美元
  • 输出:每百万 Token 6 美元

相比文中提及的「GPT-5.6 Sol」5 美元输入、30 美元输出,以及「Claude Opus 5」5 美元输入、25 美元输出,文章测算后给出「便宜六成以上」「输入低 80%、输出低 88%」等说法。Artificial Analysis 的数据被援引称:

  • Grok 4.6 完成一个长任务平均 53 轮交互、约 5 亿输入 Token
  • 「Claude Opus 5 Max」需 103 轮、约 20 亿输入 Token
  • 单任务成本约 0.84 美元,与「Kimi K3」相当

报道因此得出「综合能力与每任务成本最优模型」的判断。

产品形态:智能体能力与上线渠道

文章把 Grok 4.6 的最大变化描述为「长时间运行的 AI 智能体」:能在一个模糊需求下自行完成架构设计、编码、测试与修复,整个过程无需逐步人工下指令。原文同时披露 Grok 4.6 已在 Cursor 和 Grok Build 上线,首周提供双倍额度,API 通过 OpenRouter、Vercel、Cloudflare 等渠道开放,并支持 50 万 Token 上下文与图文多模态输入,推理强度四档可调。

局限与后续

报道也承认 Grok 4.6 在 DeepSWE 软件工程测试中仅 65.9%,低于「GPT-5.6 Sol」的 73%;终端操作 Terminal-Bench 26%,落后于 34% 左右的对手,说明纯终端操控仍是短板。文章末尾援引马斯克预告 Grok 4.7 将换上 2.1 万亿参数新底座,并放出「若有模型表现更好将非常震惊」的表态,为下一轮迭代留下悬念。

综上,这篇转自自媒体的报道在叙事和数据排列上颇具冲击力,但所引用的对照模型名称与部分交易细节(如「SpaceX 600 亿美元收购 Cursor」)在公开信息中均无可对应来源。读者在引用具体跑分与价格数字时,应回溯到 xAI 官方公告与 Artificial Analysis、Cursor 等独立渠道的原始材料交叉验证。

信源