桃子桃子快讯
返回首页
行业动态

AI 速览:GLM-5.3 追平开源前沿,厂商密集调价

GLM-5.3 智能体 Elo 跃居开源并列第一,OpenAI、Anthropic 调整定价与权限,agent 基础设施…

2026.08.19 · 周三4 分钟阅读

智谱 GLM-5.3 在 Artificial Analysis Intelligence Index 上拿到 60 分,与 Kimi K3 并列开源权重最高分;其智能体 Elo 从 1524 跃升至 1770,仅次于 Opus 5。性能上涨的同时,单任务输出约 18,700 tokens,比 GLM-5.2 多出约 20%,单次 Index 任务成本从 0.44 美元升至 0.68 美元。权重预计本周内发布。OpenAI 在 OpenRouter 上将 GPT 5.6 Sol 的价格砍半;Anthropic 把提升后的 Claude Code 周限额延期至 8 月 31 日,并提示容量可能吃紧;Cowork 在移动端与网页端向付费计划开放;Glean 则强调「路由」本身已成为一种独立部署层,部分查询甚至不经模型直接回答。

GLM-5.3 追平开源前沿,代价是更多 token

智谱新一代模型 GLM-5.3 在 Artificial Analysis Intelligence Index 上取得 60 分,与月之暗面的 Kimi K3 并列,是开源权重模型中的最高分。智能体方向的进步更为明显:Elo 从 1524 升至 1770,仅次于 Anthropic 的 Opus 5。但性能的提升伴随着开销上升——单任务约消耗 18,700 个输出 token,比 GLM-5.2 多约 20%;Index 任务单次成本从 0.44 美元上升到 0.68 美元。权重预计在本周内释出,开发者可在成本与能力之间重新权衡。

定价、权限与产品形态同时变动

  • OpenAI:在 OpenRouter 网关上将 GPT 5.6 Sol 的价格下调约一半。
  • Anthropic:将已上调的 Claude Code 周限额延期开放至 8 月 31 日,同时提醒容量可能紧张。
  • Cowork:在移动端与网页端向付费用户开放。
  • Glean:提出「路由即部署层」的判断,主张部分查询不必调用模型即可回答。

上下文不是越多越好

三项独立研究都指向同一结论:上下文长度存在边际收益拐点。

  • IBM Research 在 8 个模型上扩展记忆系统,发现有效引导信息是按模型校准的「剂量」,而非可一键开启的开关。
  • 一项检索研究显示,在固定上下文预算下,追求最高召回率的配置反而解决更少问题。
  • 一项受控的材料模拟实验测出,在 agent 写领域代码时,额外 prompt 细节的边际收益有限。

评测与基础设施向生产侧推进

LangSmith 上线调优后的 evaluator,用于对线上智能体轨迹打分;官方称其比所对比的前沿裁判模型准确率更高,同时成本低 82%。Artificial Analysis 则发布一个搜索评测索引,把「回答质量」与「总任务成本」放在同一坐标轴上,Parallel 与 Firecrawl 处于前沿位置。

智能体继续「长出手脚」

  • Claude 新增 Gmail 发邮件与 Drive 文件管理能力,前置用户可设的审批门。
  • Cloudflare 通过 x402 启动 agent 流量按请求计费,使 MCP 服务器与 API 提供方可以为自己托管的 agent 流量收费。
  • Vercel 投入 100 万美元悬赏,用于发现其 sandbox 在隔离不可信 agent 代码时的边界与漏洞。

前沿实验室:从训练暂停到蛋白设计

OpenAI 因发现关键网络能力相关证据,暂停对面向部署的模型进行强化学习训练两周,期间正加固并监控其研究环境,同时持有其原本计划的最大一次训练运行。Anthropic 则公布 Claude 在蛋白结合物设计上的进展:在 15 个靶点中成功设计 14 个,其中 2 个由外部实验室合成测试,结合率高于已发表领域基线。

信源