桃子桃子快讯
返回首页
行业动态

AI 数学能力两年跨越式提升,OpenAI 转而强调新模型「收益」

沃顿教授 Ethan Molnick 发文指出大模型数学与科学能力两年内大幅跃升,相关调用成本不足 2000 美元;Op…

2026.08.01 · 周六2 分钟阅读

沃顿商学院教授、长期追踪 AI 落地的独立评论人 Ethan Molnick 近日在 X 平台发文,列出几条值得关注的行业动向。其中最实质的一条是:大模型在数学与科学任务上的能力在过去两年间出现跨越式提升——两年前 LLM 连基础算术都无法稳定完成,如今调用 API 完成同类能力的总成本据 Noam Brown 估算已不足 2000 美元。

数学与科学能力两年跃迁

Molnick 的核心观察集中在能力曲线上。两年前的大模型在基础算术、简单推理上仍频繁出错,是社区内反复被提及的能力短板;而新一代模型在 MATH、GPQA 等基准上的成绩已逐步逼近人类专家水平。若 Molnick 引用的「不足 2000 美元 API 成本」数据成立,意味着以推理即服务的方式复现两年前不可行的数学任务,边际成本已大幅压缩到个人研究者可承受的范围。

不过该数据点仅来自 X 平台的一手推文,缺少明确的测试条件、模型版本与计费档位说明,目前不宜作为产业基准广泛引用,仍需 OpenAI 或第三方机构给出可复现的成本明细。

OpenAI 传播转向:从风险到收益

Molnick 提出的另一条变化是 OpenAI 在发布新模型时的沟通策略:官方话术正从「强调潜在风险」转向「凸显能力收益」。这一转向与近期 OpenAI 在官方博客、发布会中更突出基准成绩与生产力场景的表述一致,也与监管层面的态度逐步明朗、模型能力走向稳定相关。

传播重点的迁移并不意味着安全问题被淡化,而是说明在产品已经稳定跨过基础能力门槛后,市场叙事重心自然向应用价值倾斜。

小结

综合来看,Molnick 的观察更接近「行业拐点提示」而非正式新闻:能力在涨、成本在降、话术在变。对于关注大模型商业化与能力演进的从业者,这三条线索值得持续跟踪,但具体数字仍需等待更完整的一手披露再做判断。

信源