桃子桃子快讯
返回首页
行业动态

一本 AI 教材的写作反思:LLM 长篇技术写作为何停滞

作者用大模型辅助完成 RLHF 教材后发现,模型在编程、数学上飞速进步,长篇非虚构写作却几乎停滞,呈现「不可约的复合错误…

2026.08.12 · 周三3 分钟阅读

一位刚完成《Reinforcement Learning from Human Feedback》教材的作者在博客中分享了他的写作体会:在 LaTeX 排版、深度校对、TikZ 配图等环节大模型确实帮了大忙,但当他尝试让模型直接撰写整章技术内容时,结果令人失望——模型可以写好一句话,却很难把整本书组织得有条理、引人入胜。这一反差让他认为,长篇非虚构写作是当前大模型能力地图中被忽视的一块洼地。

写作进步与模型整体能力脱节

作者指出,近两年大模型在编程、数学、搜索研究等任务上的进展几乎是「陡峭上升」,但长篇写作的进步曲线却接近平坦。他特别提到,目前在写作上口碑最好的仍是一些相对早期的模型,例如 OpenAI 的 GPT-4.5 与月之暗面的 Kimi K2;在他撰写教材期间,最新的 GPT-5.5 Pro 也只是被用作 200-300 页稿件的深度错别字检查工具,并未带来写作能力的代际跃迁。

在他看来,写作能力与其他技能更像「正交」关系——并非被忽视,而是缺乏专门的高质量训练数据,也难以通过当前主流的推理时扩展手段获得乘法级提升。换言之,更大的参数量或许能减少小错误,却未必能把这些零散改进整合成结构化的长篇表达。

擅长逐句校对,缺乏整体组织

作者总结了自己与多家模型协作的经验:

  • GPT 系列:长期擅长发现拼写与细节错误,把近终稿 PDF 交给 GPT-5.5 Pro 后,仍能扫出大量散落于 200-300 页文稿中的隐匿笔误。
  • Claude 系列:更接近「编辑」角色,在品味、任务心智模型和「卡壳时的破局建议」上明显更胜一筹。

这些能力有一个共同主题:模型擅长逐句、逐公式、逐图的局部打磨,却很难在多次增删之后回头审视整体结构,把各部分重新串成连贯的论述。作者将这种现象称为「不可约的复合错误」——每一步局部修改都会引入新的偏差,而这些偏差难以在更高层级被完全纠正。

对「AI 解决开放科学」的隐忧

作者坦言,作为一名对 AI 进展持乐观态度的人,他选择在这个时间点发出质疑显得有些不合时宜——毕竟 Anthropic 同期刚发布 Claude 在黎曼猜想上的进展博客。他并不否认大模型在数学等「窄域科学」上带来的极端加速,而是担心这种窄域能力无法泛化到更广阔的科学写作与组织任务上。

在他看来,知识的组织本身就是一种「压缩」,而压缩才能催生洞见。当下的大模型在长篇非虚构写作中倾向于增加信息熵,这种特性很难无限叠加。因此,在可预见的未来,模型更可能扮演「强大的科研助手」,在低悬果实与跨领域联想上提供帮助,而非独立产出具有革命性的科学洞见;人类作者仍将充当把控整体结构与表达节奏的关键角色。

信源