桃子桃子快讯
返回首页
工具

用 AI 语义搜索挖掘 6500 本优质非虚构

作者借助 Claude Code 与 GPT 整理主要非虚构奖项的入围与获奖书目,并用 embedding 模型实现语义…

2026.07.22 · 周三3 分钟阅读

一位读者本暑假花了些时间,借助 Claude Code 与 GPT 整理了一份覆盖 6500 余本英文非虚构佳作的数据库,并搭建了一个免费、可语义检索的浏览平台。项目本身没有复杂的「AI 含量」,核心亮点在于把语义搜索嵌入到一个研究者已经习惯的工作流中——找书、翻目录、随机浏览。

项目缘起:图书馆里的随机漫步

作者回忆大学时在图书馆做勤工俭学的经历:他把 A–F 书架(涵盖宗教、哲学、社会学、历史)上的每本书都随手翻到一页,读一句,若有共鸣就连读几页,再顺手翻看左右两侧的邻书。这种「经过筛选的随机抽样」——既有专家编目和馆员把关,又保留了偶然性——构成了他后来自学能力的基础。

他认为,今天大学生遇到查找资料的需求时,往往直接 Google,结果远不如当年去研究图书馆的 GR 830(俗称「捉鬼敢死队会读的书」)书架旁随手翻一翻。作者感叹,研究图书馆的开放书架正逐渐被学习实验室、数字创新中心、社交与零食区取代,那些「奇怪又好看的旧书」很多正被电子版替代或直接送进垃圾箱。

AI 用来做什么

判断一本书是否「优质」很难,但作者的经验是:入围或获得主要非虚构奖项的书几乎都是好书,这成为他的筛选标尺。他先盘点英语世界的主要非虚构奖项,再让 Claude 与 GPT 从维基百科等公开来源抓取历届入围与获奖名单,最终汇成一份可检索、可排序的书单。

技术层面,平台的核心 AI 能力是语义搜索:用户既可以输入「现代法国」「社会史」这样的关键词,也可以搜索像「出人意料地怪诞的经典传记」这样的自然语句,由 embedding 模型在 6500 余条书目中做相似度匹配,找出语义相近的推荐结果。

平台的实际效果

  • 数据规模:约 6500 本历届主要非虚构奖项入围及获奖作品。
  • 查询方式:支持简单词组与自然语言描述,匹配结果有时「出乎意料但合情合理」,有时则令人费解——后者恰恰是作者喜欢的部分,因为它复刻了图书馆书架旁那种「修葺良好的花园里随机漫步」的感觉。
  • 典型用法:找「类似某本书」的作品。例如他在读完茨威格回忆昨日欧洲的《昨日的世界》后,用语义搜索立刻发现几本此前从未听说、但气质相近的备选书。
  • 附加可视化:作者还用这批数据做了些小实验,比如按颜色排列约 5000 本书的封面,探讨书籍设计是否也存在像汽车那样随年代「变灰」的趋势。

作者的态度

作者强调,自己支付全部托管与 API 费用,目的单纯是希望更多人能找到并阅读优质非虚构。在 AI 与播客蚕食阅读时间的当下,他仍认为非虚构正处在一个「很少被承认的黄金时代」。对他而言,语义搜索之所以是当下最值得欢迎的 AI 工具,正是因为它对已有工作流的改进最为朴素直接:让文本搜索变得更好用。

(注:原文中提到的模型写作「GPT-5.6」,按目前公开信息应为笔误或非标准名称,此处按原文事实陈述,未做更正性推断。)

信源