桃子桃子快讯
返回首页
研究论文

巴基斯坦民间团队手工整理 57 万页乌尔都语图书,并以此训练模型

Ibteda Digital Library 用近十年时间在 Photoshop 中手工修整 57 万余页乌尔都语书影,…

2026.08.26 · 周三3 分钟阅读

巴基斯坦的 Ibteda Digital Library 是一个由小型团队运营的民间数字图书馆。该项目在近十年的时间里,用一台尼康相机、几盏 LED 灯和一块从复印机上拆下来的玻璃板搭建拍摄台,逐页拍摄了 8.2 万余张乌尔都语图书的双页照片(合计约 164 万页单面)。其中 57.5 万余页单面在 Photoshop 中逐页手工修整后才发布上线,累计重建出约 1.02 万小时的有效后期处理时间。

项目缘起与瓶颈

项目的起因可以追溯到 2015 年。团队在为纪念诗人迦利布逝世 150 周年准备研究资料时发现,许多历史版本已绝版或难以获取,于是决定自建档案。他们用相机加玻璃压板的简单装置控制书页弯曲,再用 Photoshop 逐张修整——决定页面边界、旋转角度、保留哪些边距、处理污渍和损坏等。

  • 拍摄:每次开页拍摄一张双页照片。
  • 后期:操作员在 Photoshop 中把双页拆成两张成品图。
  • 发布:保存两张尺寸一致、有序排列的页面图。

这种流程在单页上看并不昂贵,但累积到数千本书后便成为整个档案扩张的瓶颈。

馆藏规模与处理量

按团队统计,截至项目覆盖年份 2016 至 2026:

  • 已完成后期处理的图书 1,765 册,共 575,729 页单面。
  • 全部拍摄档案包含 822,161 张双页照片。
  • 共有 5,000 余册图书入库。
  • 处理速度约为每小时 56 页单面。

馆藏年代跨度大,从 1865 年的《Bahar-e-Ajam》一直到 1950 年代出版物,涵盖石印本、字典、杂志、插图本、英文从左至右排版的书籍以及带大量边注的页面,单一的版面规则难以覆盖全部类型。

设备使用记录

团队通过尼康机身写入的 EXIF 元数据还原了拍摄设备的变迁:

  • D3300:2016 年起使用,累计快门次数 326,128 次。
  • D5300:2018 年 2 月至 2023 年 3 月为主力机,最终记录快门次数 575,747 次,约为尼康标称 10 万次耐久测试的 5.8 倍。
  • D3500:2023 年 8 月至 2024 年 4 月,累计 83,373 次。

这些数据来自可读取的拍摄时间戳,团队以此重建出约 3,000 小时的有效拍摄时间和 2,467 次拍摄会话,平均每小时约 268 张。

走向自动化

随着拍摄速度超过后期处理速度,重复的 Photoshop 工作越来越难以为继。团队最初尝试传统计算机视觉方法——轮廓检测、投影轮廓分析、纸色阈值、边缘启发式等——但每种方法都只能在馆藏的小部分子集上生效。

在积累了大量人工修整样本之后,团队尝试训练模型来自动完成书页分割与边界处理。文章在此处截断,未披露具体模型架构、训练规模与效果数据,但该工作表明,对小语种、历史排版复杂的图书数字化任务而言,人工标注数据本身就是模型能否落地的关键资源。

信源