巴基斯坦民间团队手工整理 57 万页乌尔都语图书,并以此训练模型
Ibteda Digital Library 用近十年时间在 Photoshop 中手工修整 57 万余页乌尔都语书影,…
巴基斯坦的 Ibteda Digital Library 是一个由小型团队运营的民间数字图书馆。该项目在近十年的时间里,用一台尼康相机、几盏 LED 灯和一块从复印机上拆下来的玻璃板搭建拍摄台,逐页拍摄了 8.2 万余张乌尔都语图书的双页照片(合计约 164 万页单面)。其中 57.5 万余页单面在 Photoshop 中逐页手工修整后才发布上线,累计重建出约 1.02 万小时的有效后期处理时间。
项目缘起与瓶颈
项目的起因可以追溯到 2015 年。团队在为纪念诗人迦利布逝世 150 周年准备研究资料时发现,许多历史版本已绝版或难以获取,于是决定自建档案。他们用相机加玻璃压板的简单装置控制书页弯曲,再用 Photoshop 逐张修整——决定页面边界、旋转角度、保留哪些边距、处理污渍和损坏等。
- 拍摄:每次开页拍摄一张双页照片。
- 后期:操作员在 Photoshop 中把双页拆成两张成品图。
- 发布:保存两张尺寸一致、有序排列的页面图。
这种流程在单页上看并不昂贵,但累积到数千本书后便成为整个档案扩张的瓶颈。
馆藏规模与处理量
按团队统计,截至项目覆盖年份 2016 至 2026:
- 已完成后期处理的图书 1,765 册,共 575,729 页单面。
- 全部拍摄档案包含 822,161 张双页照片。
- 共有 5,000 余册图书入库。
- 处理速度约为每小时 56 页单面。
馆藏年代跨度大,从 1865 年的《Bahar-e-Ajam》一直到 1950 年代出版物,涵盖石印本、字典、杂志、插图本、英文从左至右排版的书籍以及带大量边注的页面,单一的版面规则难以覆盖全部类型。
设备使用记录
团队通过尼康机身写入的 EXIF 元数据还原了拍摄设备的变迁:
- D3300:2016 年起使用,累计快门次数 326,128 次。
- D5300:2018 年 2 月至 2023 年 3 月为主力机,最终记录快门次数 575,747 次,约为尼康标称 10 万次耐久测试的 5.8 倍。
- D3500:2023 年 8 月至 2024 年 4 月,累计 83,373 次。
这些数据来自可读取的拍摄时间戳,团队以此重建出约 3,000 小时的有效拍摄时间和 2,467 次拍摄会话,平均每小时约 268 张。
走向自动化
随着拍摄速度超过后期处理速度,重复的 Photoshop 工作越来越难以为继。团队最初尝试传统计算机视觉方法——轮廓检测、投影轮廓分析、纸色阈值、边缘启发式等——但每种方法都只能在馆藏的小部分子集上生效。
在积累了大量人工修整样本之后,团队尝试训练模型来自动完成书页分割与边界处理。文章在此处截断,未披露具体模型架构、训练规模与效果数据,但该工作表明,对小语种、历史排版复杂的图书数字化任务而言,人工标注数据本身就是模型能否落地的关键资源。
