桃子桃子快讯
返回首页
研究论文

古籍数字化研究:人工修正十次胜过所有模型扩展

巴基斯坦一档案馆将十年 Photoshop 手工积累的 57.5 万页标签反向用于训练,结果十次人工修正带来的提升超过所…

2026.08.27 · 周四3 分钟阅读

巴基斯坦的 Ibteda Digital Library 是一座面向社区的私人档案馆,过去十年间用自建相机支架将一批罕见的乌尔都语古籍——包括石印本、词典与期刊——逐页扫描并以 Photoshop 手工修整。当日常运营告一段落时,项目负责人意识到这十年里 575,729 张成品页(覆盖 1,765 本书)实际上记录了操作员对每一页所做的裁剪决策。他把这些成品页反向配准回原始照片(采用 SIFT + MAGSAC,配合保守的接受阈值),将恢复出的几何信息直接当作监督信号,由此开启了一项以「数据本身」驱动自动化的实验。

扩展实验全部失效

在公开训练集上,规模提升几乎没有带来收益。将训练用书从 378 本扩到 572 本,未见未见过图书的 pass@80 指标有任何移动。作者还尝试了以下几条常被视作「标准升级路径」的路线:

  • 替换为 ResNet-50:训练拟合更好,但留出集持平,校准后甚至更差;
  • 输入分辨率升至 1024px:无明显收益;
  • 增加空间感知头:无明显收益。

按书逐本的误差分析揭示了原因:模型的失败并不是漏检或错配,而是对每一本书都呈现出近乎常量的偏移——而这个偏移对应的是操作员习惯性留出的页边距内缩量。这种偏好根本不存在于新书的像素里,所以无论喂进多少数据或换多大的骨干网络都学不到。

关键洞察:十次人工修正击退所有扩展杠杆

实验最终落地为一种极简方案:对每本书让人工再标注十个裁剪框,并按元素级中位数取残差,作为对该书「操作员偏移」的估计。这一步把留出书的 pass@80 从 0.71 拉到了 0.83——超过前面所有数据规模与模型升级的组合。论文的核心结论被作者概括为一句话:「缺失的信息不在像素里。」更大的骨干网络因此不在后续路线图上。

修复环节:神经网只负责提议,约束交给传统方法

对于污渍、印章等瑕疵的修复,团队刻意把神经网络的作用范围收窄:U-Net 仅负责预测「需要修补的支持区域」,其余一律交给经典 OpenCV 方法按周围像素重建,保证掩膜外区域与原图字节级一致。标签采用 REMOVE / KEEP / IGNORE 三态;任何导致乌尔都语变音符号被擦除的预测都会触发否决,无论交并比高低。引入更严格的标签规则后,标记 IoU 从 0.56 提升到 0.60,变音符号误删归零。

仍待解决的问题

作者在文末公开征集两方面的意见:

  • 是否存在建模「不可见的人类偏好」而非可见结构的相关先例,例如对单实例残差进行校准的工作?团队的下一步是直接让模型以校准样本为条件(少样本内缩量推断),取代后置的中位数估计。
  • 是否存在值得信赖的受限扩散 / Inpainting 方案,能在数学上保证声明的支持区域外不被改动?还是说对档案级工作而言,经典填充仍是唯一诚实的选择?

完整的训练配方、标签挖掘阈值与路由规则收录在「复现契约」附录中;代码与权重因仍在档案审核流程中暂未发布。

信源