桃子桃子快讯
返回首页
研究论文

百度飞桨开源 HPD-Parsing 文档解析模型

百度飞桨发布 1B 参数文档解析模型 HPD-Parsing,采用分层并行解码,在 OmniDocBench v1.6…

2026.07.23 · 周四3 分钟阅读

百度飞桨(PaddlePaddle)团队在 Hugging Face 上发布了一款名为 HPD-Parsing 的轻量化文档解析模型。该模型仅 1B 参数,主打高吞吐量,提出了一种新的「分层并行解码(Hierarchical Parallel Decoding)」范式,致力于解决传统统一视觉语言模型(VLM)解析器在整页文档解析时的串行瓶颈。

核心思路:全局布局 + 局部并行

传统基于 VLM 的文档解析器将整页内容作为一个整体处理,输出依靠逐 token 的自回归生成,文档越长,串行瓶颈越明显。HPD-Parsing 团队观察到文档解析的一个关键特征:页面结构需要全局协调,而内容生成在很大程度上是局部化的。

基于此,HPD-Parsing 设计了一个主布局分支(main layout branch)负责全局文档结构的协调,并动态地将局部内容生成分派给并发的子分支。同时引入渐进式多 token 预测(Progressive Multi-Token Prediction, P-MTP),在每个分支内进一步减少解码步数。配合共享前缀的 KV 缓存复用,整体解码路径在分支维度和 token 维度上都被显著压缩。

关键能力

  • 分层并行解码(HPD):将整页自回归生成重构为「全局协调 + 局部并行解码」的模式,兼顾全局结构一致性与局部生成效率。
  • 分阶段自适应训练:在迁移到并行解码范式的过程中,引入难度感知的自动化数据筛选管线,结合大规模数据收集、模型辅助标注、难度估计与均衡采样,降低人工标注成本。
  • 高吞吐与精度兼顾:在 OmniDocBench v1.6 上取得 94.91% 的综合得分,刷新端到端统一解析器当前最优成绩;峰值吞吐达到 4,752 tokens/second(TPS),是当前最快文档解析器的 1.62 倍、自身自回归基线的 3.06 倍。

性能数据

HPD-Parsing 给出的关键基准结果如下:

  • OmniDocBench v1.6 综合得分:94.91%(端到端统一解析器 SOTA)。
  • 峰值吞吐量:4,752 TPS。
  • 相对最快的现有文档解析器:1.62 倍提速(原文表述为 2.62×,按其表述记录)。
  • 相对自身自回归基线:3.06 倍提速。
  • 模型规模:1B 参数。

意义与定位

HPD-Parsing 证明文档解析不一定需要依赖单一串行生成轨迹,而可以通过「全局布局协调 + 局部并行解码」高效完成。对于需要批量处理长文档、扫描件或 PDF 的场景,这种高吞吐方案具备明显的工程价值。同时,1B 的轻量规模也使其更容易部署在资源受限的环境中,与当前追求更大参数规模的文档理解模型形成差异化定位。

信源