Firecrawl 开源浏览器 OCR 插件,20ms 把 PDF 转成 Markdown
Firecrawl 团队开源浏览器 OCR 插件 OCR It,可在 20ms 内将不可复制 PDF 转成 Markdo…
Y Combinator 孵化的明星项目 Firecrawl 团队近日开源了一款浏览器 OCR 插件 OCR It,主打把不可复制的 PDF 文件在 20 毫秒内转成结构清晰的 Markdown,方便直接喂给大模型做总结或问答。联合创始人兼 CTO Nicolas Camara 在 X 上宣布了这一消息,项目刚上线便登上 GitHub Trending。
处理速度与定位
据介绍,OCR It 在与 IBM 开源文档解析工具 Docling 处理质量相当的前提下,速度比后者快了近 300 倍。插件内置 Tesseract OCR 引擎,无需联网、不需要 API Key,安装时也不主动申请任何网站权限,仅在自动模式或跨域 iframe 场景下才按需申请当前站点权限。这意味着用户可以在本地完成识别,避免文档内容上传第三方服务。
从定位上看,OCR It 解决的是一个长期痛点:很多学术 PDF、扫描件和老旧报告无法直接复制文本,文字提取后还存在乱码、版式错乱等问题,导致 LLM 读取困难。Firecrawl 团队给出的方案是把 OCR 流程嵌入浏览器,配合快捷键实现半自动化的批量识别。
使用方式
OCR It 目前支持 Chrome 和 Firefox,提供手动与自动两种模式。核心操作逻辑是「框选区域 + 快捷键触发」,主要快捷键如下(Windows 与 Linux 用户需将 Option 替换为 Alt):
- 框选区域:按下
Option + Shift + R,拖选需要识别的文字区域,按Enter保存。 - 手动翻页识别:每翻一页按一次
Option + Shift + S,插件自动截图并排队执行 OCR。 - 自动模式:按下
Option + Shift + A或点击 Start auto-run,自动循环执行「截图 — OCR — 翻页」,按ESC可中止。 - 结束与导出:插件默认在连续识别到两张相同页面、无法翻页、OCR 失败或达到 300 页上限时自动停止。完成后可在面板中检查修改,使用「Copy all」或「Download .txt」导出全文。
值得注意的是,浏览器内置 PDF 阅读器目前还不支持自动翻页,因此处理 PDF 时建议使用手动模式。
当前局限
多位早期用户在 X 上反馈,OCR It 在版式简单、文字清晰的 PDF 上表现稳定,但在以下复杂场景中仍力不从心:
- 多栏排版的正文段落识别顺序容易错乱。
- 标题、脚注、表格、数学公式与正文混排时,结构化输出质量明显下降。
- 自动翻页在某些阅读器中失效,需手动配合。
适用场景与展望
综合来看,OCR It 更适合作为「快速把可读 PDF 转成可喂给 LLM 的纯文本」的轻量工具,对于需要高精度版面还原(如学术论文、财报、扫描书籍)的场景,仍需等待团队后续更新,或搭配 Docling 等专业解析工具使用。项目已在 GitHub 开源,感兴趣的用户可自行下载体验。
