20ms把PDF变成Markdown!开源OCR神器快了近300倍

量子位 2026-08-29T23:50:03.039947

摘要:Firecrawl 团队开源了一款名为 OCR It 的浏览器插件,能在 20ms 内将 PDF 页面中的文字提取并转为 Markdown,速度比同类工具 Docling 快近 300 倍。本文介绍它的用法、效果与当前局限。

从 PDF 到 Markdown,只需 20 毫秒

曾经手动摘取 PDF 文字、结果乱码一堆、大模型还看不懂的麻烦事,终于有了新的解法。Y Combinator 孵化的 Firecrawl 团队最近发布了开源 OCR 工具 OCR It。其联合创始人兼 CTO Nicolas Camara 表示,OCR It 可以在 20ms 内将一份不可复制的 PDF 文件中的文字内容提取出来,并转化为清晰的 Markdown 格式,方便 AI 直接阅读。

20ms 是什么概念?相当于你刚点完确认还没眨完眼,一份处理好的 Markdown 文件就已经生成完毕。

这个刚刚开源的工具很快在 GitHub 上获得热门关注。Nicolas Camara 称,在处理质量与 Docling 旗鼓相当的前提下,OCR It 的处理速度比 Docling 快了近 300 倍。

图片

图片

图片

网友们测完也纷纷在 X 上留言:快,确实快得很啊!

图片

图片

图片

OCR It 怎么用

OCR It 是一款适用于 Chrome 和 Firefox 的免费浏览器插件。你只需框选一次区域,之后每按一次快捷键(或开启自动模式),它就能把整本书或整个文档变成完整且可编辑的纯文本,方便直接喂给 AI 进行总结或提问。

识别过程中,OCR It 会在连续识别到两张相同页面、无法继续翻页、OCR 失败或达到 300 页上限时自动停止,避免在末页无限重复抓取。

图片

具体操作分为手动档和自动档。Windows 和 Linux 用户请将 Option 键替换为 Alt。

手动档

图片

自动档

按下 Option+Shift+A 或点击 Start auto-run,OCR It 便会自动循环执行“截图—OCR—翻页”,直到文档结束。中途想结束按 ESC 即可,检查流程几乎与手动档一致。

另外,OCR It 不需要 API Key、不需要联网,安装时也不索取任何网站权限;它只会在需要自动运行或操作跨域 iframe 时才按需申请当前站点的权限。注意,浏览器内置 PDF 阅读器目前还不支持自动翻页,处理这类 PDF 时建议使用手动档。

处理复杂任务时还不太稳定

OCR It 虽然又快又方便,但还远没到“以后把所有 PDF 都丢给它就能高枕无忧”的程度。网友们的实测也指出了它在处理某些复杂任务时仍存在不足。

图片

关键要点

当前能力与局限

就现阶段而言,OCR It 在版式简单、文字清晰的 PDF 文档上表现相当顺手;但遇到标题、脚注、表格、数学公式与正文段落混排的复杂页面时,处理效果还不太理想。简单说,它对规整的单栏文本友好,距离应对复杂排版还有不小的提升空间。

图片

后续展望

不过,团队显然还在持续打磨这个项目,后续更新值得期待。

👇

感兴趣的朋友可以点进文末第二个链接查看详情,也欢迎在评论区分享你的实测结果~

关键要点

查看原文