跳转到内容
主站 新闻 控制台

20ms将PDF转换为Markdown,开源OCR工具提速近300倍

· 量子位
国内AI

曾经只能手动摘取 PDF 文字,结果乱码一堆,LLM 还看不懂的苦逼日子——

终于要结束了!

图片

Y Combinator 孵化的明星项目 Firecrawl 团队最近放了个大招:

其联合创始人兼 CTO Nicolas Camara 宣布,他们最新开发的 OCR It 可以在 20 毫秒内提取一份不可复制 PDF 文件中的全部文字内容,并将其转换为清晰的 Markdown 格式,AI 读取后即可理解。

图片

20 毫秒是什么概念?

相当于你刚点完“确定”,还没来得及眨眼,一份处理好的 Markdown 文件就已经清清爽爽地交到你手上了。

而且,它不需要联网,可以100% 离线运行,使用内置的 Tesseract。

这款刚刚开源的 OCR 工具发布后不久,就在 GitHub 上获得了广泛关注。

Nicolas Camara 自豪地表示,在处理质量与 Docling 旗鼓相当的前提下,OCR It 的处理速度比 Docling 快了近 300 倍!

图片

小伙伴们测试后,也纷纷在 X 上留言:

快,确实快得很啊!👍

图片

图片

图片

OCR It 怎么用

首先,OCR It 是一款适用于 Chrome 和 Firefox 的免费浏览器插件。

你只需框选一次区域,之后每按一次快捷键(或开启自动模式),它就能将整本书或整个文档转换为完整且可编辑的纯文本,方便你直接交给 AI 进行总结或提问。

期间,OCR It 会在连续识别到两张相同页面、无法继续翻页、OCR 失败或达到 300 页上限时自动停止,避免在末页无限重复抓取。

图片

具体而言,手动模式和自动模式可以分别按照以下步骤操作:

注:使用 Windows 和 Linux 的用户,需要将 Option 键替换为 Alt 键。

1. 手动模式

框选和识别

首先按下 Option+Shift+R,选定需要识别的文字区域,确认无误后按 Enter 保存。

完成文字区域的框选后,按一次 Option+Shift+S,OCR It 就会开始识别当前页面,并在识别完成后自动翻到下一页。

接下来,只需重复这一操作,直到整份文档识别完毕即可。

如果希望进一步节省时间,也可以一边翻页,一边在每一页按一次 Option+Shift+S。系统会立即截图,并在后台自动排队执行识别任务。

图片

检查

全部识别完成后,可以在插件面板中检查、修改文本,也可以重新识别单独的某一页。最后选择 “Copy all” 或 “Download .txt” 导出全文,整个任务就完成了。

2. 自动模式

自动模式更加简单:只需按下 Option+Shift+A 或点击 Start auto-run,OCR It 便会自动循环执行“截图—OCR—翻页”,直至文档结束。

**如果想中途结束任务,按下 Esc 键即可。**检查流程与手动模式基本一致。

此外,OCR It 的仓库界面显示,它不需要 API Key,也不需要联网;安装时不会索取任何网站权限,仅在需要自动运行或操作跨域 iframe 时,按需申请当前站点的权限。

另外,浏览器内置的 PDF 阅读器目前还不支持自动翻页,因此在处理这类 PDF 时,还是尽量使用手动模式。

处理复杂任务时还不太稳定

不过,OCR It 虽然看起来又快又方便,但还远没有达到“以后把所有 PDF 都交给它,就能高枕无忧”的程度。

图片

网友们通过实测达成了一个共识:

OCR It 目前可以较为顺手地处理版式简单、文字清晰的 PDF 文档,但还不太能处理标题、脚注、表格、数学公式与正文段落混排的复杂页面,因此仍有不小的提升空间。

图片

参考链接:

[1] https://x.com/nickscamara_/status/2083295265793212827

[2] https://github.com/thiagotigaz/ocr-it

[3] https://www.firecrawl.dev/about