firecrawl/pdf-inspector · ⭐ 13k · Rust
打开网易新闻 查看精彩图片
项目是什么
pdf-inspector是Firecrawl开源的高性能PDF解析库,用Rust编写,核心能力是智能识别PDF类型并提取结构化文本。它能在十到五十毫秒内判断一个PDF是文本版、扫描版、纯图像版还是混合版,并给出置信度分数和逐页的OCR路由建议。这意味着你可以只对真正需要OCR的页面调用昂贵的OCR服务,其余页面走本地解析。
除了分类,它还提供位置感知的文本提取,能获取字体信息、XY坐标,并自动处理多栏阅读顺序。内置的Markdown转换可以把标题(通过字体大小比例识别H1-H4)、项目符号、编号列表等结构一键转成干净的Markdown。整个库不依赖OCR就能完成文本版PDF的解析,速度上官方声称可以在200毫秒内处理一个文本文档。提供Python、Node.js和浏览器WebAssembly绑定,集成门槛很低。
核心亮点
- 十到五十毫秒内完成PDF类型分类,并输出逐页OCR路由建议。
- 位置感知文本提取,支持字体信息、坐标和多栏阅读顺序。
- 自动识别标题层级并转换为干净Markdown,不依赖OCR。
- 提供Python、Node.js和WebAssembly绑定,多语言生态友好。
适合做文档解析、RAG数据管道或本地化PDF处理的产品团队。特别是那些被OCR成本困扰、或需要快速判断PDF是否需要走OCR管道的开发者。对RAG应用来说,这个库能把PDF预处理的质量和速度同时提上来。
为什么值得关注
在开源基准测试中,它的解析质量超过了PyMuPDF4LLM和MarkItDown,速度还更快。考虑到RAG应用对文档解析质量的高要求,以及OCR成本在规模化时的压力,这样一个轻量、快速、多绑定的库有很强的实用价值。
Firecrawl本身在文档抓取领域有积累,这个项目是它们为打磨自身产品而开源的底层能力,含金量不低。
小编点评 PDF解析的瑞士军刀,RAG管道的质量与成本双优化。
项目地址:https://github.com/firecrawl/pdf-inspector
热门跟贴