OCR工具存在了这么多年,但直到今天,大多数人在处理一本长PDF的时候,还是得分页、切割、拼接,遇到跨页的表格直接抓狂。传统方案不是不能跑,是跑到一半就崩给你看。
最近有个开源项目让很多开发者直呼离谱。它叫Unlimited OCR,来自百度,能够一次性解析整本100页的PDF,不需要分页处理,上下文中途不会丢失。30亿参数,本地就能跑,免费。在HuggingFace上下载量已经超过224万次,GitHub Star突破1.67万,至今仍在全球趋势榜上。 更离谱的是,图灵奖得主、Meta首席AI科学家杨立昆也转发了这个项目。 一个中国大厂的开源项目,能让杨立昆主动下场推荐,在全球开发者社区里引发持续讨论——这本身就不太寻常。本文主要搞清楚一件事:Unlimited OCR到底做对了什么,让这么多人上头。
最近有个开源项目让很多开发者直呼离谱。它叫Unlimited OCR,来自百度,能够一次性解析整本100页的PDF,不需要分页处理,上下文中途不会丢失。30亿参数,本地就能跑,免费。在HuggingFace上下载量已经超过224万次,GitHub Star突破1.67万,至今仍在全球趋势榜上。 更离谱的是,图灵奖得主、Meta首席AI科学家杨立昆也转发了这个项目。 一个中国大厂的开源项目,能让杨立昆主动下场推荐,在全球开发者社区里引发持续讨论——这本身就不太寻常。本文主要搞清楚一件事:Unlimited OCR到底做对了什么,让这么多人上头。

JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图
JPG
长图