来源:市场资讯

(来源:刘聪NLP)

这两天刷到一个项目bigset,tinyfinsh开源的一个项目,

核心功能是通过用户的一句话需求,将散落在网页上的信息,变成一张可以持续维护的高质量的数据集(excel),同时支持定时自动刷新。

比如,现在LLM模型的API价格都是多少?能不能直接让把从各个网站上把所有LLM的价格都获取下来,同时每天进行更新检测。

bigset有点Clay AI 的开源版那意思,并且整理后的高质量、可持续更新的数据,对于其他agent应用来说,也能发挥作用。

bigset整个流程十分丝滑,可以理解为一支自动化的研究小队,

当获取用户描述需求后,AI 会自动推断出数据结构,判断出这张表需要哪些列,比如我们上面的case,"模型ID、厂商、输入输出缓存价格、价格链接"等列,并确定模型ID应作为主键。

打开网易新闻 查看精彩图片

然后,编排智能体通过网络搜索去发现实体,比如先找出OpenAI、Google、Anthropic、DeepSeek、Alibaba模型等厂商。

打开网易新闻 查看精彩图片

接着,子智能体并行分头行动,每个子智能体专注调研一个实体,比如其中一个去抓取OpenAI某一个模型的真实定价页面,各自获取真实数据并在经过校验后插入一行。

打开网易新闻 查看精彩图片

最后,得到一张可以在界面里浏览、可导出 CSV 或 XLSX 的结构化表格。

如果设定了刷新频率(30 分钟、6 小时、12 小时、每天或每周),就会按计划自动重跑,让API价格始终保持最新。

同时编排 + 并行子智能体的架构,可以让bigset兼顾覆盖广度与数据准确性。

结果也很适合作为深度研究场合的信息基础。

提到tinyfinsh,前阵子免费Web Search 和 Fetch两大接口应该还是蛮出圈的。

你在各种Agent可以免费使用,但会有频率限制Search每分钟5次,Fetch每分钟25次,

Fetch尤为好用,任意一个 URL 进去,用真实 Chromium 渲染,然后把导航栏、cookie 弹窗、广告脚本全部剥掉,输出干净的 Markdown。

打开网易新闻 查看精彩图片

回到bigset,如何部署使用呢?

官方的部署文档写的也是十分仔细, 先把仓库拉下来:

git clone https://github.com/tinyfish-io/bigset.gitcd bigsetcp .env.example .env

接下来要填 .env。

BigSet 主要需要三类 key

TinyFish API Key 用来做网页搜索和页面抓取,也就是 Search 和 Fetch。

打开网易新闻 查看精彩图片

OpenRouter API Key 用来跑 LLM,包括 schema inference 和后面的 agent

打开网易新闻 查看精彩图片

Clerk 用来做登录认证,需要 Publishable Key、Secret Key,以及 Clerk JWT Issuer URL。

打开网易新闻 查看精彩图片

对应分别填写,

TINYFISH_API_KEY=OPENROUTER_API_KEY=NEXT_PUBLIC_CLERK_PUBLISHABLE_KEY=CLERK_SECRET_KEY=CLERK_JWT_ISSUER_DOMAIN=

填完以后,直接启动:

make dev

打开网易新闻 查看精彩图片

跑起来以后,默认有三个入口:

BigSet App:       http://localhost:3500Convex Dashboard: http://localhost:6791Mastra Studio:    http://localhost:4111

打开网易新闻 查看精彩图片

真正使用时,打开 localhost:3500,注册或登录,然后新建 dataset,就可以了。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

比如,你先用自然语言描述想要的数据集,

收集AI Agent的Web Search / Fetch / Browser API工具,字段包括产品名、公司、支持能力、是否开源、免费额度或起步价格、并每周刷新。

系统会先生成 schema,也就是这张表应该有哪些列、字段类型是什么、哪一列是主键。用户可以在页面里手动修改字段、刷新频率和最大行数。

打开网易新闻 查看精彩图片

确认之后,进入 dataset 页面,触发 populate。

打开网易新闻 查看精彩图片

BigSet 后端会启动 agent workflow,先搜索候选实体,

打开网易新闻 查看精彩图片

再让 sub-agent 逐个研究每一行,把结果写进表里。

打开网易新闻 查看精彩图片

数据可以excel导出。

打开网易新闻 查看精彩图片

我在window下面部署,还遇到了一个问题,就是在wsl2 Ubuntu-22.04启动的时候,

frontend镜像一直启动不起来,直接使用bun启动也不行,会出现拉起之后,程序直接停止

打开网易新闻 查看精彩图片

最后把项目从 /mnt/d 挪到 WSL 自己的 Linux 目录下就好了,

我也是醉了,准备Mac了,感谢CodeX。

打开网易新闻 查看精彩图片

当然,bigset还是存在一些不足,

比较核心的问题就是没办法使用在采集需要登录的网站、或者付费的内容,

但这恰恰是很多高价值数据所在的地方,也是我们经常获取数据的地方。

最后,

我觉得,bigset真正有意思的地方,

是把AI从一次性问答,向可维护的数据资产推进了一步。

搜索引擎给你网页,

rag给你答案,

bigset想给你一张会持续更新的表。

对agent来说,可能比多回答几句话更重要。

对于很多真实业务来说,

持续维护有一份真实有效的结构化数据,就足够了。