决策模型也能像大语言模型一样,在自己电脑上跑起来了。一个名为 Ollaya 的应用正式登场,专门用来在本地运行决策模型,支持 Windows、macOS 和 Linux 三大平台。
它的定位很直白:LLM 领域有 Ollama 负责把模型拉下来跑,Ollaya 想在决策模型这个品类里扮演同样的角色。用户不用折腾环境,拉取模型、启动服务,就能在本地拿到判断结果。
决策模型为什么值得单独做个运行器
这类模型和聊天型 AI 走的不是一条路。以 Jev 为代表的决策模型,输出的是针对多个选项的判断和对应的置信度分数,而不是一段自然语言回复。用对场景时,它处理任务的速度和成本,相比 Claude 系列、GPT 系列这类前沿模型有明显优势。
正因为如此,围绕 Jev 的应用开发在全球范围内快速铺开,参考这一思路的新决策模型也接连出现。其中不少以开源形式发布,本身就能在本地运行——缺的只是一个顺手的执行工具。
Ollaya 补的就是这个位置。它把开源决策模型打包成易于调用的服务,背后提供与 TypeSafe 兼容的 API,模型涵盖 Laya、decider、NLI 和 GLiClass 等。
一次实际运行长什么样
官方给出的示例里,运行的是决策模型 Winnow-E4B。输入是一段用户抱怨:今年第三次被重复扣款,今天之内不退款就换别家服务。
模型输出的判断被拆成了几个维度:
- 意图:退款要求,置信度 91%
- 紧急性:有,置信度 92%
- 怒りレベル(愤怒等级):2.89,置信度 86%
这种结构化输出正是决策模型的典型形态——不解释、不寒暄,直接给出可被程序消费的判断和分数。
本地跑和调 API,差距有多大
官方还放出了一组对比:一边是调用 Jev 的 API 服务,另一边是在搭载 GeForce RTX 4070 的 PC 上用 Ollaya 本地运行决策模型。
结论是,部分模型在精度上已经能相当接近 Jev 的水平,同时延迟更短。换句话说,本地执行不只是省钱和省数据外流,在响应速度上也有自己的优势。
Ollama 其实在 0.35 版本就已经支持运行决策模型,但可用模型数量有限,当时只有 nimble、tev1、tev1:0.8b 三种。Ollaya 能跑的模型性能更高,这是它主打的差异点之一。
另一个差异在选项数量上。Ollama 每次请求最多支持 15 个选项,Ollaya 把这个上限提到了 255 个。对于需要在大量候选中做判断的场景,这个差距不小。
开源,Apache 2.0
Ollaya 本身是开源项目,源码托管在 GitHub 的 ollaya-dev/ollaya 仓库,采用 Apache License Version 2.0 授权。这意味着开发者可以自行查看实现、修改甚至二次分发。
从 Jev 引发关注,到各类决策模型陆续出现,再到 Ollama 跟进支持、Ollaya 专门做运行器,这条路径正在快速补齐工具链。决策模型能不能复制大语言模型那套本地化生态,Ollaya 是其中一个值得观察的样本。
热门跟贴