一家做期货交易所的公司,把拍卖机制搬到了大模型推理上。Architect Financial Technologies 推出 Liquid Inference,一个为每一次请求实时竞价的 LLM 路由器。对开发者来说,动作只有一个:换掉 base URL,代码不动,让供应商在价格上互相厮杀。
这不是又一个 API 聚合层。它的核心机制是交易所式的双边定价——供应商挂出报价,买家按规则挑最低价成交。
每一次请求,都是一场拍卖
Liquid Inference 的运作方式接近交易所撮合。供应商针对特定模型发布报价,每一个请求都会在所有报价该模型的供应商之间进行拍卖。最终胜出的,是满足买家规则的最低报价。
买家这一侧可以设置的约束相当细:
- 单个任务的成本上限
- 首 token 时间限制
- 最低吞吐量要求
- 指定可用区域、零数据留存
- 供应商或模型白名单
此外还有一个 Auto 模式,可以针对给定的工作单元自动挑选模型。据 Harrison 在 LinkedIn 的帖子,产品还提供路由规则预设,并支持完整的多模态能力。
这套逻辑的关键在于,价格不是平台定的,是供应商自己报的。谁能接受更低的价,谁就接到这一单。
做市的是家期货交易所
Liquid Inference 出自一家交易公司,而不是 AI 实验室。Architect 运营着 AX 永续期货交易所。2026 年 5 月,它收购了一家美国指定合约市场,用于上市 GPU 算力期货,目前仍在监管审查中。
团队把搭建金融交易所的经验,直接用来为推理做双边价格发现。这个背景解释了产品为什么长成现在这样——订单簿、报价、清算交易,这些词出现在一个 LLM API 里并不常见。
账户持有者可以查看实时订单簿、按供应商和按模型的报价,以及已清算的交易。对 LLM API 来说,这种级别的市场数据并不寻常。
供应商的接入走 Liquid Inference 应用。Harrison 表示,新供应商的验证是「几分钟,而不是几周」。所有提示词都使用 OpenAI API 标准。一套 REST 和 WebSocket API 负责注册模型和报价。
供应商可以根据自身成本更新报价。这意味着他们可以在想卖的时候,才把闲置 GPU 算力拿出来卖。结算通过 Stripe 完成,每一笔任务都有明细记录。
闲置算力多了一个出口
把报价权交给供应商,实际效果是让算力供给变得更有弹性。手里有闲置 GPU 的一方,不必签长期合约,也不必接受平台统一价,可以按自己的成本线决定什么时候进场。
对买家而言,规则约束加上竞价机制,理论上能把每一单的价格压到当前市场能满足条件的最低点。成本上限、延迟要求、吞吐底线这些条件,构成了买家的出价边界。
这套设计能不能跑通,取决于两件事:报价的供应商是否足够多,以及竞价是否真的能持续产生更低的成交价。Architect 给出的答案是把它做成一个市场,而不是一份价目表。
热门跟贴