你有没有经历过这种抓狂:Claude 管代码审查,GPT 写文档,Gemini 做调研,Ollama 跑本地测试,每个工具一套 API Key、一套工具配置、一套记忆上下文,切来切去状态全丢。想统一记忆?想一次配置到处生效?不存在的。我忍了一年,终于动手搭了一个叫 HyperNexus 的东西——一个统一 AI 控制平面,通过单个 MCP(Model Context Protocol)服务器把所有这些大模型接在一起。所有配置、记忆、路由规则都收敛到一处,切模型跟切频道一样平顺。

这玩意儿核心就是三个字:别让开发者把生命浪费在胶水代码上。下面按照我最满意的几个能力逐条拆开说。

第一条:渐进式工具路由,令牌消耗直降 60%

MCP 服务器最大的坑是令牌膨胀——你要是把 50 个工具的 schema 一股脑塞进每个 Prompt,还没开始聊,上下文窗口先吃掉一半。HyperNexus 用了个笨办法但管用:每次只注前 3 个最相关的工具定义。后台先把 Prompt 转成向量,再对 1.1 万多个注册的工具 schema 做语义相似度排序,只取前三名喂给大模型。实测下来,这种“按需注入”把单次请求的 token 用量砍掉 60%,工具选择准确率还能稳在 95% 以上。也就是说,用更少的令牌成本换来了几乎不降级的体验。

第二条:LLM 瀑布流,限流失败也静默切换

用 API 总会撞上速率限制或者临时故障,与其让智能体原地报错,不如事先铺好几层后路。HyperNexus 内置了一套瀑布式 fallback:首选用 Claude 的 API,若被限流就自动切到 OpenRouter 走备路,还没恢复就降到本地 LM Studio,最差还有 Ollama 兜底。全程不需要你写一行重试逻辑,也不会有中断提示,智能体根本感知不到背后已经换了好几手。这种静默降级对长时间跑任务的 agent 尤其友好。

第三条:SQLite + 向量语义搜索,记忆重启不丢失

大多数 agent 框架的重启等于失忆,之前对话里的总结、偏好、事实全清空。HyperNexus 用 SQLite 做持久化存储,再叠一层 sqlite-vec 扩展为每条记忆生成向量,存成支持语义检索的格式。记忆入库时自动打上 embedding,下次查询不再靠关键词硬匹配,而是拉出语义最相近的历史片段。哪怕进程重启、机器重启,只要文件在,上下文就在。

内部骨架:Go 扛并发,TypeScript 搭监控面板

后台用 Go 写了 446 个 HTTP handler,靠着 goroutine 并发处理多个工具调用请求。前端监控和配置界面则用 TypeScript 搭成面板,可以实时看到不同模型的路由状态、记忆库规模和工具调用分布。整体架构就是一张 MCP 路由器负责分发、一旁是 1.1 万多个可注册工具构成注册中心,底下一层持久化记忆,顶部统一对接 Claude、GPT、Gemini 等客户端,进出都走同一套协议。

这套方案本质上就是把“换模型不换上下文”这件事做成了基础设施。你不用再为每个 AI 客户端单独配工具、单独管记忆,也不用在多个控制台间来回切。对我来说,最直接的收益就是:同一个 Prompt 在不同模型间传递时,工具召回和记忆保持终于不再打架了。如果你也在同时用多个大模型服务,也许可以试试把类似的 MCP 控制平面搭起来——至少令牌账单会先给你一个惊喜。