如何为AI驱动的开发者助手构建一个能生成数据库查询、推荐索引,还支持多轮对话的推理架构?

Couchbase的答案是,不要只依赖单个大模型,而要搭建一层灵活、可伸缩、容错性强的模型推理层。当Capella iQ的企业用户越来越多,单一模型方案开始捉襟见肘——客户部署偏好各异,对模型供应商的灵活性要求更高,还要扛住流量洪峰并保证跨区域高可用。

打开网易新闻 查看精彩图片

为此,Couchbase转向亚马逊云科技的Bedrock,用Anthropic的Claude系列模型为Capella iQ装上“多模型”大脑。

他们先把整个推理控制面架设在AWS的两个区域(us-east-1和us-west-2)上,通过Amazon EKS运行微服务。其中cp-api负责接收开发者自然语言请求并确定提示词模板,cp-internal-api做内部服务通信与模型路由,cp-ns则管理模型供应商配置和租户级偏好。

所有对Bedrock的调用都经过VPC接口端点,推送至AWS托管的推理基础设施。同时,他们接入跨区域推理(CRIS),在美国境内us-east-1、us-east-2和us-west-2三个区域间自动故障转移和负载分配,再也不用预先预留算力。

当开发者在Capella iQ里问“给我写个SQL++查询”或“建议一个索引”时,请求先经cp-api完成鉴权、拉取会话上下文,然后由cp-api组装推理负载,注入提示词和对话历史,再委托给Bedrock。底层的Claude模型负责理解意图并生成回答,整个链路保持私有、可控且可随时切换模型。

Couchbase表示,这套多模型架构让他们在获得更高可用性的同时,也满足了不同客户对模型选择的控制欲——这才是企业级AI助理该有的样子。