Couchbase 如何利用 Amazon Bedrock 为 Capella iQ 构建多模型 AI 架构
标题:Couchbase 如何借助 Amazon Bedrock 为 Capella iQ 构建多模型 AI 架构
本文与 Couchbase 的 Tushar Madaan 合作撰写。打造一个能够生成数据库查询、推荐索引并支持多轮对话工作流的 AI 开发者助手,光靠单一的大语言模型(LLM)是不够的。它需要一个灵活、可扩展且容错性强的推理架构。随着企业对 Capella iQ 的采用不断增加,Couchbase 扩展了其 AI 应用,以支持多个基础模型(FM)供应商,从而获得更高的灵活性、更强的运营韧性,并满足客户多样化的部署偏好。Couchbase 需要一种与模型无关的推理架构,能够应对流量突发,跨 AWS 区域保持高可用,且无需预先预留容量。本文将介绍 Couchbase 如何采用 Amazon Bedrock 结合 Anthropic 的 Claude 系列模型来驱动 Capella iQ,解释其多模型方案背后的架构决策,以及在生产环境中获得的运营收益。
解决方案概览
下图展示了 Capella iQ 与 Amazon Bedrock 集成的生产架构。
图 1 — Couchbase Capella iQ 与 Amazon Bedrock 控制平面架构
该架构托管在 AWS 控制平面内,跨两个 AWS 区域(us-east-1 和 us-west-2)部署,以实现高可用性。在 us-east-1 区域,一个 Amazon Elastic Kubernetes Service(Amazon EKS)集群运行着 Capella iQ 的微服务:
- cp-api pod:主 API 服务,接收开发者请求并协调推理调用。该 pod 通过虚拟私有云(VPC)接口端点将请求转发给 Amazon Bedrock。
- cp-internal-api pod:负责服务间的内部通信和模型路由逻辑。
- cp-ns pod:管理命名空间级别的配置,包括模型供应商设置、租户级覆盖以及组织偏好。
一个 Amazon Virtual Private Cloud(Amazon VPC)接口端点为 EKS 集群与 Amazon Bedrock 运行时提供了私有连接。
这个端点负责将推理流量路由到由 AWS 为 Bedrock 管理的基础设施,并支持美区内的跨区域推理(Cross-Region Inference, CRIS),覆盖 us-east-1、us-east-2 和 us-west-2,从而实现自动故障转移、负载均衡,并在需求高峰时提高可用性。
工作原理
当开发者与 Capella iQ 交互时(无论是询问 SQL++ 查询、请求索引建议,还是继续多轮对话),请求会端到端经过以下流水线:
请求接收
开发者的自然语言请求到达 cp-api Pod。该 Pod 负责处理身份验证、检索会话上下文,并根据请求类型确定合适的提示模板。
推理编排
cp-api Pod 组装推理载荷,构建提示信息,注入多轮对话所需的对话历史,并应用来自 cp-ns Pod 的租户特定模型配置。cp-internal-api Pod 则负责解析模型供应商选择以及组织级别的路由覆盖。
私有模型调用
cp-api Pod 通过 VPC 接口端点将请求转发至 Amazon Bedrock 运行时。完整的提示信息和响应载荷始终留在 AWS 基础设施内部,绝不经过公共互联网。这种设计满足了企业安全性和数据驻留要求。
跨区域推理
Amazon Bedrock 利用跨区域推理功能,自动将推理请求路由到最优的美区区域(us-east-1、us-east-2 或 us-west-2),确保请求始终在美国地理边界内。在需求高峰或区域降级时,请求会自动路由到可用区域,无需应用层逻辑或人工干预。
响应交付
模型响应(生成的 SQL++ 语句、索引建议或对话回复)沿相同的私有路径流回。cp-api Pod 先进行响应规范化和格式化,然后将结果展示在 Capella iQ 界面上给开发者。对话状态会被持久化,以支持多轮对话的连续性。
Couchbase 如何借助 Amazon Bedrock 为 Capella iQ 构建多模型 AI 架构
这种设计确保了模型升级或供应商更换只需要在命名空间层更新配置,无需修改代码、无需停机,也不会影响开发者体验。
模型评估
在选型生产模型之前,团队建立了一套基准测试套件,覆盖 Capella iQ 的所有核心工作流:SQL++ 生成、索引推荐、查询解释、iQ Insights 生成以及多轮对话。团队使用标准化的提示/响应对多个可在 Bedrock 上使用的模型进行了评估,评分聚焦四个维度:功能正确性、确定性、延迟和格式一致性。
Anthropic 的 Claude Sonnet 4.5 在基于 BIRD 方法论构建的内部评估中达到了约 76% 的准确率,在所有评估工作流中都达到了生产质量标准,没有出现严重退化。这验证了 Claude Sonnet 4.5 可作为 Capella iQ 多样化工作负载(涵盖结构化代码生成、自然语言解释和多轮推理)的初始生产模型。更重要的是,它验证了一套模型评估框架,帮助 Couchbase 在 Amazon Bedrock 推出新模型时快速验证并采纳。
Amazon Bedrock 的优势
Amazon Bedrock 提供了完全托管、无服务器的推理环境,省去了管理模型基础设施的麻烦。它提供不断增长的基础模型目录,因此 Couchbase 无需重新设计推理管道就能评估和采用新一代模型。跨区域推理提供了内置的弹性和地理分布能力,否则这些都需要大量的定制工程工作。
对 Couchbase 而言,通过 Amazon Bedrock 的单一 API 访问多个模型家族自然契合了他们构建供应商无关架构的目标——模型选择只需配置,无需改代码。企业客户需要部署灵活性,同时要确保推理流量始终处于可管控的 AWS 环境内。
通过与Amazon Bedrock集成,Couchbase让Capella iQ中的AI辅助工作流能够享受到AWS的安全态势、数据驻留控制以及SOC、HIPAA、ISO等合规认证的好处。
工程考虑
尽管Amazon Bedrock简化了大量基础设施的复杂性,但在企业级规模上构建一个生产级的多模型推理层,也带来了一系列挑战:
- 跨区域故障转移测试:最显著的挑战出现在验证跨区域故障转移场景时。为了测试在不同故障模式下(包括部分端点降级和区域限流),推理流量能否在
us-east-1和us-west-2之间正确路由,团队需要构建自定义测试工具,并模拟在开发环境中难以复现的条件。他们与AWS紧密合作,验证了请求是否能自动重新路由到健康区域而不影响响应质量或延迟,并针对生产环境调整了超时和重试配置。 - 模型基准测试:对多个候选模型进行全面的基准测试,带来了公平比较结果的复杂性。分词、上下文窗口处理以及响应格式的差异,需要在评分可被有意义地比较之前进行仔细的归一化。团队构建了自动化评估流水线,以提高可重复性并减少模型选择过程中的人工开销。