Google Developers Blog

Model routing with Google Cloud API Gateway

8.5内容质量

TL;DR · AI 摘要

Google Cloud API Gateway新增模型路由功能,支持动态将请求分发至Gemini、Claude等LLM模型,无需修改客户端代码。

核心要点

  • Google Cloud API Gateway支持Gemini、Claude和OpenAI OSS-GPT模型的动态路由
  • 通过OpenAPI 3.x的x-google-api-management扩展块配置路由规则
  • 统一入口点减少客户端代码变更,实现后端模型集中管理

结构提纲

按章节快速跳转。

  1. 介绍AI应用开发中模型路由的挑战及Google Cloud API Gateway的解决方案

  2. API Gateway作为轻量级入口层动态路由请求至不同LLM模型

  3. 通过OpenAPI 3.x扩展块定义虚拟模型与后端目标的映射关系

  4. 展示与Agent GatewayGemini Enterprise平台的无缝集成方案

  5. 实现统一入口、安全隔离和后端模型灵活替换的工程价值

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Model Routing with API Gateway
    • 核心功能
      • 动态模型路由
      • 统一入口点
      • 安全隔离
    • 技术实现
      • OpenAPI 3.x扩展
      • x-google-api-management配置
      • 后端模型映射
    • 集成方案
      • Agent Gateway集成
      • Gemini Enterprise平台

金句 / Highlights

值得收藏与分享的关键句。

#Google Cloud#API Gateway#LLM#模型路由#AI
打开原文

使用 Google Cloud API Gateway 进行模型路由 - Google Developers Blog

Google Tag Manager (noscript)

结束 Google Tag Manager (noscript)

HTML

使用 Google Cloud API Gateway 进行模型路由

2026年8月4日

Mak Ahmad

产品经理

Sanjay Pujare

软件工程师

分享

  • Facebook
  • Twitter
  • LinkedIn
  • 邮件

在构建 AI 应用时,开发者需要自由地将流量路由到最适合任务的模型,而无需硬编码端点或管理开源代理。Google Cloud API Gateway 现在提供模型路由的公共预览版功能来解决这一需求。该功能提供了一个轻量级的无服务器入口层,可接收 OpenAI 兼容请求,并动态将其路由到 GeminiClaude 或 OpenAI OSS-GPT。这种 AI 网关模式通常被称为 LLM 网关或集中式 LLM 端点。

API Gateway 可作为独立组件用于简单的基于规则的路由、限速和令牌追踪,也可与 Google Cloud 更广泛的 AI 网关生态系统和 Gemini 企业代理平台无缝集成。例如,您可以将代理的出站流量通过 Agent Gateway 进行严格的安全治理,然后将请求传递给 API Gateway 以处理到 Google 托管 LLM 的动态路由。以下是配置路由逻辑的逐步指南。

路由您的流量

这为您所有 LLM 流量提供了一个单一稳定的端点,因此您可以集中添加或替换后端模型而无需更改客户端代码。由于应用程序通过网关进行身份验证,而不是直接与模型提供商进行身份验证,客户端身份验证与后端 LLM 身份验证保持分离,使您能够在不修改应用程序的情况下轮换或更改后端凭证。

  • 配置您的路由规则:您可以在 OpenAPI 3.x 规范中使用新的 x-google-api-management 扩展块,直接将虚拟模型名称映射到特定的后端目标。
code
openapi: 3.0.4

info:

  description: 在 OAS 3.x 规范中使用模型路由
  version: 1.0.0

x-google-api-management:
  backends:
    gemini-35-flashlite:
      address: >-
        https://aiplatform.googleapis.com/v1/projects/YOUR_PROJECT_ID/locations/global/publishers/google/models/gemini-3.5-flash-lite:generateContent
      deadline: 60.0
      pathTranslation: CONSTANT_ADDRESS

    anthropic-claude-opus-47:
      address: >-
        https://aiplatform.googleapis.com/v1/projects/YOUR_PROJECT_ID/locations/global/publishers/anthropic/models/claude-opus-4-7:rawPredict
      deadline: 60.0
      pathTranslation: CONSTANT_ADDRESS

    openai-gpt-oss-120b:
      address: >-
        https://aiplatform.googleapis.com/v1/projects/YOUR_PROJECT_ID/locations/global/endpoints/openapi/chat/completions
      deadline: 60.0
      pathTranslation: CONSTANT_ADDRESS

  ai:
    models:
      routing:
        routers:
          # 路由器 1:在 Gemini(默认)和 Claude 之间路由
          gemini-claude-router:
            defaultModel:
              backend: gemini-35-flashlite
              targetModel: google/gemini-3.5-flash-lite
            rules:
              - model: "claude-opus-4-7"
                backend: anthropic-claude-opus-47
                targetModel: anthropic/claude-opus-4-7

          # 路由器 2:在 OpenAI GPT(默认)和 Gemini 之间路由
          openai-gemini-router:
            defaultModel:
              backend: openai-gpt-oss-120b
              targetModel: openai/gpt-oss-120b-maas
            rules:
              - model: "gemini-3.5-flash-lite"
                backend: gemini-35-flashlite
                targetModel: google/gemini-3.5-flash-lite

servers:
  - url: "https://my-gateway.example.com"

paths:
  /v1/chat/gemini-claude:
    post:
      summary: "端点:默认使用 Gemini,Claude 作为可选方案"
      operationId: "chatGeminiClaude"
      x-google-model-router: gemini-claude-router
      responses:
        '200':
          description: "OK"

  /v1/chat/openai-gemini:
    post:
      summary: "端点:默认使用 OpenAI,Gemini 作为可选方案"
      operationId: "chatOpenAIGemini"
      x-google-model-router: openai-gemini-router
      responses:
        '200':
          description: "OK"

YAML

已复制

注意:单个路由器引用的所有后端必须共享相同的主机(例如 aiplatform.googleapis.com)。路由会在共享的 Agent Platform 主机上选择不同的模型和路径——它不会在不同主机之间进行路由。

  1. 部署网关:部署更新后的 API 配置,使网关处于活动状态并准备好处理流量。
  1. 发送标准请求:您的应用程序只需发送标准的 OpenAI POST /v1/chat/gemini-claude 或 POST /v1/chat/openai-gemini 请求。网关会拦截请求,将负载转码为后端的原生模式,添加所需的 Agent Platform 认证令牌,并实时进行路由。例如(请为 $API_KEY 和 my-gateway.example.com 使用适当的值):
code
curl -X POST "https://my-gateway.example.com/v1/chat/gemini-claude" \
  -H "content-type: application/json" \
  -H "x-api-key: $API_KEY" \
  -d '{
        "model": "claude-opus-4-7",
        "messages": [
          {"role": "user", "content": "用五个词介绍自己"}
        ]
      }'

Shell

入门

模型路由功能现已在API网关中开放预览版。要停止管理代理并开始统一AI流量,请查看我们的文档,今天部署您的第一个模型路由器。

这些模型路由功能属于Google Cloud更广泛的AI网关生态系统的一部分:通过Apigee实现广泛的API和工具管理,通过Gemini企业代理平台的Agent Gateway实现端到端代理治理,因此您可以从轻量级起步,并在需要时扩展到其他功能。

发布在:

  • AI
  • 云服务
  • 操作指南
  • 公告
  • 最佳实践
  • 解决方案
  • 学习
  • 探索
  • 解决问题

上一篇

下一篇

相关文章

列表

AI

云服务

社区

商业与领导力

为什么Go是AI辅助软件工程的理想语言

2026年8月11日

操作指南

学习

如何使用Google微基准测试评估TPU性能

2026年7月30日

网络

公告

使用LiteRT和Gemma在树莓派上掌握边缘AI

导航点