Claude / GPT 多模型路由

把模型选择收进一份配置,而不是写死在业务代码里

ModelRelay Hub 用统一入口组织 Claude 与 GPT 的模型配置:业务代码只引用任务名,主模型、备选模型以及不允许降级的边界都写在一处。换模型、调分层不必再改业务、过评审、重新发版,实际可用模型以 /v1/models 返回为准。

建议顺序:注册 → 请求 /v1/models 确认主模型 → 配置任务分层与回退 → 只为可重跑任务开启降级。

把模型选择从业务代码里抽出来

模型名不该出现在业务逻辑里。哪一层调用哪个模型、失败了走不走备选,属于会随时间变化的运维决策;写死在代码里,意味着每次调整都要改业务、过评审、重新发版。

ModelRelay Hub 的做法是把这些决策收进一份服务端配置:业务代码只引用任务名(如 summarize、code_review),主模型、备选和是否允许降级由配置决定;模型名、分组和 Base URL 集中维护,具体可用模型以当前 Key 请求 /v1/models 的返回为准,而不是散落在各处的常量。

按任务分层选模型

下表按任务类型描述主模型与备选的取向,不绑定具体模型 ID;真实模型名以 /v1/models 的实际返回为准,先确认主模型再决定备选。

任务类型主模型备选是否允许降级
短文本摘要高性价比通用模型同档轻量模型允许(可重跑)
分类与打标结构化输出稳定的模型备用结构化模型允许(结果可校验)
代码生成与审查代码能力强的模型次选代码模型谨慎(需人工复核)
长上下文理解支持长上下文的模型不允许(避免截断误差)
对外交付 / 计费相关指定主模型不允许(显式失败)

回退必须显式

可回退任务:配置备选模型

摘要、分类、草稿这类可重跑、结果可校验的任务,主模型不可用时自动切到同档备选,任务照常完成。这类降级要写进配置,并限定在明确的任务范围内,而不是全局默认打开。

必须显式失败的任务:不做静默降级

输出会写库、计费或对外交付的关键任务不配置自动降级。主模型失败时应显式报错,把重试还是人工介入的决定权交给业务,而不是悄悄换一个模型继续跑、让上游拿到未经确认的结果。

记录每次回退:留痕可追

每次回退都记录触发的主模型、实际命中的备选、request id、耗时和原因。没有留痕,路由问题只能靠猜;入口开放也不代表模型库存或响应时间承诺,关键任务需自行设计失败策略。

统一配置示例

下面是一份 yaml 形式的路由配置示例:业务代码引用任务名,主模型、备选和是否允许降级都集中在这里维护。模型 ID 请替换为 /v1/models 实际返回的值。

# ModelRelay Hub 路由配置示例(模型 ID 以 /v1/models 实际返回为准)
base_url: https://modelrelayhub.top/v1
auth: Bearer ${MODELRELAY_API_KEY}

routes:
  summarize:              # 短摘要,可重跑
    primary:  <轻量通用模型>
    fallback: <同档备用模型>
    allow_degrade: true

  classify:               # 分类打标,结果可校验
    primary:  <结构化输出模型>
    fallback: <备用结构化模型>
    allow_degrade: true

  code_review:            # 代码审查,需人工复核
    primary:  <代码能力模型>
    fallback: <次选代码模型>
    allow_degrade: false

  billing_reply:          # 对外交付 / 计费相关,禁止静默降级
    primary:  <指定主模型>
    fallback: null
    allow_degrade: false  # 失败时显式报错并记录 request id

额度与计费

¥1 = $1

充值 ¥1 到账 $1 API 额度。充值兑换率与调用倍率是分开的两件事,调用扣费 = 模型基准价 × 来源倍率。

  • 低价来源倍率:default 0.22x、Kiro Pro 0.22x、特惠 0.22x、GPT Team 0.22x。
  • 官转档为独立计费分组(特惠来源),倍率 1.6x,不代表模型厂商官方服务。
  • Claude 与 GPT 走同一入口,实际模型以 /v1/models 返回为准。
  • 本站由 ModelRelay Hub 运营团队运营,是第三方兼容 API 服务,不是 Anthropic / OpenAI 或其他厂商官方服务。

符合最新活动资格的用户,累计前 ¥50 实付享 1:1 API 额度赠送,最多赠送 $50;超过部分及达到上限后的充值不再赠送。资格与口径以本站公告和后台核验为准。

常见问题

为什么要把模型名从业务代码里抽出来?

模型名、分组和 Base URL 写死在业务代码里,换模型或调整分层就得改代码、重新发版。集中到一份配置后,业务代码只引用任务名,路由由配置决定,模型变更以 /v1/models 实际返回为准。

主模型和备选模型怎么选?

按任务类型选择,不绑定具体模型 ID。摘要、分类、代码、长上下文各有偏好,实际可用模型以当前 Key 请求 /v1/models 的返回为准,先确认主模型再决定备选。

什么样的任务不该配置自动降级?

输出会直接进入计费、写库或对外交付的关键任务不做静默降级,失败时应显式报错并由业务决定重试或人工介入;只有可替代、可重跑的任务才配置备选模型。

回退发生了怎么知道?

每次回退都应记录触发的主模型、实际命中的备选模型、request id 和原因,写进日志。入口开放不代表模型库存或响应时间承诺,关键任务需自行设计失败策略。

ModelRelay Hub 是官方服务吗?

不是。本站是第三方兼容 API 服务,通过兼容网关在 Claude 与 GPT 之间路由请求,不是 Anthropic、OpenAI 或其他厂商的官方服务。