智能路由

TokenAPIBay 的智能路由背后跑了两套评分:规则引擎快速初筛,AI 模型深度语义评分。两轮叠加,决定最终走哪个模型。大致流程是这样的:

① 规则预评分。300+ 维规则引擎从逻辑推理、代码生成、多步指令、领域专业性这些指标快速扫一遍,毫秒级出初判。

② AI 二次评分。模型做深度语义理解,算出一个精确的复杂度分数。两轮得分叠加,得到最终等级(Simple / Standard / Complex / Reasoning)。

③ 智能路由。拿最终等级去模型池里筛——能接住的所有模型里,在精度不下降的前提下挑最便宜的。全程毫秒级,不用你操心。

你正常指定 model 字段就行,路由引擎会优先从模型池匹配合适模型;没匹配上就退回你指定的模型。

工作原理

智能路由的决策流程:

流程
① 你发起请求,指定 model 字段(例如 deepseek-v4-flash)
② 系统验证 API Key,查出绑定的模型池和智能路由配置
③ 300+ 维规则引擎对请求内容快速预评分(逻辑推理、代码生成、多步指令等维度)
④ AI 模型评分引擎对请求进行二次语义评分,输出精确复杂度分数
⑤ 规则引擎根据双重评分结果匹配模型能力等级,在精度不下降的前提下按价格排序,选最优
⑥ 路由到选中的模型(如无模型池匹配则退回你指定的模型)

混合评分体系

两套评分各管各的:

评分层职责技术方案
规则评分(300+ 维)对请求内容快速预评分,覆盖逻辑推理、代码生成、多步指令、领域专业性等维度可配置的 300+ 维规则策略,毫秒级完成初判
模型评分(AI 语义)对请求进行深度语义理解,输出精确的复杂度分数分类模型推理,与规则评分叠加得出最终等级

规则引擎管"快"——秒级扫完 300+ 维指标。AI 模型管"准"——语义评分定复杂度。两轮叠加,每次请求都在成本和精度之间找到平衡。

难度等级

系统根据 Prompt 内容分为 4 个等级,等级越高越复杂:

等级说明示例 Prompt
Simple简单闲聊、常识问答"今天几号?""1+1=?"
Standard日常办公任务"帮我写个请假邮件"
Complex需要一定推理能力"写个 Python 爬虫"
Reasoning深度推理、专业分析"解释 Transformer 架构"

路由决策示例

假设你的 API Key 绑定了 DeepSeek-V4-Flash、DeepSeek-V4-Pro 和 GLM 5.2:

你的 Prompt评估等级可用候选选中模型原因
"今天天气怎么样"SimpleFlash、Pro、GLMDeepSeek-V4-Flash最低价满足需求
"写个带用户认证的 API"Complex仅 GLMGLM 5.2其他模型能力不够
"解释量子纠缠"StandardPro、GLMDeepSeek-V4-Pro够用且价格合理

在 API Key 上启用

  1. 登录 控制台,进入 API 管理 → API 密钥
  2. 找到目标密钥,点击编辑
  3. 已绑定模型 中添加 2 个或以上能力跨度较大的模型(如一个轻量模型加一个旗舰模型)
  4. 智能路由自动生效,无需额外配置
如果 API Key 只绑定了一个模型,智能路由不会切换模型,该模型处理所有等级的任务。

常见场景

场景:我想只用便宜模型

API Key 只绑定 DeepSeek-V4-Flash 一个模型。没得选,全部走 Flash。

场景:我想省成本但复杂任务用好模型

绑定 Flash + GLM 5.2。系统自动在简单任务走 Flash,复杂任务走 GLM。

场景:我就想只用旗舰模型

绑定 GLM 5.2 或 DeepSeek-V4-Pro 一个模型。所有流量全走旗舰。

场景:绑了多个模型但总觉得路由不对

模型能力跨度不够。如果绑了两个能力差不多的模型,价格更低的会(几乎)一直胜出。建议绑定能力差距大的模型,路由效果才有意义。