智能路由
TokenAPIBay 的智能路由背后跑了两套评分:规则引擎快速初筛,AI 模型深度语义评分。两轮叠加,决定最终走哪个模型。大致流程是这样的:
① 规则预评分。300+ 维规则引擎从逻辑推理、代码生成、多步指令、领域专业性这些指标快速扫一遍,毫秒级出初判。
② AI 二次评分。模型做深度语义理解,算出一个精确的复杂度分数。两轮得分叠加,得到最终等级(Simple / Standard / Complex / Reasoning)。
③ 智能路由。拿最终等级去模型池里筛——能接住的所有模型里,在精度不下降的前提下挑最便宜的。全程毫秒级,不用你操心。
你正常指定 model 字段就行,路由引擎会优先从模型池匹配合适模型;没匹配上就退回你指定的模型。
工作原理
智能路由的决策流程:
① 你发起请求,指定 model 字段(例如 deepseek-v4-flash)
② 系统验证 API Key,查出绑定的模型池和智能路由配置
③ 300+ 维规则引擎对请求内容快速预评分(逻辑推理、代码生成、多步指令等维度)
④ AI 模型评分引擎对请求进行二次语义评分,输出精确复杂度分数
⑤ 规则引擎根据双重评分结果匹配模型能力等级,在精度不下降的前提下按价格排序,选最优
⑥ 路由到选中的模型(如无模型池匹配则退回你指定的模型)混合评分体系
两套评分各管各的:
| 评分层 | 职责 | 技术方案 |
|---|---|---|
| 规则评分(300+ 维) | 对请求内容快速预评分,覆盖逻辑推理、代码生成、多步指令、领域专业性等维度 | 可配置的 300+ 维规则策略,毫秒级完成初判 |
| 模型评分(AI 语义) | 对请求进行深度语义理解,输出精确的复杂度分数 | 分类模型推理,与规则评分叠加得出最终等级 |
规则引擎管"快"——秒级扫完 300+ 维指标。AI 模型管"准"——语义评分定复杂度。两轮叠加,每次请求都在成本和精度之间找到平衡。
难度等级
系统根据 Prompt 内容分为 4 个等级,等级越高越复杂:
| 等级 | 说明 | 示例 Prompt |
|---|---|---|
| Simple | 简单闲聊、常识问答 | "今天几号?""1+1=?" |
| Standard | 日常办公任务 | "帮我写个请假邮件" |
| Complex | 需要一定推理能力 | "写个 Python 爬虫" |
| Reasoning | 深度推理、专业分析 | "解释 Transformer 架构" |
路由决策示例
假设你的 API Key 绑定了 DeepSeek-V4-Flash、DeepSeek-V4-Pro 和 GLM 5.2:
| 你的 Prompt | 评估等级 | 可用候选 | 选中模型 | 原因 |
|---|---|---|---|---|
| "今天天气怎么样" | Simple | Flash、Pro、GLM | DeepSeek-V4-Flash | 最低价满足需求 |
| "写个带用户认证的 API" | Complex | 仅 GLM | GLM 5.2 | 其他模型能力不够 |
| "解释量子纠缠" | Standard | Pro、GLM | DeepSeek-V4-Pro | 够用且价格合理 |
在 API Key 上启用
- 登录 控制台,进入 API 管理 → API 密钥
- 找到目标密钥,点击编辑
- 在 已绑定模型 中添加 2 个或以上能力跨度较大的模型(如一个轻量模型加一个旗舰模型)
- 智能路由自动生效,无需额外配置
常见场景
场景:我想只用便宜模型
API Key 只绑定 DeepSeek-V4-Flash 一个模型。没得选,全部走 Flash。
场景:我想省成本但复杂任务用好模型
绑定 Flash + GLM 5.2。系统自动在简单任务走 Flash,复杂任务走 GLM。
场景:我就想只用旗舰模型
绑定 GLM 5.2 或 DeepSeek-V4-Pro 一个模型。所有流量全走旗舰。
场景:绑了多个模型但总觉得路由不对
模型能力跨度不够。如果绑了两个能力差不多的模型,价格更低的会(几乎)一直胜出。建议绑定能力差距大的模型,路由效果才有意义。