核心能力
从「转发」到「决策」
六大能力,把模型网关从转发器升级为智能路由平台
任务感知路由
按任务类型与难度自动匹配模型档位——翻译、摘要走轻快通道,代码、深度推理交给强模型,无需人工指定。
成本优先选择
在质量达标的候选通道中选最便宜的;简单任务自动降级到经济档,综合成本降低 40-60%。
自动容灾兜底
上游限流、宕机时自动重试并切换备用通道,30 秒内完成故障切换,请求永不因单一供应商失败。
延迟感知调度
每条通道持续采样分位数延迟(5 分钟滚动窗口),慢节点自动降权避让,P99 优先调度。
决策可解释可审计
每次路由决策随响应回传原因,并落库形成防篡改的日级哈希链——满足企业合规与审计要求。
零改造接入
OpenAI 兼容接口,SDK 改个 base_url 即可接入;声明 model=auto 进入托管路由,模型迭代与价格波动由平台吸收。
平台架构
五层路由服务平台
接入层吸收调用方差异,路由大脑是智能核心,信号闭环沉淀为数据飞轮
L5
接入层
统一 OpenAI 兼容入口 · 按调用方签发独立 Key · 声明式意图(成本带 / 延迟偏好 / model=auto)
L4
路由大脑
准入过滤 → 任务画像 → 风险定价 → 能力匹配;新策略先并行观察比对,达标后再承载流量
L3
账务引擎
上游真实成本精确到每次请求——预算管控、内部结算与用量报表的事实源
L2
信号闭环
决策日志(7 天保留)· 日级哈希链存证 · 通道健康画像 · 质量反馈——全部回流训练路由策略
L1
供应适配
多供应商池,协议方言归一 + 基础重试——可插拔替换,非核心资产
一次请求的完整决策链
0
请求接入
OpenAI 兼容请求,调用方 Key 鉴权
1
上下文估算
token 估算,排除窗口不够的模型
2
任务分类
判定类型与难度档,确定质量门槛
3
健康过滤
排除熔断中、错误率与延迟超标的通道
4
成本优选
达标候选中选成本最低者
5
加权分发
多通道按权重概率分配,记录决策
部署方式
两种形态,按需选择
今天把路由栈部署进你自己的集群,或作为托管服务直接消费
当前可用
私有化独立部署
独立的部署单元(自带 LiteLLM 实例与数据库),可落入任意 Kubernetes 集群——与 VeyraOS 平台零耦合。
- 独立命名空间与凭据
- kubectl apply 分钟级就绪
- 私有化部署,数据不出域
即将推出
托管云服务
全托管的模型路由服务:Key 自助签发、预算与配额管理——一个 Key 调用全部模型,容量与价格波动由平台吸收。
- Key 生命周期自助管理
- 预算、限流、超额熔断
- 内置用量与决策审计