llmproxy:模型流量统一出入口
所有 Agent 的模型请求都经过 llmproxy。它把「接哪些模型、怎么分配、怎么保护」从业务代码里抽出来,变成一个可观测、可控制的基础设施层。
四协议互译,一套接口接所有模型
OpenAI / Anthropic / Gemini / Qwen 四种厂商协议在 llmproxy 内互译:业务侧只需要写一种调用格式,换模型厂商不改代码。
# 业务代码永远只写这一种格式
POST /v1/chat/completions
{ "model": "claude-sonnet-4", "messages": [...], "stream": true }
# 实际路由到哪个厂商由 llmproxy 决定,业务无感知
四策略负载均衡
多模型 / 多供应商并存时,llmproxy 支持四种分配策略,可组合使用:
| 策略 | 行为 |
|---|---|
| 按用量 | 优先分配用量低的上游,摊平成本 |
| 按权重 | 按配置权重比例分发,主备分流 |
| 按优先级 | 关键请求优先走高质量模型,普通请求走经济模型 |
| 故障转移 | 上游不可用时自动切到备用供应商 |
SSE 透传与流式体验
流式响应(SSE)端到端透传,Agent 侧拿到的是与直连厂商一致的流,延迟透明;协议互译在流上也成立,不做降级轮询。
熔断限流与成本保护
对每个上游做熔断(连续失败自动摘除、冷却后恢复)与限流(按配额 / 速率),防止单个 Agent 的突发请求拖垮整体成本。监控页(/monitoring?tab=llm-proxy)实时展示用量、延迟与成本分布。
PKCE OAuth 鉴权
llmproxy 作为代理接入上游时,支持 PKCE OAuth 授权码流程,凭据不出服务端,浏览器端完成授权——模型密钥始终不落盘、不进提示词。