llmproxy:模型流量统一出入口

所有 Agent 的模型请求都经过 llmproxy。它把「接哪些模型、怎么分配、怎么保护」从业务代码里抽出来,变成一个可观测、可控制的基础设施层。

四协议互译,一套接口接所有模型

OpenAI / Anthropic / Gemini / Qwen 四种厂商协议在 llmproxy 内互译:业务侧只需要写一种调用格式,换模型厂商不改代码。

# 业务代码永远只写这一种格式
POST /v1/chat/completions
{ "model": "claude-sonnet-4", "messages": [...], "stream": true }

# 实际路由到哪个厂商由 llmproxy 决定,业务无感知

四策略负载均衡

多模型 / 多供应商并存时,llmproxy 支持四种分配策略,可组合使用:

策略行为
按用量优先分配用量低的上游,摊平成本
按权重按配置权重比例分发,主备分流
按优先级关键请求优先走高质量模型,普通请求走经济模型
故障转移上游不可用时自动切到备用供应商

SSE 透传与流式体验

流式响应(SSE)端到端透传,Agent 侧拿到的是与直连厂商一致的流,延迟透明;协议互译在流上也成立,不做降级轮询。

熔断限流与成本保护

对每个上游做熔断(连续失败自动摘除、冷却后恢复)与限流(按配额 / 速率),防止单个 Agent 的突发请求拖垮整体成本。监控页(/monitoring?tab=llm-proxy)实时展示用量、延迟与成本分布。

PKCE OAuth 鉴权

llmproxy 作为代理接入上游时,支持 PKCE OAuth 授权码流程,凭据不出服务端,浏览器端完成授权——模型密钥始终不落盘、不进提示词。

© 2026 crab 皖ICP备2026024716号