什么是 LLM 网关?
LLM 网关是一个端点和一把密钥,把请求路由到众多模型供应商。下面讲它做什么、为何有帮助,以及谁真正需要它。
LLM 网关就是架在众多模型供应商之前的一个 API:一把密钥、一张账单、一个端点,路由和故障切换都替你处理好。UnoRouter 是开源网关,通过 OpenAI 兼容 API 提供 200+ 个模型,另有 Anthropic 和 Gemini 原生端点,大多数模型有免费额度,其余按量计费。
LLM 网关是一个单一的 API 端点,坐落在众多模型供应商前面,把你的请求路由到你所要的那个模型。与其为每个实验室分别持有一把密钥、一个基础 URL 和各自的 SDK 怪癖,不如持有一把密钥和一个兼容 OpenAI 的端点,其余的交给网关处理。这与经典后端工作中的 API 网关是同一个想法,只是用到了语言模型上。下面讲它给你带来什么。
朴素的定义
网关暴露一个兼容 OpenAI 的接口,通常是 /v1/chat/completions,并在幕后把你请求中的 model 字段映射到一个真实供应商。你每次发送同样形状的请求;网关挑选上游,附上正确的供应商凭证,翻译任何怪癖,并把响应以流的形式传回。换模型时你的代码不变,因为你编程所针对的契约保持恒定。
它为何有帮助
三处收益。一次集成:针对一个端点编程,你就能使用网关承载的每个模型,无需按供应商各设一个客户端。一张账单:跨所有供应商的用量落在一个余额上,而不是十几张分开的发票。以及轻松切换:改一个模型只是一行编辑,于是你可以按任务追逐最佳价格或质量,而无需重新铺设你的应用。对多数构建者而言,单是在集成上省下的时间,就是全部的理由。
它在底层如何运作
当一个请求到来,网关读取 model 中的名称,查出匹配的上游供应商,换入该供应商的凭证,重写供应商特有的请求体字段,再把调用转发出去。流式的 token 经由同一连接返回,所以在你这边看起来就是一次普通的 OpenAI 调用。好的网关会加上对瞬时错误的重试、用量与成本的记账,以及一份最新的模型目录,于是新发布会自行出现,而你什么都不必动。
谁真正需要它
如果你使用不止一个模型,打算随价格和质量的变化切换模型,或者构建任何不该被硬绑定到单一厂商的东西,那你就需要一个网关。编程智能体、聊天应用、角色聊天前端和内部工具都能从中受益。如果你确实只调用某一家供应商的某一个模型,且从不打算更换,那直接用供应商的密钥更简单。其余所有人都能靠网关省下实实在在的功夫。
简而言之
LLM 网关把众多供应商变成一个端点、一把密钥和一张账单,于是你集成一次,便能自由换模型。UnoRouter 正是这种模子里的兼容 OpenAI 的网关:一把密钥为代码和聊天同样触达 200 多个模型,配上不会过期的按用量付费额度。如果你触及不止一个模型,网关是更干净的根基。
常见问题
什么时候需要 LLM 网关,而不是直接用供应商密钥?
当你用到不止一个模型系列、希望在某个供应商宕机时自动切换,或想要一张账单的时候。网关免去了在每家厂商开账号的麻烦,改一个字符串就能换模型。
LLM 网关会增加延迟吗?
多一跳而已,通常是几十毫秒,实际使用中会被流式输出掩盖。响应慢更多是模型本身的问题,而非网关。
UnoRouter 提供哪些端点?
OpenAI 兼容的 /v1/chat/completions、/v1/responses 和 /v1/embeddings,Anthropic 原生的 /v1/messages,以及 Gemini 原生的 /v1beta,全部在一把密钥之后。
Nevika 接受任意 OpenAI 兼容端点作为自定义代理。这里给出一分钟的配置流程、该选哪个模型,以及大家最常撞到的两个报错。
一位角色扮演玩家在 UnoRouter 上从记忆力、情感深度、推进力和创意写作四方面为三个 Claude Opus 版本排名。4.8 胜出,4.6 力压 4.7,每个版本都有各自明显的强项与短板。
SpicyChat 是一个零配置的 RP 网站,它的记忆和上下文被拦在付费档后面。UnoRouter 保留那份轻松的开局,还加上 200+ 个由你挑的模型、深度 lorebooks,以及一把还能运行编程智能体的密钥。