当前位置:首页 > 文章列表 > 科技周边 > 人工智能 > 多家模型 API 参数各不相同:用 LiteLLM 虚拟 Key 做路由和配额隔离

多家模型 API 参数各不相同:用 LiteLLM 虚拟 Key 做路由和配额隔离

来源:17golang原创 2026-09-04 16:38:27 0浏览 收藏

多家模型 API 真正难维护的地方,通常不是把请求发出去,而是每家供应商的模型名、鉴权字段和限流方式都不一样。把这些差异散落到业务服务里,换模型就要改配置、改密钥、改客户端。

更稳的做法是把 LiteLLM Proxy 放在服务端:用 model_list 把供应商部署映射成稳定的 model_name,客户端统一请求代理;再用虚拟 Key 给项目分配模型白名单、预算和速率限制。这样供应商密钥留在代理侧,调用方只拿到可撤销的项目凭证。

先记住三个结果:统一入口隔离供应商差异;虚拟 Key 隔离调用方;数据库记录让预算和消费可追踪。下面用最小配置把这条边界搭起来。

先把“供应商差异”收敛到代理层

LiteLLM 官方文档把 Proxy 定位为统一的 LLM Gateway。先准备 PostgreSQL,并在代理环境中设置 DATABASE_URL 和以 sk- 开头的 LITELLM_MASTER_KEY。供应商的真实密钥也只放在服务端环境变量。

model_list:
  - model_name: team-chat
    litellm_params:
      model: openai/
      api_key: os.environ/OPENAI_API_KEY
  - model_name: team-chat
    litellm_params:
      model: azure/
      api_key: os.environ/AZURE_API_KEY
      api_base: os.environ/AZURE_API_BASE
general_settings:
  master_key: os.environ/LITELLM_MASTER_KEY
  database_url: os.environ/DATABASE_URL

这里两个条目故意使用相同的 model_name。业务端只请求 team-chat,至于实际落到哪个部署,由代理的模型组和路由策略处理。不要把供应商密钥、api_base 或部署名写进浏览器代码。

LiteLLM 统一入口与供应商边界静态结构图
图1:查看 LiteLLM Proxy 如何把统一模型名连接到多个供应商部署,客户端只依赖代理入口。

用 model_list 和虚拟 Key 划分路由

启动代理后,用 master key 调用 /key/generate 创建虚拟 Key。请求体的 models 是这个 Key 可访问的模型名;如果只给项目开放 team-chat,就不要把管理用途的其他模型一并放进去。

curl http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "models": ["team-chat"],
    "metadata": {"project": "support-bot"},
    "max_budget": 20,
    "budget_duration": "30d",
    "rpm_limit": 30,
    "tpm_limit": 12000
  }'

返回的 sk-... 只交给对应服务使用。实际项目建议以 team 作为归属单位,再为不同应用生成 Key;这样人员变动时可以吊销单个 Key,应用额度也不会混在一个共享密钥里。

让配额与调用方绑定,而不是写死在客户端

LiteLLM 会在启用数据库时记录 Key、用户或 team 的消费,并可通过 /key/info/user/info/team/info 查询。额度设计要先回答三个问题:这个 Key 能调用哪些模型、一个周期最多花多少、并发或速率上限是多少。

不要把预算判断只写在客户端:客户端可以被绕过,而且多实例并发时很容易出现各自计数。代理层的 Key 限制负责做硬边界,业务日志再补充请求 ID、业务租户和失败原因。需要统一追踪下游用户时,可考虑官方提供的 overwrite_user_with_key_hash 设置,让经过代理校验的请求使用与 Key 绑定的稳定标识。

LiteLLM 虚拟 Key 权限预算与消费记录静态关系图
图2:查看虚拟 Key 的权限与配额边界,理解模型访问、预算限制和消费记录如何跟随调用方。

用统一 OpenAI 客户端验证隔离效果

LiteLLM Proxy 提供 OpenAI 风格的请求入口,因此业务代码只需要替换 base_url 和 Key:

from openai import OpenAI

client = OpenAI(
    api_key="sk-project-key",
    base_url="http://localhost:4000"
)
response = client.chat.completions.create(
    model="team-chat",
    messages=[{"role": "user", "content": "给我一句简短的欢迎语"}]
)
print(response.choices[0].message.content)

验证时不要只看“能返回”。至少做三组检查:项目 Key 请求允许的 team-chat;请求一个未授权模型应被代理拒绝;连续超过 rpm 或预算后应出现可识别的限流/预算错误。换供应商时只改代理配置,客户端请求形状保持不变。

上线前还要安排 Key 轮换:新 Key 生效后再吊销旧 Key;master key 仅给管理接口使用;日志里只记录 Key 的标识或哈希,不记录完整凭证。若网关需要自定义请求头,官方支持通过 litellm_key_header_name 指定头名,但仍应在网关层完成 TLS、权限和过期管理。

常见问题

虚拟 Key 能代替供应商密钥吗?不能。它是 LiteLLM Proxy 的访问凭证,供应商密钥仍由代理服务端保存。

为什么配置了多个模型却没有切换?检查多个条目的 model_name 是否形成同一模型组,并确认客户端请求的名称就是该组名,而不是供应商原始部署名。

只设置 max_budget 就够了吗?不够。预算控制花费,rpm/tpm 控制请求速度和令牌量;生产项目通常需要按调用方同时设置。

统一接口是否保证所有参数都兼容?不能保证。统一的是常见请求/响应形状,供应商特有参数、工具调用和响应能力仍应按实际模型文档做兼容测试。

小结:把供应商差异收敛到 model_list,把调用方权限收敛到虚拟 Key,再把预算、速率和消费记录放到代理与数据库层,客户端就能保持稳定,路由和配额也有了清晰的责任边界。参考:LiteLLM Virtual KeysLiteLLM Getting Started

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Chrome DevTools Application 面板如何检查 Web Storage:区分 Local Storage 与 Session StorageChrome DevTools Application 面板如何检查 Web Storage:区分 Local Storage 与 Session Storage
上一篇
Chrome DevTools Application 面板如何检查 Web Storage:区分 Local Storage 与 Session Storage
Go replace 看似生效却仍下载远程模块:用 go list -m -json 查真实来源
下一篇
Go replace 看似生效却仍下载远程模块:用 go list -m -json 查真实来源
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    134次使用
  • C-Eval中文评测基准:大语言模型多学科能力评估指南
    C-Eval
    深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
    51次使用
  • ClickPrompt:AI提示词生成与优化工具,支持Stable Diffusion、ChatGPT及代码辅助
    ClickPrompt
    ClickPrompt是一款专为AI提示词编写者设计的开源在线工具,支持Stable Diffusion绘图、ChatGPT对话及GitHub Copilot代码辅助。提供Prompt自动生成、一键运行、社区分享及可视化优化功能,帮助用户高效获取精准AI输出。
    24次使用
  • Google AI提示词库:免费官方Prompt模板与使用指南
    Google AI提示词库
    探索Google Cloud官方生成式AI提示词库,提供免费、无需登录的中英双语Prompt模板。涵盖内容创作、代码优化、数据分析等场景,助您快速提升AI交互效率与质量。
    29次使用
  • Gradio是什么?Python开源库快速构建机器学习Web演示界面
    Gradio
    Gradio是一个用于构建机器学习和数据科学Web应用的开源Python库。支持快速创建交互界面,获Google、Meta等大厂青睐,适合模型演示、部署反馈及调试。
    132次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码