14 私有化部署、AI Gateway 与 API 权限
章节目标
设计企业 AI PoC 到生产的部署形态,理解 AI Gateway、API 网关、权限控制、成本计量和审计日志的作用。
开篇案例:为什么 PoC 能跑,生产不能上
一个部门 PoC 用本地脚本调用模型 API,效果不错。准备推广到集团时,安全团队提出一连串问题:模型 Key 放在哪里?谁能调用?敏感 Prompt 是否出境?日志保存哪些字段?成本怎么按部门统计?如果模型响应异常,是否能切换备用模型?
这些问题不是“上线前麻烦”,而是企业 AI 的基本设施。PoC 可以追求速度,生产必须把模型调用、权限、日志、成本和审计放进统一网关。
部署层级
| 阶段 | 推荐方式 | 适合场景 |
|---|---|---|
| 原型 | 本地脚本 + CSV | 验证流程价值 |
| PoC | Docker Compose + 内网服务器 | 小范围试用 |
| Beta | 后端服务 + 数据库 + 向量库 + 网关 | 部门试点 |
| 生产 | Kubernetes + 统一身份 + 日志采集 + 审计 | 企业上线 |
AI Gateway
AI Gateway 负责统一模型调用,而不是让每个业务系统直接持有模型 Key。
它通常承担:
- 模型路由。
- 统一鉴权。
- 限流和熔断。
- Token 和成本计量。
- Prompt / output 风险检测。
- 模型版本记录。
- 审计日志。
权限控制
企业 AI 系统至少要校验:
- 用户身份。
- 应用权限。
- 知识库权限。
- 工具权限。
- 数据行级权限。
- 高风险动作审批。
审计日志
建议记录:
trace_id
user_id
role
model
prompt_hash
knowledge_base_version
tool_calls
tokens
risk_flag
approval_result
timestamp
不要在日志中长期保存完整敏感 Prompt。
信创与国产模型统一接入
中国企业项目常面临信创环境、专网部署和国产模型选型。FDE 应设计 模型适配层,统一:
- 输入输出格式、错误码、超时重试。
- 结构化输出与流式响应。
- 模型版本记录与路由策略。
国产模型选型维度
| 维度 | 评估问题 |
|---|---|
| 任务匹配 | 抽取、推理、代码、多模态哪类更强 |
| 工具调用 | Function Calling / MCP 兼容性 |
| 成本延迟 | token 单价、TPM、私有化算力 |
| 私有化 | 是否支持本地权重、量化、信创硬件 |
| 合规 | 数据出境、等保、行业监管 |
开源平台私有化评估
私有化 PoC 还需评估:Llama 系、Qwen、DeepSeek 等开源权重在客户环境的推理框架(vLLM、TGI、Ollama)、向量库(Milvus、pgvector)和网关集成成本。详见 国产模型工具指南。
部署方案怎么写
一份合格的部署方案不需要一开始画得很复杂,但至少要写清:
| 模块 | 要回答的问题 |
|---|---|
| 入口 | 用户从 Web、IM、插件还是 API 进入 |
| 身份 | 如何识别用户、角色和组织 |
| 模型 | 公有 API、私有化模型还是混合路由 |
| 数据 | 文档、表格、业务系统、对象存储在哪里 |
| 工具 | 通过 MCP / API Gateway 还是直连 |
| 日志 | Trace、成本、风险标记如何记录 |
| 回滚 | 模型、Prompt、知识库和代码如何回退 |
成本从 token 走向 task
企业管理层不关心单个 token 多少钱,更关心“完成一次业务任务的成本”。FDE 应把成本拆成:
- 模型输入输出成本。
- 检索和向量库成本。
- 工具调用和系统集成成本。
- 人工复核成本。
- 运维、日志和评估成本。
最后汇总为 cost per task,再与人工基线比较,才有商业化意义。
实操任务
为你的 PoC 设计部署方案:
- 本地、内网还是云端?
- 模型调用是否走统一网关?
- 用户身份如何识别?
- 工具权限如何控制?
- 成本如何统计?
- 日志保存哪些字段?
交付物
- 部署架构图。
- AI Gateway 职责说明。
- 权限矩阵。
- 审计日志字段表。
常见误区
- 每个服务各自保存模型 Key。
- 只做用户登录,不做知识库和工具权限。
- 不记录模型和 Prompt 版本。
- 成本只看 token 单价,不看 cost per task。
检查清单
- 是否能统一管理模型调用?
- 是否能追踪一次完整任务?
- 是否能限制高风险工具?
- 是否能按用户或任务统计成本?