基于ModelArts Standard专属资源池的自建MaaS推理解决方案技术架构
1. 用途和受众
1.1 预期用途
- 指导基于ModelArts Standard专属资源池的自建MaaS推理解决方案的设计和开发。
- 为售前、解决方案设计、实施和审查提供可重用的架构模式。
- 作为解决方案手册、交付包或实际部署的架构基础。
1.2 目标受众
| 观众 | 典型角色 | 预期用途 |
|---|---|---|
| 内部 | 架构师、开发人员、交付架构师、运营工程师 | 解决方案设计 |
| 外部 | 客户、合作伙伴、ISV、开发人员 | 集成 |
2. 参考架构概述
2.1 架构描述
基于ModelArts Standard专属资源池的自建MaaS推理解决方案为大型政府、企业等,构建一个基于内网安全隔离、全托管的云上自建专属MaaS,直接为客户提供高可靠性的AI API服务,将客户从繁重的底层模型运维部署中解放出来,聚焦AI业务创新,敏捷地为客户提供主流先进模型API,快速扩容。
2.2 业务背景
| 项目 | 描述 |
|---|---|
| 业务问题 | 大型政府、企业等客户需要AI大模型推理服务,但自建模型运维部署成本高、周期长,且对数据安全和网络隔离有严格合规要求,公网访问存在安全风险,模型扩容和故障迁移缺乏统一管理 |
| 期望的结果 | 构建基于内网安全隔离、全托管的云上自建专属MaaS,直接提供高可靠AI API服务,客户无需关注底层模型运维,聚焦AI业务创新,敏捷获取主流先进模型API并支持快速扩容 |
| 主要用户 | 大型政府、企业等对数据安全、网络隔离和合规性有严格要求的组织 |
| 关键制约因素 | 数据安全合规要求(AI算力资源需物理专属、VPC内网隔离,与公网完全隔离);模型运维复杂度高(需SRE统一运维,重点看);内网互通要求(线下DC与云上VPC打通);性能指标约束(TTFT、TPOT及并发时延) |
| 成功指标 | AI API服务可用性及可靠性(多实例部署+故障自动迁移);安全隔离级别(物理专属+VPC内网+无外网攻击风险);扩容响应速度(按实例成套扩容);运维成本降低(SRE统一运维,减少运维工作量);API治理能力(鉴权、配额、流控、Token运营) |
2.3 架构优点
- 全链路内网隔离:全链路通过VPN接入租户区VPC内网访问,与公网完全隔离,安全性高
- 智算资源物理专属:AI算力资源物理专属,提供更高的安全级别
- 自建MaaS网关统一管控:自建MaaS网关支持模型故障迁移、基于APIKEY的鉴权、配额、流控、Token运营等能力
- 统一运维降本:AI算力通过ModelArts Standard管理,SRE统一运维,减少运维工作量
2.4 设计关注点
3.1 性能:
自建MaaS层在容器集群上,部署AI网关承载业务高峰流量,提供低时延的网关管理能力,后端AI专属资源池通过PD分离架构部署大模型,提供高性能推理
3.2 安全:
通过全内网访问,隔离互联网流量攻击,容器集群通过容器版HSS提供节点补丁及漏洞防护能力
3.3 可扩展性:
网关层容器化部署,可快速横向扩容节点和ELB,敏捷应对高峰流量冲击,AI算力资源负载过高,可对专属资源池扩容,使用相同部署更多模型,并对作为统一模型后端,承载推理业务
3.4 运维可观测性:
| 核心监控维度 | 核心监控指标 |
|---|---|
| 资源利用率监控 | - CPU / 内存:实时采集推理实例的 CPU 使用率、Core 数、内存使用率、内存使用量(MB),反映实例基础资源负载。 - NPU(异构资源):采集 NPU 使用率、显存使用率 / 占用量,精准监控 AI 加速硬件负载,适配大模型、深度学习推理场景。 |
| 网络流量监控 | - 网络上行流速 / 网络下行流速:实时统计接收 / 发送流量速率(Byte/s),识别网络带宽瓶颈、异常流量攻击。 - 连接数:实时在线连接数、连接数趋势,判断服务并发承载能力、长连接泄漏问题。 |
| 请求性能监控 | - 服务请求数:统计周期内 2xx(成功)、4xx、5xx(异常)请求总量,直观反映服务可用性。 - 服务请求QPS:每秒请求次数,衡量服务并发处理能力。 - 服务请求时延:平均时延、TP50/TP90/TP99时延(毫秒),定位慢请求、性能瓶颈。 - 原理:拦截推理服务入口流量,记录请求收发时间、响应码,按统计周期聚合计算,支持毫秒级时延精度。 |
| 模型推理专项监控(大模型适配) | - 首Token时延:请求发起至返回第一个Token的时延,大模型流式推理核心指标,反映模型初始化与首帧生成效率。 - 非首Token时延:后续每个Token生成时延,衡量模型持续推理稳定性。 - Token数统计:输入/输出/总Token数及增量,适配计费、模型输入输出规模分析。 |
3.5 可靠性:模型使用多实例部署,避免出现单点故障;通过自建MaaS网关Proxy Model统一入口实现模型级故障切换,使后端任意模型出现异常时,流量可自动切换到备用模型,确保推理服务稳定运行
2.5 典型架构

1.网络接入:客户线下DC和华为云租户区VPC网络通过VPN或者云专线打通;
2.自建MaaS网关部署:使用CCE部署开源LiteLLM AI网关组件,提供API鉴权等能力,基于网关构建故障迁移,模型代理链接;
3.创建专属资源池挂载SFS Turbo:在Modelarts Standard中完成专属资源池创建,需要打通MaaS VPC和ModelArts VPC,操作参考链接,开源权重存放在SFS Turbo中,挂载到专属资源池,模型部署权重从SFS Turbo加载,操作参考链接;
4.模型资源规划及部署:在专属资源池中部署大模型,选择API Key认证,操作参考链接,模型部署指导参考昇腾开源社区。
5.通过内网访问推理在线服务:打通Modelarts Standard内网访问,实现和线下内网互通,参考链接
6.日志集中:MA及AI网关日志传送至AOM,LTS,CTS进行统一监控、审计及告警
2.6 流程描述
本方案部署流程分为六个阶段:
①网络接入(VPN/云专线打通客户线下DC与华为云VPC);
②AI网关部署(CCE部署LiteLLM网关,提供鉴权与故障迁移);
③SFS Turbo内存放开源资源,它与专属资源池打通关联,支持后续模型部署访问;
④创建专属资源池,对模型资源规划,使用专属资源池算力部署模型;
⑤打通ModelArts与VPC内网,实现线下通过VPC网络内网互通,调用大模型API;
⑥关键业务指标及日志集中汇集,支持对日常故障处理、运行优化提供可观测能力(MA及AI网关日志统一传送至AOM、LTS、CTS进行监控审计)。
2.7 模型互备容灾方案
自建MaaS网关后端假设存在两个异构真实大模型服务:DeepSeek V4 Flash、GLM‑5.2。
在 LiteLLM‑Proxy 中,为两个底层异构模型配置完全相同的对外虚拟代理模型ID,并将二者配置为互为主备容灾关系。对外业务侧仅感知这一个统一虚拟模型ID,业务代码无需感知底层模型实例切换,由网关层完成故障自动漂移。
说明:二者为异构模型,不是同模型多副本;主备不是传统“主写备读”,而是故障降级互备:任意一个后端发生不可用,流量自动漂移至另一个模型。
2.7.1 LiteLLM配置要点
1. 在 model_list 中,两条记录填写model_name(对外虚拟代理ID),分别指向底层真实模型:deepseek/deepseek‑v4‑flash、zhipu/glm‑5.2。
2. 通过 routing_strategy: fallback 开启故障降级策略,配置 fallback_strategy,实现互备:
- 正常优先流量流向主模型(DeepSeek V4 Flash);
- 当主模型触发故障条件,自动切流至备模型 GLM‑5.2;
- 同时配置反向降级:若GLM‑5.2作为运行中的服务出现故障,同样切回DeepSeek V4 Flash,实现双向互备。
3. 完整声明两个模型的 model_info.max_input_tokens:DeepSeek V4 Flash、GLM‑5.2 均支持超大上下文,网关预校验避免超窗口报错。
4. 开启冷却熔断:配置 fallback_cooldown_time,故障后端进入冷却窗口,冷却结束后尝试回切主模型;避免短时间大量反复抖动切换。
5. 捕获的可触发fallback的异常集合:连接超时、5xx、限流429、鉴权错误、上下文超限等;可按需排除业务类400参数错误,不触发降级。
2.7.2 核心架构逻辑
1. 业务接入层:业务方固定调用同一个虚拟代理模型ID,请求格式遵循OpenAI协议,无感知底层模型切换。
2. LiteLLM Proxy网关层
- 收到请求后优先路由至当前主模型;
- 当主模型返回故障/超时/熔断状态,网关不向上游返回错误,自动复用原始请求,转发至互备的另一异构模型;
- 记录SpendLogs:日志中保存虚拟模型ID、实际选中底层模型名称、触发fallback的错误原因,用于事后审计、统计降级发生频次。
- 响应原样透传给业务方,OpenAI返回结构保持兼容。
3. 回切逻辑:故障模型经过冷却时间后,下一次新请求优先尝试原来的主模型;如果主模型已经恢复,则切回主模型;依旧故障则继续使用备模型。
2.7.3 约束与风险点(异构模型互备重点)
⚠️ DeepSeek V4 Flash 与 GLM‑5.2 属于异构模型,输出风格、能力、最大输出、工具调用能力不完全等价,降级会带来业务效果差异。
-
能力差异风险
- 代码能力、指令遵循、工具调用格式、SSE流式输出细节存在差异;业务需要接受降级后输出行为变化。
- 若业务强依赖特定模型输出格式,异构互备会产生兼容性问题。
-
上下文窗口校验
虽然两个模型均支持超长上下文,但二者标称上限不同,网关开启enable_pre_call_checks,请求转发前校验候选模型是否可承载当前prompt token数;避免降级后触发上下文超限报错。 -
会话状态不感知
LiteLLM fallback是单次请求级别降级,无会话亲和。一轮会话内,可能前一条请求走DeepSeek,下一条故障降级切到GLM‑5.2;多轮对话上下文连续度、记忆一致性由上层业务处理,网关不做会话绑定。 -
流式SSE降级代价
SSE流式请求已经部分返回chunk之后,后端发生故障,LiteLLM无法回溯重放已经输出的内容;仅完整未开始返回的请求才会触发fallback。已经吐出部分流的请求会直接报错,不会自动切换备模型重试。
2.7.4 监控指标建议
- 虚拟模型总QPS;
- fallback触发次数、fallback错误类型分布;
- 底层两个真实模型各自的token消耗;
- 模型冷却熔断状态;
- 降级请求占比告警:当异构互备降级占比超过阈值,触发告警,代表主模型持续异常。
2.7 云服务产品清单
| 分类 | 服务或产品 | 推荐配置 |
|---|---|---|
| 接入层 | VPN/云专线、ELB、VPCEP | |
| 自建MaaS应用层 | CCE Turbo、ECS | |
| 数据层 | SFS Turbo、RDS for PostgreSQL、SWR | |
| 推理服务层 | ModelArts Standard | |
| 运维管理层 | AOM、LTS、CES、CTS |
3. 参考链接
- LiteLLM, Unified AI Management Gateway:https://support.huaweicloud.com/intl/en-us/litellm-aislt/litellm_01.html
- LCreating a Dedicated Resource Pool:https://support.huaweicloud.com/intl/en-us/usermanual-standard-modelarts/resmgmt-modelarts_0004.html
- Associating the Network of a Dedicated Resource Pool File System with SFS Turbo:https://support.huaweicloud.com/intl/en-us/resmgmt-modelarts/resmgmt-modelarts_0096.html
- Deploying and Using Real-Time Inference:https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0002.html
- Ascend vLLM Open Source Community:https://docs.vllm.ai/projects/ascend/en/latest/index.html
- Accessing a Real-Time Service Through a Private Network
:https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0011.html - Ascend vLLM Open Source Community:https://docs.vllm.ai/projects/ascend/en/latest/index.html
- Viewing Real-Time Service Logs: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0020.html
- Viewing Events of a Real-Time Service: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0019.html
- Viewing Performance Metrics of a Real-Time Service on ModelArts: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0027.html
- Viewing Performance Metrics of a Real-Time Service on AOM: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0026.html
- Using CTS to Audit Inference Service Operations: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0103.html
4. 使用限制
- NA
附录 A. 术语和缩略语
| 术语 | 定义 |
|---|---|
| AI | Artificial Intelligence,人工智能 |
| MaaS | Model as a Service,模型即服务 |
| API | Application Programming Interface,应用程序编程接口 |
| APIKEY | API Key,API 密钥(接口鉴权密钥) |
| VPC | Virtual Private Cloud,虚拟私有云 |
| VPN | Virtual Private Network,虚拟专用网络 |
| DC | Data Center,数据中心 |
| CCE | Cloud Container Engine,云容器引擎(华为云) |
| ECS | Elastic Cloud Server,弹性云服务器 |
| SFS Turbo | Scalable File Service Turbo,弹性文件服务 Turbo 版 |
| SWR | Software Repository for Containers,容器镜像服务 |
| ELB | Elastic Load Balance,弹性负载均衡 |
| VPCEP | VPC Endpoint,VPC 终端节点 |
| ModelArts / MA | ModelArts,华为云 AI 开发平台(MA 为其简写) |
| LM | Large Model / Language Model,大模型 / 语言模型 |
| SRE | Site Reliability Engineering,站点可靠性工程(可靠性运维) |
| AOM | Application Operations Management,应用运维管理 |
| LTS | Log Tank Service,日志审计服务 |
| CTS | Cloud Trace Service,云审计服务 |
| CES | Cloud Eye Service,云监控服务 |
| HSS | Host Security Service,主机安全服务 |
| TTFT | Time To First Token,首 Token 时间(首字响应时延) |
| TPOT | Time Per Output Token,每输出 Token 耗时 |
| Token | Token,词元(模型推理的最小输出单位) |
| KPI | Key Performance Indicator,关键绩效指标 |
| CSM | Customer Success Manager,客户成功经理 |
| SA | Solution Architect,解决方案架构师 |
| ISV | Independent Software Vendor,独立软件供应商 |
| IaC | Infrastructure as Code,基础设施即代码 |
| vLLM | v Large Language Model,高吞吐量大模型推理加速框架(开源项目) |
| LiteLLM | Lite Large Language Model,轻量级大模型代理网关(开源项目) |
| OpenAI | Open AI,OpenAI 协议(文中指 OpenAI 兼容的 API 协议) |
| Ingress | Ingress,Kubernetes 入口路由资源(网关流量入口) |
附录 B. 图表约定
- 使用实线箭头表示同步请求或数据流。
- 对异步事件、控制关系或可选流使用虚线箭头。
- 标记信任边界、区域、可用区、VPC 和子网。
- 在有用的地方标记带有协议、方向和关键安全特征的箭头。
- 对访问、应用程序、数据、安全和操作层使用一致的颜色。
- 包含图例并避免仅依靠颜色来传达含义。
- 点赞
- 收藏
- 关注作者
评论(0)