基于ModelArts Standard专属资源池的自建MaaS推理解决方案技术架构

举报
华为云架构中心 发表于 2026/08/26 10:56:40 2026/08/26
【摘要】 基于ModelArts Standard专属资源池的自建MaaS推理解决方案为大型政府、企业等,构建一个基于内网安全隔离、全托管的云上自建专属MaaS,直接为客户提供高可靠性的AI API服务,将客户从繁重的底层模型运维部署中解放出来,聚焦AI业务创新,敏捷地为客户提供主流先进模型API,快速扩容。

1. 用途和受众

1.1 预期用途

  • 指导基于ModelArts Standard专属资源池的自建MaaS推理解决方案的设计和开发。
  • 为售前、解决方案设计、实施和审查提供可重用的架构模式。
  • 作为解决方案手册、交付包或实际部署的架构基础。

1.2 目标受众

观众 典型角色 预期用途
内部 架构师、开发人员、交付架构师、运营工程师 解决方案设计
外部 客户、合作伙伴、ISV、开发人员 集成

2. 参考架构概述

2.1 架构描述

基于ModelArts Standard专属资源池的自建MaaS推理解决方案为大型政府、企业等,构建一个基于内网安全隔离、全托管的云上自建专属MaaS,直接为客户提供高可靠性的AI API服务,将客户从繁重的底层模型运维部署中解放出来,聚焦AI业务创新,敏捷地为客户提供主流先进模型API,快速扩容。

2.2 业务背景

项目 描述
业务问题 大型政府、企业等客户需要AI大模型推理服务,但自建模型运维部署成本高、周期长,且对数据安全和网络隔离有严格合规要求,公网访问存在安全风险,模型扩容和故障迁移缺乏统一管理
期望的结果 构建基于内网安全隔离、全托管的云上自建专属MaaS,直接提供高可靠AI API服务,客户无需关注底层模型运维,聚焦AI业务创新,敏捷获取主流先进模型API并支持快速扩容
主要用户 大型政府、企业等对数据安全、网络隔离和合规性有严格要求的组织
关键制约因素 数据安全合规要求(AI算力资源需物理专属、VPC内网隔离,与公网完全隔离);模型运维复杂度高(需SRE统一运维,重点看);内网互通要求(线下DC与云上VPC打通);性能指标约束(TTFT、TPOT及并发时延)
成功指标 AI API服务可用性及可靠性(多实例部署+故障自动迁移);安全隔离级别(物理专属+VPC内网+无外网攻击风险);扩容响应速度(按实例成套扩容);运维成本降低(SRE统一运维,减少运维工作量);API治理能力(鉴权、配额、流控、Token运营)

2.3 架构优点

  • 全链路内网隔离:全链路通过VPN接入租户区VPC内网访问,与公网完全隔离,安全性高
  • 智算资源物理专属:AI算力资源物理专属,提供更高的安全级别
  • 自建MaaS网关统一管控:自建MaaS网关支持模型故障迁移、基于APIKEY的鉴权、配额、流控、Token运营等能力
  • 统一运维降本:AI算力通过ModelArts Standard管理,SRE统一运维,减少运维工作量

2.4 设计关注点

3.1 性能:
  自建MaaS层在容器集群上,部署AI网关承载业务高峰流量,提供低时延的网关管理能力,后端AI专属资源池通过PD分离架构部署大模型,提供高性能推理
3.2 安全:
  通过全内网访问,隔离互联网流量攻击,容器集群通过容器版HSS提供节点补丁及漏洞防护能力
3.3 可扩展性:
  网关层容器化部署,可快速横向扩容节点和ELB,敏捷应对高峰流量冲击,AI算力资源负载过高,可对专属资源池扩容,使用相同部署更多模型,并对作为统一模型后端,承载推理业务
3.4 运维可观测性:

核心监控维度 核心监控指标
资源利用率监控 CPU / 内存:实时采集推理实例的 CPU 使用率、Core 数、内存使用率、内存使用量(MB),反映实例基础资源负载。
NPU(异构资源):采集 NPU 使用率、显存使用率 / 占用量,精准监控 AI 加速硬件负载,适配大模型、深度学习推理场景。
网络流量监控 网络上行流速 / 网络下行流速:实时统计接收 / 发送流量速率(Byte/s),识别网络带宽瓶颈、异常流量攻击。
连接数:实时在线连接数、连接数趋势,判断服务并发承载能力、长连接泄漏问题。
请求性能监控 服务请求数:统计周期内 2xx(成功)、4xx、5xx(异常)请求总量,直观反映服务可用性。
服务请求QPS:每秒请求次数,衡量服务并发处理能力。
服务请求时延:平均时延、TP50/TP90/TP99时延(毫秒),定位慢请求、性能瓶颈。
原理:拦截推理服务入口流量,记录请求收发时间、响应码,按统计周期聚合计算,支持毫秒级时延精度。
模型推理专项监控(大模型适配) 首Token时延:请求发起至返回第一个Token的时延,大模型流式推理核心指标,反映模型初始化与首帧生成效率。
非首Token时延:后续每个Token生成时延,衡量模型持续推理稳定性。
Token数统计:输入/输出/总Token数及增量,适配计费、模型输入输出规模分析。

3.5 可靠性:模型使用多实例部署,避免出现单点故障;通过自建MaaS网关Proxy Model统一入口实现模型级故障切换,使后端任意模型出现异常时,流量可自动切换到备用模型,确保推理服务稳定运行

2.5 典型架构

1.网络接入:客户线下DC和华为云租户区VPC网络通过VPN或者云专线打通;
2.自建MaaS网关部署:使用CCE部署开源LiteLLM AI网关组件,提供API鉴权等能力,基于网关构建故障迁移,模型代理链接
3.创建专属资源池挂载SFS Turbo:在Modelarts Standard中完成专属资源池创建,需要打通MaaS VPC和ModelArts VPC,操作参考链接,开源权重存放在SFS Turbo中,挂载到专属资源池,模型部署权重从SFS Turbo加载,操作参考链接
4.模型资源规划及部署:在专属资源池中部署大模型,选择API Key认证,操作参考链接,模型部署指导参考昇腾开源社区
5.通过内网访问推理在线服务:打通Modelarts Standard内网访问,实现和线下内网互通,参考链接
6.日志集中:MA及AI网关日志传送至AOM,LTS,CTS进行统一监控、审计及告警

2.6 流程描述

本方案部署流程分为六个阶段:
①网络接入(VPN/云专线打通客户线下DC与华为云VPC);
②AI网关部署(CCE部署LiteLLM网关,提供鉴权与故障迁移);
③SFS Turbo内存放开源资源,它与专属资源池打通关联,支持后续模型部署访问;
④创建专属资源池,对模型资源规划,使用专属资源池算力部署模型;
⑤打通ModelArts与VPC内网,实现线下通过VPC网络内网互通,调用大模型API;
⑥关键业务指标及日志集中汇集,支持对日常故障处理、运行优化提供可观测能力(MA及AI网关日志统一传送至AOM、LTS、CTS进行监控审计)。

2.7 模型互备容灾方案

  自建MaaS网关后端假设存在两个异构真实大模型服务:DeepSeek V4 FlashGLM‑5.2
在 LiteLLM‑Proxy 中,为两个底层异构模型配置完全相同的对外虚拟代理模型ID,并将二者配置为互为主备容灾关系。对外业务侧仅感知这一个统一虚拟模型ID,业务代码无需感知底层模型实例切换,由网关层完成故障自动漂移。

说明:二者为异构模型,不是同模型多副本;主备不是传统“主写备读”,而是故障降级互备:任意一个后端发生不可用,流量自动漂移至另一个模型。

2.7.1 LiteLLM配置要点
 1. 在 model_list 中,两条记录填写model_name(对外虚拟代理ID),分别指向底层真实模型:deepseek/deepseek‑v4‑flashzhipu/glm‑5.2
 2. 通过 routing_strategy: fallback 开启故障降级策略,配置 fallback_strategy,实现互备:
 - 正常优先流量流向主模型(DeepSeek V4 Flash);
 - 当主模型触发故障条件,自动切流至备模型 GLM‑5.2;
 - 同时配置反向降级:若GLM‑5.2作为运行中的服务出现故障,同样切回DeepSeek V4 Flash,实现双向互备
 3. 完整声明两个模型的 model_info.max_input_tokens:DeepSeek V4 Flash、GLM‑5.2 均支持超大上下文,网关预校验避免超窗口报错。
 4. 开启冷却熔断:配置 fallback_cooldown_time,故障后端进入冷却窗口,冷却结束后尝试回切主模型;避免短时间大量反复抖动切换。
 5. 捕获的可触发fallback的异常集合:连接超时、5xx、限流429、鉴权错误、上下文超限等;可按需排除业务类400参数错误,不触发降级。

2.7.2 核心架构逻辑
 1. 业务接入层:业务方固定调用同一个虚拟代理模型ID,请求格式遵循OpenAI协议,无感知底层模型切换。
 2. LiteLLM Proxy网关层
 - 收到请求后优先路由至当前主模型;
 - 当主模型返回故障/超时/熔断状态,网关不向上游返回错误,自动复用原始请求,转发至互备的另一异构模型;
 - 记录SpendLogs:日志中保存虚拟模型ID、实际选中底层模型名称、触发fallback的错误原因,用于事后审计、统计降级发生频次。
 - 响应原样透传给业务方,OpenAI返回结构保持兼容。
 3. 回切逻辑:故障模型经过冷却时间后,下一次新请求优先尝试原来的主模型;如果主模型已经恢复,则切回主模型;依旧故障则继续使用备模型。

2.7.3 约束与风险点(异构模型互备重点)

⚠️ DeepSeek V4 Flash 与 GLM‑5.2 属于异构模型,输出风格、能力、最大输出、工具调用能力不完全等价,降级会带来业务效果差异。

  1. 能力差异风险

    • 代码能力、指令遵循、工具调用格式、SSE流式输出细节存在差异;业务需要接受降级后输出行为变化。
    • 若业务强依赖特定模型输出格式,异构互备会产生兼容性问题。
  2. 上下文窗口校验
    虽然两个模型均支持超长上下文,但二者标称上限不同,网关开启 enable_pre_call_checks,请求转发前校验候选模型是否可承载当前prompt token数;避免降级后触发上下文超限报错。

  3. 会话状态不感知
    LiteLLM fallback是单次请求级别降级,无会话亲和。一轮会话内,可能前一条请求走DeepSeek,下一条故障降级切到GLM‑5.2;多轮对话上下文连续度、记忆一致性由上层业务处理,网关不做会话绑定。

  4. 流式SSE降级代价
    SSE流式请求已经部分返回chunk之后,后端发生故障,LiteLLM无法回溯重放已经输出的内容;仅完整未开始返回的请求才会触发fallback。已经吐出部分流的请求会直接报错,不会自动切换备模型重试。

2.7.4 监控指标建议
 - 虚拟模型总QPS;
 - fallback触发次数、fallback错误类型分布;
 - 底层两个真实模型各自的token消耗;
 - 模型冷却熔断状态;
 - 降级请求占比告警:当异构互备降级占比超过阈值,触发告警,代表主模型持续异常。

2.7 云服务产品清单

分类 服务或产品 推荐配置
接入层 VPN/云专线、ELB、VPCEP
自建MaaS应用层 CCE Turbo、ECS
数据层 SFS Turbo、RDS for PostgreSQL、SWR
推理服务层 ModelArts Standard
运维管理层 AOM、LTS、CES、CTS

3. 参考链接

  • LiteLLM, Unified AI Management Gateway:https://support.huaweicloud.com/intl/en-us/litellm-aislt/litellm_01.html
  • LCreating a Dedicated Resource Pool:https://support.huaweicloud.com/intl/en-us/usermanual-standard-modelarts/resmgmt-modelarts_0004.html
  • Associating the Network of a Dedicated Resource Pool File System with SFS Turbo:https://support.huaweicloud.com/intl/en-us/resmgmt-modelarts/resmgmt-modelarts_0096.html
  • Deploying and Using Real-Time Inference:https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0002.html
  • Ascend vLLM Open Source Community:https://docs.vllm.ai/projects/ascend/en/latest/index.html
  • Accessing a Real-Time Service Through a Private Network
    :https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0011.html
  • Ascend vLLM Open Source Community:https://docs.vllm.ai/projects/ascend/en/latest/index.html
  • Viewing Real-Time Service Logs: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0020.html
  • Viewing Events of a Real-Time Service: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0019.html
  • Viewing Performance Metrics of a Real-Time Service on ModelArts: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0027.html
  • Viewing Performance Metrics of a Real-Time Service on AOM: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0026.html
  • Using CTS to Audit Inference Service Operations: https://support.huaweicloud.com/intl/en-us/inference-modelarts/inference2.0-modelarts-0103.html

4. 使用限制

  • NA

附录 A. 术语和缩略语

术语 定义
AI Artificial Intelligence,人工智能
MaaS Model as a Service,模型即服务
API Application Programming Interface,应用程序编程接口
APIKEY API Key,API 密钥(接口鉴权密钥)
VPC Virtual Private Cloud,虚拟私有云
VPN Virtual Private Network,虚拟专用网络
DC Data Center,数据中心
CCE Cloud Container Engine,云容器引擎(华为云)
ECS Elastic Cloud Server,弹性云服务器
SFS Turbo Scalable File Service Turbo,弹性文件服务 Turbo 版
SWR Software Repository for Containers,容器镜像服务
ELB Elastic Load Balance,弹性负载均衡
VPCEP VPC Endpoint,VPC 终端节点
ModelArts / MA ModelArts,华为云 AI 开发平台(MA 为其简写)
LM Large Model / Language Model,大模型 / 语言模型
SRE Site Reliability Engineering,站点可靠性工程(可靠性运维)
AOM Application Operations Management,应用运维管理
LTS Log Tank Service,日志审计服务
CTS Cloud Trace Service,云审计服务
CES Cloud Eye Service,云监控服务
HSS Host Security Service,主机安全服务
TTFT Time To First Token,首 Token 时间(首字响应时延)
TPOT Time Per Output Token,每输出 Token 耗时
Token Token,词元(模型推理的最小输出单位)
KPI Key Performance Indicator,关键绩效指标
CSM Customer Success Manager,客户成功经理
SA Solution Architect,解决方案架构师
ISV Independent Software Vendor,独立软件供应商
IaC Infrastructure as Code,基础设施即代码
vLLM v Large Language Model,高吞吐量大模型推理加速框架(开源项目)
LiteLLM Lite Large Language Model,轻量级大模型代理网关(开源项目)
OpenAI Open AI,OpenAI 协议(文中指 OpenAI 兼容的 API 协议)
Ingress Ingress,Kubernetes 入口路由资源(网关流量入口)

附录 B. 图表约定

  • 使用实线箭头表示同步请求或数据流。
  • 对异步事件、控制关系或可选流使用虚线箭头。
  • 标记信任边界、区域、可用区、VPC 和子网。
  • 在有用的地方标记带有协议、方向和关键安全特征的箭头。
  • 对访问、应用程序、数据、安全和操作层使用一致的颜色。
  • 包含图例并避免仅依靠颜色来传达含义。
【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。