基于ModelArts Standard专属资源池的云上智算参考架构
1. 定义、用例和受众
1.1 参考架构定义
本架构基于华为云ModelArts Standard 2.0专属资源池,标准化云上智算的核心模式,分为两层:
**第一层(应用服务层)**提供接入安全防护、流量治理与应用编排的支撑环境;其中接入层(NAT/EIP/WAF/CFW)、流量治理(APIG/ELB)、运维监控(LTS/AOM/CES)为规范组件;
**第二层(ModelArts推理服务层)**承载ModelArts推理服务全托管部署与全链路运维监控。推理框架选型、副本数、亲和调度策略、多AZ高可用、灰度验证等需根据每个客户的模型规格、流量特征和SLA要求进行适配。
1.2 预期用途
- 指导华为云上大模型在线推理工作负载的设计和开发。
- 为售前、解决方案设计、实施和审查提供可重用的架构模式。
- 作为解决方案手册、交付包或实际部署的架构基础。
- 定义安全性、可靠性、性能、成本、运营和合规性护栏。
1.3 目标受众
| 观众 | 典型角色 | 预期用途 |
|---|---|---|
| 内部 | 架构师、开发人员、交付工程师、运营工程师 | 解决方案设计、审查、交付和实施 |
| 外部 | 客户、合作伙伴、ISV、开发人员 | 评估、实施、集成和操作 |
1.4 范围
在范围内
- 大模型在线推理服务部署与运维
- 华为云单一Region、专属资源池部署模型
- 接入安全、流量治理、应用编排、推理服务、运维监控全链路
超出范围
- 离线训练、数据处理流水线
- 多云/跨Region部署的特定实现细节
2. 参考架构概述
2.1 架构声明
本参考架构描述基于华为云ModelArts Standard 2.0专属资源池的云上智算方案,提供大模型在线推理服务的全托管部署能力,具备安全接入、流量治理、弹性扩缩容、全链路可观测等核心质量属性。
2.2 业务背景
| 项目 | 描述 |
|---|---|
| 业务问题 | 企业需要将大模型推理服务安全、稳定地部署到云上,兼顾性能与成本 |
| 期望的结果 | 推理服务高可用、可弹性扩缩容、全链路可监控、安全合规 |
| 主要用户 | 终端用户(AI应用调用方)、模型部署与作业管理用户 |
| 关键制约因素 | NPU资源供给、专属资源池网络隔离、推理延迟SLA、预算控制 |
| 成功指标 | 推理TTFT/TPOT达标率、服务可用性≥99.9%、资源利用率优化、上线周期缩短 |
2.3 架构说明
解决方案分为两层:
第一层 — 应用服务层(接入层 → 流量治理层 → 应用层)
为推理服务提供安全接入、流量管控和应用编排的支撑环境:
- 接入层(NAT/EIP/WAF/CFW):公网接入与安全防护
- 流量治理层(APIG/ELB):API管理、熔断降级与负载均衡
- 应用层(CCE/HSS):AI应用编排与主机安全
第二层 — ModelArts推理服务层(推理服务层 → 运维管理层)⭐
架构核心,承载大模型推理的全托管部署与全链路运维:
- 推理服务层:ModelArts Standard 2.0 专属资源池全托管大模型推理,通过VPCEP对内提供推理访问,亦支持公网访问
- 运维管理层(LTS/AOM/CES):日志、监控、告警全链路可观测能力
数据存储使用OBS(模型权重/代码)、SFS Turbo(高速缓存)、SWR(容器镜像)。
设计理念:第一层为标准基础设施护栏,可按客户复用;第二层是架构核心,需根据模型规格、流量特征和SLA要求进行深度适配。详见 §4 ModelArts推理服务层详细设计。
2.4 设计关注点
第一层(应用服务层)— 接入与流量治理
| 维度 | 关注点 |
|---|---|
| 安全 | WAF/CFW公网防护,HSS主机安全 |
| 网络管理 | 资源池VPC隔离,NAT/EIP公网出口,VPCEP内网打通 |
| 流量治理 | APIG熔断降级,ELB负载均衡与跨AZ分发 |
第二层(ModelArts推理服务层)— 推理服务与运维
| 维度 | 关注点 |
|---|---|
| 观测/运维 | 支持Shell管理、日志对接LTS;服务响应TTFT、TPOT实时统计,监控统计对接AOM |
| 弹性/性能 | 推理服务实例支持副本级扩缩容;算力资源池支持弹性扩缩容,支持划分逻辑子池 |
| 可靠性 | 平台托管推理服务SLA;支持负载均衡、亲和调度、故障自动重启;多AZ多实例高可用 |
| 安全 | 默认提供鉴权,推理2.0支持apikey鉴权;云内支持VPCEP订阅式打通访问 |
2.5 典型架构

第一层 — 应用服务层
| 子层 | 组件 |
|---|---|
| 接入层 | NAT、EIP、WAF、CFW |
| 流量治理 | ELB、APIG |
| 应用层 | CCE、HSS |
第二层 — ModelArts推理服务层 ⭐
| 子层 | 组件 |
|---|---|
| 运维管理层 | LTS、CES、AOM |
| 推理服务层 | ModelArts Standard 2.0 专属资源池 |
2.6 流程描述
- 用户访问AI应用,接入层安全云服务进行流量过滤、清洗;用户请求流量由APIG进行流量治理,例如熔断策略,降级策略等,再经由ELB对流量进行负载均衡
- 用户请求进入应用的workflow,应用根据处理的不同阶段自行去调用相应的工具,例如大模型对话、文档解析、以及外部搜索工具等
- 推理服务由ModelArts全流程托管,对内通过VPCEP提供推理服务/公有云可通过ModelArts公网地址访问,推理服务提供鉴权、负载均衡、监控、故障恢复等运维能力
- 内网访问-推理服务/外网访问-推理服务(存在默认流控,详情联系站点服务SRE)
2.7 云服务产品清单
| 接入模块 | 流量治理 | 应用服务 | 模型服务 |
|---|---|---|---|
| NAT/EIP/WAF/CFW/VPCEP | APIG/ELB | CCE/ECS/HSS | ModelArts SFS Turbo/OBS/SWR |
3. ModelArts推理服务层详细设计
本章节深入展开第二层(推理服务层 → 运维管理层)的关键设计,这是架构的核心。
3.1 ModelArts Standard 2.0 专属资源池部署
3.1.1 专属资源池概述
ModelArts Standard 2.0 专属资源池为用户独占的NPU计算资源池,支持VPC隔离、弹性扩缩容和逻辑子池划分。部署流程包括:资源池创建与规格选型 → 镜像与模型权重准备 → 在线服务配置 → 健康检查与调度策略 → 监控对接。
3.1.2 推理服务部署能力(官方)
参考来源:实时推理的部署及使用流程 — 华为云ModelArts
ModelArts平台提供AI模型推理服务管理能力,帮助用户快速将AI模型部署为可运行的推理服务,并为推理服务提供API能力供用户集成到自定义应用中。
部署模式:
- 云端部署:在云平台基础设施(云服务器、存储资源、网络资源等)上部署和运行推理服务,适用于对计算资源要求高、数据量大的场景
- 在线推理(实时推理):通过实时处理单个请求并同步返回结果,将模型部署为Web Service,提供RESTful API接口
- 适用场景:在线智能客服、自动驾驶实时决策等对实时性要求较高的场景
准备工作:
| 准备项 | 说明 |
|---|---|
| 资源池 | 推理部署支持公共资源池和专属资源池。使用专属资源池需确保目标资源池有足够资源 |
| 镜像 | 提前准备推理镜像(SWR仓库管理) |
| 模型与代码 | 提前准备好模型、代码文件,上传到OBS对象桶 / OBS并行文件系统 / SFS Turbo |
访问方式:
| 维度 | 选项 | 说明 |
|---|---|---|
| 认证方式 | 无认证 | 无需认证 |
| Token认证 | 基于华为云IAM服务,Token有效期24小时,可缓存避免频繁调用 | |
| API Key认证(推荐) | 在华为云控制台生成API Key,调用时放在请求头中 | |
| 访问通道 | 公网访问 | 默认方式,部署成功后提供标准RESTful API |
| 内网访问(推荐) | 通过创建内网接入申请,自动创建VPCEP,打通VPC与推理服务的内网连接 | |
| 传输协议 | HTTPS/HTTP | 默认协议 |
| WebSocket | 支持服务端主动推送,建立持久连接进行双向数据传输 | |
| Server-Sent Events | 单向实时通信(如流式输出),比WebSocket更轻量级 |
3.1.3 部署示例:DeepSeek-V4-Flash on xp1d
| 项目 | 说明 |
|---|---|
| 机型 | 910B 313T |
| 模型权重 | w8a8/w4a8 |
| 推理框架 | vllm-ascend-0.22 |
| 部署配置 | 3p(tp4dp1) 1d(tp1dp4) |
| 启动脚本 | |
| 性能验证 |
3.2 内网接入一键审批
3.2.1 VPCEP内网打通
推理服务通过VPCEP(VPC终端节点)实现内网访问,无需公网暴露:
| 配置项 | 说明 |
|---|---|
| 一键审批 | 无需操作VPCEP创建,终端节点连接审批支持一键通过,简化跨VPC内网打通流程 |
| 安全隔离 | 推理服务仅对内网暴露,公网访问可选开启 |
3.2.2 内网接入流程
业务VPC → VPCEP终端节点 → MA资源池VPC → 推理服务
- 在访问方MA页面发起访问申请,填入目的推理服务ID,访问源VPC/子网
- 目的推理服务MA侧一键审批终端节点连接
- 业务应用通过VPCEP内网地址调用推理服务
3.3 高可用架构设计
3.3.1 高可用架构
| 层级 | 策略 | 说明 |
|---|---|---|
| 负载均衡 | 业务层ELB分流 | 部署两个相同的推理服务,对应不同的服务ID/访问路径,业务层做负载分流 |
| 负载均衡 | MA内置负载均衡(推荐) | 推理服务内同一个部署模板可以设置多副本,也可以设置多个部署模板,来实现服务内的负载均衡 |
| 多实例部署 | 同AZ内多副本 + 反亲和调度 | 推理服务内部署多个副本,通过反亲和调度分配至不同物理节点,单节点故障时服务依然可用 |
| 多AZ部署 | 业务VPC对接一个推理服务 | MA推理服务下设置多个部署模板,对应多个AZ,MA推理服务内置负载均衡实现AZ间调度 |
| 故障恢复 | 就绪探针实时剔除异常副本 | 异常副本被实时剔除流量,服务降级而非中断 |
3.3.2 跨AZ通信要求
- 推理服务实例内原则上不进行AZ间通信
- 跨AZ服务通过 ModelArts推理服务负载均衡 或者 上层应用流量分发至不同AZ的VPCEP终端节点 实现AZ级别高可用
3.3.3 反亲和调度示例
Reranker 推理服务 6 个副本:3 个在 Node A、3 个在 Node B。反亲和配置避免 6 个副本集中在单一 Node,配合就绪探针实现物理机单节点故障时服务不中断。
3.4 负载均衡与灰度验证
3.4.1 负载均衡策略
| 层级 | 组件 | 策略 |
|---|---|---|
| 业务层 | ELB/APIG | 跨AZ流量分发、熔断降级、QPS流控 |
| MA服务层 | MA内置负载均衡 | 副本间流量分发,支持就绪探针感知副本健康状态 |
| 灰度发布 | MA内置流量权重 | 通过MA配置新旧版本流量权重比例,实现灰度切流 |
3.4.2 灰度验证流程
- 新版本部署:在MA推理服务内复制创建新的服务副本(与旧版本并存)
- VPCEP配置:无需独立配置
- 灰度切流:流量镜像转发
- 指标监控:对比新旧版本的 TTFT/TPOT/QPS/错误率等关键指标
- 逐步放量:指标达标后逐步提升新版本流量权重
- 全量切换:确认稳定后切换 100% 流量至新版本,下线旧版本
3.4.3 灰度验证关键指标
| 指标 | 说明 | 监控来源 |
|---|---|---|
| TTFT | 首Token响应时延 | AOM |
| TPOT | 单Token生成时延 | AOM |
| QPS | 每秒请求数 | AOM |
| 错误率 | 4xx/5xx请求占比 | LTS + AOM |
| 资源利用率 | NPU显存/CPU/内存 | AOM |
4. ModelArts Standard 2.0 上线配置Checklist
以下内容来源于实际项目上线配置checklist。
| 检查点 | 检查内容 | 通用配置建议 | 举例 |
|---|---|---|---|
| 镜像配置 | 1.检查镜像是否使用SWR仓库组织对应的生产镜像版本 | — | — |
| 服务调用配置 | 检查每秒流量限制、请求大小限制、请求超时时间、服务调用接口是否符合生产场景预期 | — | — |
| 服务鉴权key配置 | 去除测试验证key,配置全局统一或按服务种类划分 | 建议增加,需App层确认 | — |
| 流控 / QPS | QPS > 单副本qps能力 × 副本数,超出QPS后报错422 request limit | — | 前端QPS配置、后端QPS配置、LLM MA QPS配置 |
| 超时配置 | stream或非stream访问区分,最大支持1200s,按业务应用需求设置 | — | 通用 > 120s |
| 请求包大小限制 | 按业务应用需求设置 | — | — |
| 模型配置 | 1.检查OBS镜像权重文件是否存在;2.权重文件挂载路径和启动脚本加载路径一致;3.是否开启本地存储加速 | 开启预加载:模型加载至物理服务器,加速后续启动加载 | — |
| 代码配置 | 1.检查OBS镜像代码文件是否存在;2.检查代码文件挂载路径和启动脚本加载路径一致;3.是否开启本地存储加速 | — | — |
| 环境变量 | 1.检查在线服务运行需要设置的环境变量名称和值是否匹配 | 服务配置常用参数可在此处动态设置 | — |
| 运行命令 | 1.检查启动命令脚本是否和镜像中加载的脚本保持一致 | 已固定的启动脚本建议打包到容器镜像或从OBS copy至容器路径执行,挂载OBS路径执行会有鉴权、网络等损耗 | — |
| 健康检查 | 1.检查是否开启:启动探针、就绪探针、存活探针 —— 默认关闭 | 启动探针:可选配置,容器加载、推理服务启动后才会激活CloudShell并接收流量,调试阶段可不配置,稳定服务建议配置;就绪探针:多副本需要配置,MA内负载均衡会根据就绪探针判断副本间流量转发,避免将流量转发至异常副本导致业务偶发失败;存活探针:不建议配置,异常会触发重启/滚动升级,因当前NPU资源满载会导致重启失败 | infer service 1:Pod 1/2 health check pass,Pod 3 health check failed → 系统实时剔除异常Pod,服务性能降级,业务无感知;LTS/AOM告警人工处理排查恢复 |
| 故障恢复 | 1.检查故障恢复策略:1)故障自动重启——关闭;2)恢复策略——实例恢复 | 不建议配置,异常会触发重启/滚动升级,因当前NPU资源满载会导致重启失败 | — |
| 亲和调度 | 1.检查亲和调度配置:1)亲和类型——节点亲和;2)亲和强度——强亲和;3)节点——所选相关亲和调度节点 | LLM大模型一般跨机器部署,可选配置;小参数模型多卡多副本建议设置反亲和,将服务副本分配至多个物理节点,配合健康检查/就绪探针,物理机单节点故障保障服务依然对外可用 | Reranker一个推理服务6个副本:3个在Node A、3个在Node B,反亲和配置避免6个副本在一个Node |
| 负载均衡 | 检查请求已分发到多个实例 | 可在Console页面选择负载均衡策略 | — |
| LTS对接 | 1.检查在线服务启动10分钟后,是否在日志一栏有LTS日志显示 | 需在专属资源池内开启LTS插件并设置路径 | — |
| 多副本服务实例 | 1.大模型单机部署:检查服务实例数量为1,单元为1;2.大模型多机PD混部(vLLM):单元1为master节点,剩余worker节点在其他单元,单元数量×副本数=最终实例数;3.大模型多机PD分离部署(vLLM):单元1为master节点,Prefill/Decode分布在单元部署,资源物理隔离,单元数量×副本数=最终实例数 | xPyD通用配比规则:x = Prefill单元组数,y = Decode单元组数,总单元数 = x + y。例如1P2D = 1个预填充单元 + 2个解码单元,主流线上生产标配 | DeepSeek 5P1D:Node1(2 Prefill + Route)、Node2(2 Prefill)、Node3(1 Prefill + 1 Decode) |
| 服务内心跳检测 | 1.检查内部服务是否提供健康检查端点 | — | curlhttp://host:port/health、curl http://host:port/healthcheck |
| 驱动检查 | 1.检查使用ModelArts专属资源池NPU驱动为最新版本 | — | — |
| 服务监控检查 | 1.大模型推理业务指标:QPS、时延、TTFT、Token数、服务状态;2.资源利用率监控:CPU/内存、GPU/NPU(异构资源);3.网络流量监控:网络上行/下行流速、连接数;4.请求性能监控:服务请求数、服务请求QPS、服务请求时延 | — | — |
5. 参考链接
- 产品文档:https://support.huaweicloud.com/modelarts/
- 推理服务部署指南:https://support.huaweicloud.com/intl/zh-cn/inference-modelarts/inference2.0-modelarts-0002.html
- 实施指南:https://support.huaweicloud.com/usermanual-modelarts/standard-pool.html
- 源代码或 IaC:不适用(托管服务部署)
- 操作手册:见上方"5. ModelArts Standard 2.0 上线配置Checklist"章节
- 安全性和合规性映射:WAF/CFW/HSS 安全防护体系
6. 已知限制
- 专属资源池NPU资源供给受区域限制,不同az创建不同的专属资源池
- 多AZ高可用需通过业务VPC对接多个资源池VPCEP实现,资源池间不可直接通信
- 存活探针不建议配置(NPU资源满载时重启会失败)
7. 扩展点
- 跨Region容灾部署(通过业务VPC对接多资源池VPCEP)
- 混合推理(大模型+小模型协同,反亲和调度跨节点部署)
- PD分离部署(Prefill/Decode物理隔离,xPyD配比优化吞吐)
- 本地化或行业特定合规适配
附录 A. 术语和缩略语
| 术语 | 定义 |
|---|---|
| ModelArts Standard 2.0 | 华为云AI开发与推理平台标准版,支持专属资源池 |
| 专属资源池 | 用户独占的NPU计算资源池,支持VPC隔离与弹性扩缩容 |
| VPCEP | VPC终端节点,用于内网打通访问推理服务 |
| TTFT | Time To First Token,首Token响应时延 |
| TPOT | Time Per Output Token,单Token生成时延 |
| PD分离 | Prefill与Decode分离部署,资源物理隔离提升吞吐 |
| xPyD | x个Prefill单元 + y个Decode单元的通用配比规则 |
附录 B. 图表约定
- 使用实线箭头表示同步请求或数据流。
- 对异步事件、控制关系或可选流使用虚线箭头。
- 标记信任边界、区域、可用区、VPC 和子网。
- 在有用的地方标记带有协议、方向和关键安全特征的箭头。
- 对访问、应用程序、数据、安全和操作层使用一致的颜色。
- 包含图例并避免仅依靠颜色来传达含义。
附录 C. 出版质量
- 所有占位符均已被替换或有意标记为不适用。
- 架构图和叙述描述了相同的设计。
- 产品名称和服务功能已根据当前文档进行验证。
- 安全和合规声明是基于证据并经过审查的。
- 可用性、RTO、RPO、性能和成本目标是可衡量的。
- 未经授权,不得包含客户敏感或受限信息。
- 目标受众可以访问链接、存储库、图表和附件。
- 点赞
- 收藏
- 关注作者
评论(0)