基于ModelArts Standard专属资源池的云上智算参考架构

举报
华为云架构中心 发表于 2026/08/26 10:44:16 2026/08/26
【摘要】 通过ModelArts Standard 托管算力资源,对模型、推理服务进行全生命周期管理,为上层应用提供安全、稳定、弹性的推理服务。

1. 定义、用例和受众

1.1 参考架构定义

本架构基于华为云ModelArts Standard 2.0专属资源池,标准化云上智算的核心模式,分为两层:
**第一层(应用服务层)**提供接入安全防护、流量治理与应用编排的支撑环境;其中接入层(NAT/EIP/WAF/CFW)、流量治理(APIG/ELB)、运维监控(LTS/AOM/CES)为规范组件;
**第二层(ModelArts推理服务层)**承载ModelArts推理服务全托管部署与全链路运维监控。推理框架选型、副本数、亲和调度策略、多AZ高可用、灰度验证等需根据每个客户的模型规格、流量特征和SLA要求进行适配。

1.2 预期用途

  • 指导华为云上大模型在线推理工作负载的设计和开发。
  • 为售前、解决方案设计、实施和审查提供可重用的架构模式。
  • 作为解决方案手册、交付包或实际部署的架构基础。
  • 定义安全性、可靠性、性能、成本、运营和合规性护栏。

1.3 目标受众

观众 典型角色 预期用途
内部 架构师、开发人员、交付工程师、运营工程师 解决方案设计、审查、交付和实施
外部 客户、合作伙伴、ISV、开发人员 评估、实施、集成和操作

1.4 范围

在范围内

  • 大模型在线推理服务部署与运维
  • 华为云单一Region、专属资源池部署模型
  • 接入安全、流量治理、应用编排、推理服务、运维监控全链路

超出范围

  • 离线训练、数据处理流水线
  • 多云/跨Region部署的特定实现细节

2. 参考架构概述

2.1 架构声明

本参考架构描述基于华为云ModelArts Standard 2.0专属资源池的云上智算方案,提供大模型在线推理服务的全托管部署能力,具备安全接入、流量治理、弹性扩缩容、全链路可观测等核心质量属性。

2.2 业务背景

项目 描述
业务问题 企业需要将大模型推理服务安全、稳定地部署到云上,兼顾性能与成本
期望的结果 推理服务高可用、可弹性扩缩容、全链路可监控、安全合规
主要用户 终端用户(AI应用调用方)、模型部署与作业管理用户
关键制约因素 NPU资源供给、专属资源池网络隔离、推理延迟SLA、预算控制
成功指标 推理TTFT/TPOT达标率、服务可用性≥99.9%、资源利用率优化、上线周期缩短

2.3 架构说明

解决方案分为两层

第一层 — 应用服务层(接入层 → 流量治理层 → 应用层)

为推理服务提供安全接入、流量管控和应用编排的支撑环境:

  • 接入层(NAT/EIP/WAF/CFW):公网接入与安全防护
  • 流量治理层(APIG/ELB):API管理、熔断降级与负载均衡
  • 应用层(CCE/HSS):AI应用编排与主机安全

第二层 — ModelArts推理服务层(推理服务层 → 运维管理层)⭐

架构核心,承载大模型推理的全托管部署与全链路运维:

  • 推理服务层:ModelArts Standard 2.0 专属资源池全托管大模型推理,通过VPCEP对内提供推理访问,亦支持公网访问
  • 运维管理层(LTS/AOM/CES):日志、监控、告警全链路可观测能力

数据存储使用OBS(模型权重/代码)、SFS Turbo(高速缓存)、SWR(容器镜像)。

设计理念:第一层为标准基础设施护栏,可按客户复用;第二层是架构核心,需根据模型规格、流量特征和SLA要求进行深度适配。详见 §4 ModelArts推理服务层详细设计。

2.4 设计关注点

第一层(应用服务层)— 接入与流量治理

维度 关注点
安全 WAF/CFW公网防护,HSS主机安全
网络管理 资源池VPC隔离,NAT/EIP公网出口,VPCEP内网打通
流量治理 APIG熔断降级,ELB负载均衡与跨AZ分发

第二层(ModelArts推理服务层)— 推理服务与运维

维度 关注点
观测/运维 支持Shell管理、日志对接LTS;服务响应TTFT、TPOT实时统计,监控统计对接AOM
弹性/性能 推理服务实例支持副本级扩缩容;算力资源池支持弹性扩缩容,支持划分逻辑子池
可靠性 平台托管推理服务SLA;支持负载均衡、亲和调度、故障自动重启;多AZ多实例高可用
安全 默认提供鉴权,推理2.0支持apikey鉴权;云内支持VPCEP订阅式打通访问

2.5 典型架构

第一层 — 应用服务层

子层 组件
接入层 NAT、EIP、WAF、CFW
流量治理 ELB、APIG
应用层 CCE、HSS

第二层 — ModelArts推理服务层 ⭐

子层 组件
运维管理层 LTS、CES、AOM
推理服务层 ModelArts Standard 2.0 专属资源池

2.6 流程描述

  1. 用户访问AI应用,接入层安全云服务进行流量过滤、清洗;用户请求流量由APIG进行流量治理,例如熔断策略,降级策略等,再经由ELB对流量进行负载均衡
  2. 用户请求进入应用的workflow,应用根据处理的不同阶段自行去调用相应的工具,例如大模型对话、文档解析、以及外部搜索工具等
  3. 推理服务由ModelArts全流程托管,对内通过VPCEP提供推理服务/公有云可通过ModelArts公网地址访问,推理服务提供鉴权、负载均衡、监控、故障恢复等运维能力
  4. 内网访问-推理服务/外网访问-推理服务(存在默认流控,详情联系站点服务SRE)

2.7 云服务产品清单

接入模块 流量治理 应用服务 模型服务
NAT/EIP/WAF/CFW/VPCEP APIG/ELB CCE/ECS/HSS ModelArts SFS Turbo/OBS/SWR

3. ModelArts推理服务层详细设计

本章节深入展开第二层(推理服务层 → 运维管理层)的关键设计,这是架构的核心。

3.1 ModelArts Standard 2.0 专属资源池部署

3.1.1 专属资源池概述

ModelArts Standard 2.0 专属资源池为用户独占的NPU计算资源池,支持VPC隔离、弹性扩缩容和逻辑子池划分。部署流程包括:资源池创建与规格选型 → 镜像与模型权重准备 → 在线服务配置 → 健康检查与调度策略 → 监控对接。

3.1.2 推理服务部署能力(官方)

参考来源:实时推理的部署及使用流程 — 华为云ModelArts

ModelArts平台提供AI模型推理服务管理能力,帮助用户快速将AI模型部署为可运行的推理服务,并为推理服务提供API能力供用户集成到自定义应用中。

部署模式:

  • 云端部署:在云平台基础设施(云服务器、存储资源、网络资源等)上部署和运行推理服务,适用于对计算资源要求高、数据量大的场景
  • 在线推理(实时推理):通过实时处理单个请求并同步返回结果,将模型部署为Web Service,提供RESTful API接口
  • 适用场景:在线智能客服、自动驾驶实时决策等对实时性要求较高的场景

准备工作:

准备项 说明
资源池 推理部署支持公共资源池和专属资源池。使用专属资源池需确保目标资源池有足够资源
镜像 提前准备推理镜像(SWR仓库管理)
模型与代码 提前准备好模型、代码文件,上传到OBS对象桶 / OBS并行文件系统 / SFS Turbo

访问方式:

维度 选项 说明
认证方式 无认证 无需认证
Token认证 基于华为云IAM服务,Token有效期24小时,可缓存避免频繁调用
API Key认证(推荐) 在华为云控制台生成API Key,调用时放在请求头中
访问通道 公网访问 默认方式,部署成功后提供标准RESTful API
内网访问(推荐) 通过创建内网接入申请,自动创建VPCEP,打通VPC与推理服务的内网连接
传输协议 HTTPS/HTTP 默认协议
WebSocket 支持服务端主动推送,建立持久连接进行双向数据传输
Server-Sent Events 单向实时通信(如流式输出),比WebSocket更轻量级

3.1.3 部署示例:DeepSeek-V4-Flash on xp1d

项目 说明
机型 910B 313T
模型权重 w8a8/w4a8
推理框架 vllm-ascend-0.22
部署配置 3p(tp4dp1) 1d(tp1dp4)
启动脚本
性能验证

3.2 内网接入一键审批

3.2.1 VPCEP内网打通

推理服务通过VPCEP(VPC终端节点)实现内网访问,无需公网暴露:

配置项 说明
一键审批 无需操作VPCEP创建,终端节点连接审批支持一键通过,简化跨VPC内网打通流程
安全隔离 推理服务仅对内网暴露,公网访问可选开启

3.2.2 内网接入流程


复制代码
业务VPC → VPCEP终端节点 → MA资源池VPC → 推理服务
  1. 在访问方MA页面发起访问申请,填入目的推理服务ID,访问源VPC/子网
  2. 目的推理服务MA侧一键审批终端节点连接
  3. 业务应用通过VPCEP内网地址调用推理服务

3.3 高可用架构设计

3.3.1 高可用架构

层级 策略 说明
负载均衡 业务层ELB分流 部署两个相同的推理服务,对应不同的服务ID/访问路径,业务层做负载分流
负载均衡 MA内置负载均衡(推荐) 推理服务内同一个部署模板可以设置多副本,也可以设置多个部署模板,来实现服务内的负载均衡
多实例部署 同AZ内多副本 + 反亲和调度 推理服务内部署多个副本,通过反亲和调度分配至不同物理节点,单节点故障时服务依然可用
多AZ部署 业务VPC对接一个推理服务 MA推理服务下设置多个部署模板,对应多个AZ,MA推理服务内置负载均衡实现AZ间调度
故障恢复 就绪探针实时剔除异常副本 异常副本被实时剔除流量,服务降级而非中断

3.3.2 跨AZ通信要求

  • 推理服务实例内原则上不进行AZ间通信
  • 跨AZ服务通过 ModelArts推理服务负载均衡 或者 上层应用流量分发至不同AZ的VPCEP终端节点 实现AZ级别高可用

3.3.3 反亲和调度示例

Reranker 推理服务 6 个副本:3 个在 Node A、3 个在 Node B。反亲和配置避免 6 个副本集中在单一 Node,配合就绪探针实现物理机单节点故障时服务不中断。

3.4 负载均衡与灰度验证

3.4.1 负载均衡策略

层级 组件 策略
业务层 ELB/APIG 跨AZ流量分发、熔断降级、QPS流控
MA服务层 MA内置负载均衡 副本间流量分发,支持就绪探针感知副本健康状态
灰度发布 MA内置流量权重 通过MA配置新旧版本流量权重比例,实现灰度切流

3.4.2 灰度验证流程

  1. 新版本部署:在MA推理服务内复制创建新的服务副本(与旧版本并存)
  2. VPCEP配置:无需独立配置
  3. 灰度切流:流量镜像转发
  4. 指标监控:对比新旧版本的 TTFT/TPOT/QPS/错误率等关键指标
  5. 逐步放量:指标达标后逐步提升新版本流量权重
  6. 全量切换:确认稳定后切换 100% 流量至新版本,下线旧版本

3.4.3 灰度验证关键指标

指标 说明 监控来源
TTFT 首Token响应时延 AOM
TPOT 单Token生成时延 AOM
QPS 每秒请求数 AOM
错误率 4xx/5xx请求占比 LTS + AOM
资源利用率 NPU显存/CPU/内存 AOM

4. ModelArts Standard 2.0 上线配置Checklist

以下内容来源于实际项目上线配置checklist。

检查点 检查内容 通用配置建议 举例
镜像配置 1.检查镜像是否使用SWR仓库组织对应的生产镜像版本
服务调用配置 检查每秒流量限制、请求大小限制、请求超时时间、服务调用接口是否符合生产场景预期
服务鉴权key配置 去除测试验证key,配置全局统一或按服务种类划分 建议增加,需App层确认
流控 / QPS QPS > 单副本qps能力 × 副本数,超出QPS后报错422 request limit 前端QPS配置、后端QPS配置、LLM MA QPS配置
超时配置 stream或非stream访问区分,最大支持1200s,按业务应用需求设置 通用 > 120s
请求包大小限制 按业务应用需求设置
模型配置 1.检查OBS镜像权重文件是否存在;2.权重文件挂载路径和启动脚本加载路径一致;3.是否开启本地存储加速 开启预加载:模型加载至物理服务器,加速后续启动加载
代码配置 1.检查OBS镜像代码文件是否存在;2.检查代码文件挂载路径和启动脚本加载路径一致;3.是否开启本地存储加速
环境变量 1.检查在线服务运行需要设置的环境变量名称和值是否匹配 服务配置常用参数可在此处动态设置
运行命令 1.检查启动命令脚本是否和镜像中加载的脚本保持一致 已固定的启动脚本建议打包到容器镜像或从OBS copy至容器路径执行,挂载OBS路径执行会有鉴权、网络等损耗
健康检查 1.检查是否开启:启动探针、就绪探针、存活探针 —— 默认关闭 启动探针:可选配置,容器加载、推理服务启动后才会激活CloudShell并接收流量,调试阶段可不配置,稳定服务建议配置;就绪探针:多副本需要配置,MA内负载均衡会根据就绪探针判断副本间流量转发,避免将流量转发至异常副本导致业务偶发失败;存活探针:不建议配置,异常会触发重启/滚动升级,因当前NPU资源满载会导致重启失败 infer service 1:Pod 1/2 health check pass,Pod 3 health check failed → 系统实时剔除异常Pod,服务性能降级,业务无感知;LTS/AOM告警人工处理排查恢复
故障恢复 1.检查故障恢复策略:1)故障自动重启——关闭;2)恢复策略——实例恢复 不建议配置,异常会触发重启/滚动升级,因当前NPU资源满载会导致重启失败
亲和调度 1.检查亲和调度配置:1)亲和类型——节点亲和;2)亲和强度——强亲和;3)节点——所选相关亲和调度节点 LLM大模型一般跨机器部署,可选配置;小参数模型多卡多副本建议设置反亲和,将服务副本分配至多个物理节点,配合健康检查/就绪探针,物理机单节点故障保障服务依然对外可用 Reranker一个推理服务6个副本:3个在Node A、3个在Node B,反亲和配置避免6个副本在一个Node
负载均衡 检查请求已分发到多个实例 可在Console页面选择负载均衡策略
LTS对接 1.检查在线服务启动10分钟后,是否在日志一栏有LTS日志显示 需在专属资源池内开启LTS插件并设置路径
多副本服务实例 1.大模型单机部署:检查服务实例数量为1,单元为1;2.大模型多机PD混部(vLLM):单元1为master节点,剩余worker节点在其他单元,单元数量×副本数=最终实例数;3.大模型多机PD分离部署(vLLM):单元1为master节点,Prefill/Decode分布在单元部署,资源物理隔离,单元数量×副本数=最终实例数 xPyD通用配比规则:x = Prefill单元组数,y = Decode单元组数,总单元数 = x + y。例如1P2D = 1个预填充单元 + 2个解码单元,主流线上生产标配 DeepSeek 5P1D:Node1(2 Prefill + Route)、Node2(2 Prefill)、Node3(1 Prefill + 1 Decode)
服务内心跳检测 1.检查内部服务是否提供健康检查端点 curlhttp://host:port/health、curl http://host:port/healthcheck
驱动检查 1.检查使用ModelArts专属资源池NPU驱动为最新版本
服务监控检查 1.大模型推理业务指标:QPS、时延、TTFT、Token数、服务状态;2.资源利用率监控:CPU/内存、GPU/NPU(异构资源);3.网络流量监控:网络上行/下行流速、连接数;4.请求性能监控:服务请求数、服务请求QPS、服务请求时延

5. 参考链接

  • 产品文档:https://support.huaweicloud.com/modelarts/
  • 推理服务部署指南:https://support.huaweicloud.com/intl/zh-cn/inference-modelarts/inference2.0-modelarts-0002.html
  • 实施指南:https://support.huaweicloud.com/usermanual-modelarts/standard-pool.html
  • 源代码或 IaC:不适用(托管服务部署)
  • 操作手册:见上方"5. ModelArts Standard 2.0 上线配置Checklist"章节
  • 安全性和合规性映射:WAF/CFW/HSS 安全防护体系

6. 已知限制

  • 专属资源池NPU资源供给受区域限制,不同az创建不同的专属资源池
  • 多AZ高可用需通过业务VPC对接多个资源池VPCEP实现,资源池间不可直接通信
  • 存活探针不建议配置(NPU资源满载时重启会失败)

7. 扩展点

  • 跨Region容灾部署(通过业务VPC对接多资源池VPCEP)
  • 混合推理(大模型+小模型协同,反亲和调度跨节点部署)
  • PD分离部署(Prefill/Decode物理隔离,xPyD配比优化吞吐)
  • 本地化或行业特定合规适配

附录 A. 术语和缩略语

术语 定义
ModelArts Standard 2.0 华为云AI开发与推理平台标准版,支持专属资源池
专属资源池 用户独占的NPU计算资源池,支持VPC隔离与弹性扩缩容
VPCEP VPC终端节点,用于内网打通访问推理服务
TTFT Time To First Token,首Token响应时延
TPOT Time Per Output Token,单Token生成时延
PD分离 Prefill与Decode分离部署,资源物理隔离提升吞吐
xPyD x个Prefill单元 + y个Decode单元的通用配比规则

附录 B. 图表约定

  • 使用实线箭头表示同步请求或数据流。
  • 对异步事件、控制关系或可选流使用虚线箭头。
  • 标记信任边界、区域、可用区、VPC 和子网。
  • 在有用的地方标记带有协议、方向和关键安全特征的箭头。
  • 对访问、应用程序、数据、安全和操作层使用一致的颜色。
  • 包含图例并避免仅依靠颜色来传达含义。

附录 C. 出版质量

  • 所有占位符均已被替换或有意标记为不适用。
  • 架构图和叙述描述了相同的设计。
  • 产品名称和服务功能已根据当前文档进行验证。
  • 安全和合规声明是基于证据并经过审查的。
  • 可用性、RTO、RPO、性能和成本目标是可衡量的。
  • 未经授权,不得包含客户敏感或受限信息。
  • 目标受众可以访问链接、存储库、图表和附件。
【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。