华为云Agentic Infra架构深度解析:从CloudMatrix384超节点到FlexNPU柔性算力
2026年,AI产业正在经历一场深刻的范式转移。大模型参数规模的边际收益持续递减,产业焦点从“模型有多大”转向“智能体有多强”。Agentic AI——能够自主规划、主动决策、持续学习的智能体——正在成为新的技术制高点。但Agentic AI对底层基础设施提出了截然不同的要求:传统云计算面向的是“人提交任务、系统执行”的确定性计算模式,而Agentic AI面向的是“每天万亿级Token的实时处理”,其“主动决策+自适应调整”的特性彻底重构了计算系统的交互逻辑与资源配置规则。
华为云在2026年正式提出了Agentic Infra新范式,核心是构建“高效Token工厂+通智一体化调度+持续学习+安全自治”四大能力。本文将深入解析支撑这一范式的四项关键技术:CloudMatrix384超节点架构、xDeepServe推理服务系统、FlexNPU柔性液态算力架构,以及CCE VolcanoNext通智一体化调度引擎。
一、CloudMatrix384超节点:从“机柜集群”到“一台计算机”
大模型训练和推理对算力的需求呈指数级增长,传统以服务器为单位的计算架构已经无法支撑AI技术的代际跃迁。华为云昇腾AI云服务基于CloudMatrix384超节点,将384颗昇腾910C NPU和192颗鲲鹏通用计算芯片通过全新高速网络MatrixLink进行对等全互联,形成一个灵活实现算力配比的异构算力系统。
CloudMatrix384的核心设计理念是“资源池化”——将分散在48台服务器中的计算资源、内存资源和显存资源全部池化。基于灵衢总线(UB fabric)和全局共享内存,不同节点上的NPU可以像访问本地内存一样访问远端内存,延迟达到微秒级别。这种设计让384颗NPU在逻辑上仿佛是一台计算机内的设备在协同工作。
超节点架构从本质上适配于MoE(混合专家)大模型。MoE模型的专家并行推理需要在不同专家之间频繁交换激活信息,传统的跨机通信会引入显著的NPU空闲等待时间。而CloudMatrix384通过对等全互联和全局共享内存,将跨节点通信延迟压缩到极致,在主流模型上实现了4-5倍以上的单卡推理性能提升。
华为云的规划不止于此。未来CloudMatrix超节点规格将从384卡升级到8192卡,可实现50万到100万卡的超大规模集群。
二、xDeepServe:解耦执行架构下的极致推理效率
有了超节点硬件,还需要与之匹配的软件系统来释放算力。华为云在arXiv上发表的论文详细介绍了xDeepServe——CloudMatrix384上MaaS(模型即服务)的生产级推理服务系统。
xDeepServe的核心创新是Transformerless解耦执行架构。传统Transformer推理将Attention、Feedforward和MoE等模块耦合在同一个设备上执行,资源利用率低且难以独立扩展。Transformerless将这些模块拆解为独立的执行单元,分别部署在不同的NPU上,通过高速互联网络协同工作。
这种解耦架构支持两种部署形态:
Prefill-Decode分离:大模型推理分为Prefill(预填充,计算prompt的KV Cache)和Decode(逐Token生成)两个阶段。两者的计算特性完全不同——Prefill是计算密集型,Decode是访存密集型。传统方案中两者耦合在同一设备上,资源无法按需配置。xDeepServe将两者解耦部署,Prefill阶段由计算优化的节点集群负责,Decode阶段由内存优化的节点集群负责,各自独立扩展。
MoE-Attention分离:MoE模型的专家网络和Attention机制也可以解耦部署。Attention模块对序列长度敏感,专家网络对模型宽度敏感,分离后各自按需伸缩。
为了支撑这种解耦架构,华为云自研了XCCL通信库。XCCL利用CloudMatrix384的全局共享内存,实现了微秒级的点对点通信和高可扩展的All-to-All原语。在峰值解码配置下,xDeepServe在每颗昇腾910C芯片上达到了2400 Token/秒的吞吐,单Token输出时间(TPOT)约50毫秒。
三、FlexNPU柔性液态算力:让每一分算力物尽其用
即便有了超节点和高效的推理服务系统,AI基础设施仍然面临一个棘手的问题:算力碎片化。
华为公司Fellow、华为云服务首席架构师顾炯炯指出,Agentic AI云基础设施面临小模型单卡吃不满、大模型推理PD分离资源偏科、潮汐效应等因素导致的算力资源利用率低,以及万卡训练集群故障爆炸半径大等核心困境。传统软硬耦合的架构已无法应对这些挑战。
华为云的解法是FlexNPU柔性液态算力创新架构。它在业界主流训练和推理框架与昇腾NPU硬件算力层之间引入了一层“软件定义调度与虚拟化”软件,实现了三个层面的突破:
算子级细粒度时空复用:传统的NPU分配以“卡”为单位——一个推理任务独占一整张NPU卡,即使只用到了其中10%的算力,剩下的90%也无法分配给其他任务。FlexNPU实现了算子级别的细粒度复用,将一张NPU卡的计算能力在时间维度和空间维度上同时切分,多模型及PD推理可以共卡执行。
硬件故障隔离:在大规模集群中,单卡故障是常态而非异常。传统方案中一张卡故障可能导致整个任务失败。FlexNPU通过虚拟化层实现了故障的硬件级隔离,单卡故障不影响同节点上其他任务的运行。
基于透明快照的极速Serverless弹性:传统Serverless容器的启动时间在秒级到分钟级。FlexNPU基于透明快照技术,将节点级弹性及硬件故障恢复时间从分钟级降至秒级。
FlexNPU带来的三重突破可以概括为:更高效(算力利用率大幅提升)、更敏捷(弹性扩缩容达到秒级)、零宕机(故障对业务透明)。其核心价值在于“让用户的每一分算力投入物尽其用,让每一笔Token的支出,不再为空闲算力买单”。
四、CCE VolcanoNext:通智一体化调度
算力虚拟化和池化解决了资源供给的灵活性,但还需要一个“大脑”来统筹调度——既要调度通用计算(CPU),也要调度智能计算(NPU/GPU),还要在两者之间动态调配。
华为云发布的CCE VolcanoNext通智一体化调度引擎正是为此而生。它的核心创新在于两个层面:
训推共池:训练任务和推理任务对资源的需求特性不同——训练需要长时间、大带宽的稳定算力,推理需要低延迟、高并发的弹性算力。传统方案中两者资源池隔离,造成资源浪费。VolcanoNext将训练和推理放在同一个资源池中,通过智能调度实现资源的动态复用。
碎片整合:如前所述,算力碎片化是AI基础设施的普遍痛点。VolcanoNext通过精细化的资源调度策略,将分散在各个节点上的碎片化算力整合起来,形成可用的计算单元。
实测数据显示,CCE VolcanoNext可将资源利用率提升30%以上。
五、四大新品与Agentic Infra全景
上述技术构成了华为云Agentic Infra的完整拼图。2026年6月,华为云正式发布了四大Agentic Infra新品:
AICS灵衢智算集群:基于昇腾950,支持10万卡级集群规模与200EFLOPS单一集群总算力,Token生成时延降至10毫秒以内,千卡每秒吞吐达到500万Tokens,在线服务可用性高达99.95%。
AMS Agentic记忆存储:Agentic AI的核心能力之一是“持续学习”——智能体需要记住历史交互和上下文信息。AMS依托NPU直通CMS硬件,为Agent提供PB级超大记忆空间,支持KV Cache分层池化,将缓存命中率提升至95%,成本节省高达63%。
AgentSphere:Agent运行环境,凭借羽量级沙箱技术实现100毫秒级极速启动与每分钟十万级批创能力。
CCE VolcanoNext:通智一体化调度引擎,如前所述。
结语
从CloudMatrix384超节点的硬件池化,到xDeepServe的软件解耦执行,再到FlexNPU的细粒度算力虚拟化,最后到VolcanoNext的全局智能调度——华为云Agentic Infra构建了一个从硬件到软件、从单卡到万卡、从静态分配到动态复用的完整技术栈。
这套架构的意义超越了单纯的性能数字提升。它标志着云计算基础设施正在经历一次根本性的范式转移:服务对象从人转向AI,优化目标从“任务吞吐”转向“Token效率”,调度粒度从“服务器”细化到“算子”。理解这一趋势,有助于把握下一代云计算架构的设计方向——当智能体成为云服务的主要消费者时,基础设施的每一层都需要为Token的生成和流动重新设计。
- 点赞
- 收藏
- 关注作者
评论(0)