AReaL v1.0.5 x 昇腾RL全能力解读(二):训推共卡与多教师蒸馏——资源效率与能力融合的双重突破

举报
AGENT魔方 发表于 2026/09/07 15:34:36 2026/09/07
【摘要】 本次继续解读AReaL-Ascend v1.0.5的两大创新:训推共卡部署形态与Multi-Teacher On-Policy Distillation。这两项能力分别解决了资源效率与能力融合两大核心痛点。

上一期介绍了Code Agent长序列RL训练,本次继续解读AReaL-Ascend v1.0.5的两大创新:训推共卡部署形态与Multi-Teacher On-Policy Distillation。这两项能力分别解决了资源效率与能力融合两大核心痛点。


训推共卡:资源紧缺场景下的高效On-Policy部署形态

AReaL-Ascend v1.0.5新增了训练与推理共卡(Colocated Training & Rollout)能力。

相比训推分离需要分别为Trainer和Rollout Engine准备独立NPU资源,共卡模式让Training和vLLM Rollout复用同一组NPU,通过训练/推理阶段交替使用设备,大幅降低RL实验的资源门槛。

这一模式尤其适合:

  • NPU资源紧缺:无需额外准备独立Rollout Pool;
  • On-Policy训练:训练完成后使用最新policy直接进入下一轮 rollout,减少policy staleness;
  • 快速调试与稳定复现:资源拓扑更简单,更适合作为RL correctness / convergence baseline。

因此,AReaL-Ascend现在可以同时支持两种部署方式:

  • 训推分离:面向大规模异步吞吐;
  • 训推共卡:面向资源效率、严格On-Policy和快速复现。


共卡实现:Ray调度+AWEX IPC Zero-Copy

共卡模式的核心流程可以概括为

Ray NPU Bind
↓
Training
↓
Weight Offload
↓
Stride Fork
↓
Launch vLLM on the Same NPUs
↓
Rollout
↓
AWEX Weight Update

其中包含如下几个关键优化:

  • NPU Bind:Ray纳管NPU后,每个Training Worker固定绑定一张 NPU,为后续推理复用建立稳定的设备映射。
  • Stride Fork:根据vLLM推理实例的TP/并行规模,将一组Training Worke重新组织成一个推理实例,并复用原有Ray placement。
  • IPC Zero-Copy:推理进程通过IPC handle直接映射训练进程中的 NPU权重显存,避免 NPU → CPU → NPU 的额外数据搬运。
  • Group Tensor Packing:在IPC序列化前按照shape / dtype合并 Tensor,大幅减少大模型场景下的IPC handle数量和系统资源消耗。
  • Recursive Partition:基于AWEX transfer plan对训练权重进行重分片,仅向目标inference rank发送其所需权重,支持训练与推理并行策略不一致的场景。

1-1.png

AReaL Ray共卡调度部署

训推共卡的核心价值在于“零拷贝”——通过AWEX IPC技术,推理进程可以直接映射训练进程的显存权重,避免了传统方案中“显存→CPU→显存”的冗余数据搬运。对于27B级别的大模型,这意味着节省了数十GB的数据传输开销和数秒的等待时间。

Qwen3.6-27B单节点共卡样例

v1.0.5已提供Qwen3.6-27B + Geometry3K + GRPO + AWEX Colocate 的可运行样例:

https://github.com/HwVanICI/AReaL/blob/ascend-v1.0.5/examples/vlm_npu/qwen3_6_27b_geometry3k_grpo_awex_colocate.yaml

样例配置:

1-2.png


运行命令:

python examples/vlm/geometry3k_grpo.py \--config examples/vlm_npu/qwen3_6_27b_geometry3k_grpo_awex_colocate.yaml

1-3.png

Qwen3.6 27B单机即可完成多模态RL训练200step长稳


Multi-Teacher On-Policy Distillation:让多个领域专家能力汇聚到一个模型

除了Agentic RL,On-Policy Distillation正在成为大模型后训练中非常重要的一条技术路线。

传统RL可以将一个模型针对特定领域持续强化,但真正构建通用模型时,一个困难的问题是:

如何把多个已经训练好的领域专家能力,高效、稳定地整合到一个 Student Model中?

Multi-Teacher On-Policy Distillation(MOPD)正是针对这一问题提出的后训练范式。


为什么需要MOPD?

想象一下:你有一个擅长数学的模型A、一个精通代码的模型B、一个长于搜索的模型C——如何把它们的能力融合到一个通用模型中?传统方案是离线蒸馏,但存在“训练-测试分布不匹配”的问题。MOPD让Student模型自己生成内容,再由各领域Teacher实时评价,确保蒸馏信号始终对齐Student的真实行为。

MOPD的核心思路是:

  • 针对不同domain,分别训练独立的expert / teacher;
  • 不直接使用teacher离线生成的数据训练student;
  • 由student自己进行on-policy rollout;
  • 对student真正生成的token,由对应domain teacher进行token-level scoring;
  • 将teacher-student log-probability gap转换成稠密优化信号;
  • 最终将RL objective与distillation objective联合优化。

这相比传统off-policy distillation的一个重要优势是:MOPD通过on policy的方式,让teacher只在student当前策略真实采样出来的样本上打分,从而减少train-test distribution mismatch(训练分布和测试分布不匹配)/ teacher-student distribution mismatch(教师模型见过 / 生成的数据分布,和学生模型实际产出的数据分布不一致)。


一句话大白话总结:

传统离线蒸馏:老师提前出好卷子,学生刷卷子学习,只有参考答案那条路径有评分;学生一旦写的和参考答案中间步骤不一样,就没有参考答案可以参考。

MOPD学生现场做题, 学生写任何一步,不管是不是标准答案,老师现场针对你写出来的这一步给分。

MOPD论文进一步报告了其在多领域能力集成上的效果,并已经用于MiMo-V2-Flash的工业级后训练实践,这也使得Multi-Teacher + On-Policy Distillation成为近期非常值得关注的post-training方向。


AReaL-Ascend中的MOPD

AReaL-Ascend v1.0.5已提供完整的MOPD示例:

文档:https://github.com/HwVanICI/AReaL/blob/ascend-v1.0.5/examples/distillation/mopd/README.md

当前example使用两个不同领域:

  • AIME:数学推理领域;

  • LeetCode:代码生成领域

并已在如下环境完成验证:

2 台 Atlas 800T A3 Nodes (16卡)
1-4.png

AIME Reward:0.51 → 0.75 / 25 steps

1-5.png

LeetCode Reward:0.31 → 0.69 / 25 steps

Domain-aware Teacher Routing(领域感知教师路由)

AReaL支持按照dataset domain将不同trajectory路由到不同的 teacher:

1-6.png

例如:

AIME trajectory -> AIME Teacher
LeetCode trajectory -> LeetCode Teacher

这种设计可以让每个专家教师专注于自己擅长的领域,提升蒸馏信号的针对性 。 

除了domain routing,AReaL还支持mixture routing:多个teacher可以同时对同一trajectory进行scoring,再对它们的token log-probability进行加权组合。Mixture Routing提供了一种更灵活、更强大的知识蒸馏范式。 通过智能地融合多个专家教师的知识,来训练出一个能力更全面、更强大的学生模型,解决单一教师模型无法应对的复杂问题 。


RL + Distillation联合优化

MOPD并不是简单imitation。

Student首先自己rollout,Teacher再对Student已经生成的token进行评价。

简化理解,可以把每个token的teacher signal看成:

Teacher 更认可这个 token
提高该 token 的学习优势
Teacher 相比 Student 更不认可这个 token
降低该 token 的学习优势

这种token级别的精细化反馈,为模型提供了比传统RL中“整体回答打分”更丰富、更及时的优化指引,相当于每一步都有教师给予实时指导。

在AReaL中,最终actor objective可以同时包含:

RL Loss + MOPD Distillation Loss

因此可以同时利用:

  • Reward signal:告诉模型最终任务是否完成
  • Teacher token-level signal:告诉模型生成过程中哪些token更接近领域专家策略

相比只有terminal reward的RL,这提供了更加稠密的optimization signal。两种信号配合使用,既能确保模型最终目标不偏离,又能显著缓解纯RL训练稀疏、不稳定的问题,提升整体训练效率与收敛质量。

这类能力对于未来的模型后训练非常有价值:不同团队可以独立训练Math、Code、Search、Agent等领域Expert,再通过Multi-Teacher On-Policy Distillation将它们的能力逐步集成到一个通用Student中。这为"专家能力融合"提供了一条可规模化、可工程化的技术路径。

作为昇腾原生的开源RL后训练框架,AReaL 的每一次技术突破,华为云团队都深度参与其中,并积极推动新特性在各行业落地。当前,华为云ModelArts已原生集成AReaL训练框架,开发者可一站式快速体验其核心能力。未来,华为云将基于AReaL技术体系构建大模型后训练能力,并逐步将AReaL新特性作为云服务基础能力开放,让开发者开箱即享AReaL的技术红利。



【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。