There was an error while loading. Please reload this page.
1 parent 72bc1d0 commit 9b85e63Copy full SHA for 9b85e63
1 file changed
docs_roll/docs/简体中文/Pipeline/RLVR_cn.md
@@ -10,7 +10,7 @@ RLVR Pipeline (Reinforcement Learning with Verifiable Rewards Pipeline)
10
11
* **多任务联合训练**:支持跨领域的同时优化,实现模型在数学、编程、通用推理等多个领域的协同提升。通过 `domain_interleave_probs` 精确控制各领域数据的采样比例,每个领域可配置独立的奖励处理策略和权重系数,避免了单一任务训练可能导致的能力局限。
12
13
-* **算法友好的强化学习框架**:提供超过 20 种强化学习策略选项,支持 PPO、GRPO、Reinforce++、TOPR、RAFT++ 等多种前沿算法。丰富的奖励处理策略包括奖励标准化、奖励裁剪、奖励缩放等,多种优势估计方法,以及灵活的损失函数配置,使研究人员能够轻松实验不同的算法组合。
+* **算法友好的强化学习框架**:提供多种强化学习策略选项,支持 PPO、GRPO、Reinforce、TOPR等多种前沿算法。丰富的奖励处理策略包括奖励标准化、奖励裁剪、奖励缩放等,多种优势估计方法,以及灵活的损失函数配置,使研究人员能够轻松实验不同的算法组合。
14
15
* **全面的性能监控**:细粒度的指标追踪系统提供全方位的训练过程监控,同时追踪组级别和批次级别的性能指标,按任务领域分别统计和展示性能指标,以及 GPU 使用率、内存占用、训练吞吐量等系统指标,为模型训练过程提供全面的可视化和分析功能**。**
16
0 commit comments