Skip to content

Commit 9b85e63

Browse files
douph810975StephenRi
authored andcommitted
fix typo
1 parent 72bc1d0 commit 9b85e63

1 file changed

Lines changed: 1 addition & 1 deletion

File tree

docs_roll/docs/简体中文/Pipeline/RLVR_cn.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -10,7 +10,7 @@ RLVR Pipeline (Reinforcement Learning with Verifiable Rewards Pipeline) 
1010

1111
* **多任务联合训练**:支持跨领域的同时优化,实现模型在数学、编程、通用推理等多个领域的协同提升。通过 `domain_interleave_probs` 精确控制各领域数据的采样比例,每个领域可配置独立的奖励处理策略和权重系数,避免了单一任务训练可能导致的能力局限。
1212

13-
* **算法友好的强化学习框架**提供超过 20 种强化学习策略选项,支持 PPO、GRPO、Reinforce++、TOPR、RAFT++ 等多种前沿算法。丰富的奖励处理策略包括奖励标准化、奖励裁剪、奖励缩放等,多种优势估计方法,以及灵活的损失函数配置,使研究人员能够轻松实验不同的算法组合。
13+
* **算法友好的强化学习框架**提供多种强化学习策略选项,支持 PPO、GRPO、Reinforce、TOPR等多种前沿算法。丰富的奖励处理策略包括奖励标准化、奖励裁剪、奖励缩放等,多种优势估计方法,以及灵活的损失函数配置,使研究人员能够轻松实验不同的算法组合。
1414

1515
* **全面的性能监控**:细粒度的指标追踪系统提供全方位的训练过程监控,同时追踪组级别和批次级别的性能指标,按任务领域分别统计和展示性能指标,以及 GPU 使用率、内存占用、训练吞吐量等系统指标,为模型训练过程提供全面的可视化和分析功能****
1616

0 commit comments

Comments
 (0)