认领信息
当前进展
目前已经完成 GraphGPO 在 Relax 中的主要接入:
- 完成 ALFWorld agentic rollout、逐 turn 轨迹导出和 reward 处理;
- 实现 GraphGPO 图构建、图优势计算及 episode advantage 组合;
- 支持
GRPO / GiGPO / GraphGPO 三种方法使用同一套 recipe 切换;
- 支持不同轨迹产生不同数量 turn rows,并完成对应的 variable-row 数据传输与训练适配;
- GraphGPO 关闭时不改变 Relax 原有默认训练行为;
- 已冻结模型、ALFWorld 数据、任务 manifest、采样参数和评估集。
已完成验证
- 固定镜像候选回归测试:
190 passed;
- 真实 ALFWorld
reset/step 验证通过;
- 1-epoch GPU E2E smoke 通过;
- 2-epoch 连续训练稳定性 smoke 通过;
- 全规模 1-epoch smoke 通过;
- 10-epoch GraphGPO pilot 完成,评估成功率由
12.50% 提升至 16.41%、22.66%;
- rollout、GraphGPO advantage、TransferQueue、Megatron actor training、evaluation 和 checkpoint 链路均已贯通。
正式实验方案
正式实验统一使用:
- 模型:Qwen2.5-1.5B-Instruct
- 环境:ALFWorld
- 训练长度:150 outer epochs
- Seeds:0、1、2
- 主对照:GRPO、GiGPO、GraphGPO
- 消融:graph-only 三个 seed
- episode-only 与 GRPO 等价性通过数值测试和 parity smoke 验证
完整实验共 12 组:
- GRPO:3 seeds
- GiGPO:3 seeds
- GraphGPO:3 seeds
- graph-only:3 seeds
正式实验当前状态
截至本次更新,已有 2 组完整结束,4 组正在运行:
| 方法 |
Seed |
进度 |
最新评估成功率 |
| GraphGPO |
0 |
150/150 |
88.28% |
| GiGPO |
0 |
150/150 |
78.91% |
| GRPO |
0 |
136/150 |
45.31%(eval 134) |
| GiGPO |
1 |
24/150 |
17.19%(eval 24) |
| GRPO |
1 |
8/150 |
23.44%(eval 4) |
| GRPO |
2 |
已启动 |
13.28%(初始评估) |
以上仍是单 seed 和训练中间结果,不作为最终算法效果结论。待全部实验结束后,将汇总每个 seed 的完整曲线、三 seed 均值与标准差、paired delta、消融结果及与论文报告值的差异,并提交完整复现报告。
认领信息
当前进展
目前已经完成 GraphGPO 在 Relax 中的主要接入:
GRPO / GiGPO / GraphGPO三种方法使用同一套 recipe 切换;已完成验证
190 passed;reset/step验证通过;12.50%提升至16.41%、22.66%;正式实验方案
正式实验统一使用:
完整实验共 12 组:
正式实验当前状态
截至本次更新,已有 2 组完整结束,4 组正在运行:
以上仍是单 seed 和训练中间结果,不作为最终算法效果结论。待全部实验结束后,将汇总每个 seed 的完整曲线、三 seed 均值与标准差、paired delta、消融结果及与论文报告值的差异,并提交完整复现报告。