Skip to content

【Task.37】GraphGPO 论文复现进展 #225

Description

@chengxiang-bot

认领信息

当前进展

目前已经完成 GraphGPO 在 Relax 中的主要接入:

  • 完成 ALFWorld agentic rollout、逐 turn 轨迹导出和 reward 处理;
  • 实现 GraphGPO 图构建、图优势计算及 episode advantage 组合;
  • 支持 GRPO / GiGPO / GraphGPO 三种方法使用同一套 recipe 切换;
  • 支持不同轨迹产生不同数量 turn rows,并完成对应的 variable-row 数据传输与训练适配;
  • GraphGPO 关闭时不改变 Relax 原有默认训练行为;
  • 已冻结模型、ALFWorld 数据、任务 manifest、采样参数和评估集。

已完成验证

  • 固定镜像候选回归测试:190 passed
  • 真实 ALFWorld reset/step 验证通过;
  • 1-epoch GPU E2E smoke 通过;
  • 2-epoch 连续训练稳定性 smoke 通过;
  • 全规模 1-epoch smoke 通过;
  • 10-epoch GraphGPO pilot 完成,评估成功率由 12.50% 提升至 16.41%22.66%
  • rollout、GraphGPO advantage、TransferQueue、Megatron actor training、evaluation 和 checkpoint 链路均已贯通。

正式实验方案

正式实验统一使用:

  • 模型:Qwen2.5-1.5B-Instruct
  • 环境:ALFWorld
  • 训练长度:150 outer epochs
  • Seeds:0、1、2
  • 主对照:GRPO、GiGPO、GraphGPO
  • 消融:graph-only 三个 seed
  • episode-only 与 GRPO 等价性通过数值测试和 parity smoke 验证

完整实验共 12 组:

  • GRPO:3 seeds
  • GiGPO:3 seeds
  • GraphGPO:3 seeds
  • graph-only:3 seeds

正式实验当前状态

截至本次更新,已有 2 组完整结束,4 组正在运行:

方法 Seed 进度 最新评估成功率
GraphGPO 0 150/150 88.28%
GiGPO 0 150/150 78.91%
GRPO 0 136/150 45.31%(eval 134)
GiGPO 1 24/150 17.19%(eval 24)
GRPO 1 8/150 23.44%(eval 4)
GRPO 2 已启动 13.28%(初始评估)

以上仍是单 seed 和训练中间结果,不作为最终算法效果结论。待全部实验结束后,将汇总每个 seed 的完整曲线、三 seed 均值与标准差、paired delta、消融结果及与论文报告值的差异,并提交完整复现报告。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions