@@ -6,11 +6,11 @@ ENTRYPOINT=${ENTRYPOINT:-"-m verl.trainer.sft_trainer"}
66NUM_GPUS=${NUM_GPUS:- 8}
77
88MODEL_ID=${MODEL_ID:- Qwen/ Qwen2.5-0.5B-Instruct}
9- MODEL_PATH=${MODEL_PATH:- ${HOME} / models/ ${MODEL_ID} }
10- # hf download "${MODEL_ID}" --local-dir "${MODEL_PATH}"
9+ MODEL_PATH=${MODEL_PATH:-/ weka / nora-default / aakankshan / interactive_tables / models/ ${MODEL_ID} }
10+ hf download " ${MODEL_ID} " --local-dir " ${MODEL_PATH} "
1111
12- TRAIN_FILES=${TRAIN_FILES:- $HOME / data/ gsm8k_sft / train.parquet}
13- VAL_FILES=${VAL_FILES:- $HOME / data/ gsm8k_sft / test.parquet}
12+ TRAIN_FILES=${TRAIN_FILES:-/ weka / nora-default / aakankshan / interactive_tables / data/ gsm8k_sft_messages / train.parquet}
13+ VAL_FILES=${VAL_FILES:-/ weka / nora-default / aakankshan / interactive_tables / data/ gsm8k_sft_messages / test.parquet}
1414
1515SP_SIZE=${SP_SIZE:- 1}
1616LIGER=${LIGER:- False}
@@ -23,11 +23,11 @@ RESUME_MODE=${RESUME_MODE:-disable}
2323SAVE_FREQ=${SAVE_FREQ:- 1}
2424
2525micro_bsz=2
26- NUM_GPUS=8
26+ NUM_GPUS=1
2727
2828project_name=" verl-test"
2929exp_name=" $( basename " ${MODEL_ID,,} " ) -sft-minimal"
30- ckpts_home=${ckpts_home:- $HOME / ${project_name} / ${exp_name} }
30+ ckpts_home=${ckpts_home:-/ weka / nora-default / aakankshan / interactive_tables / models / checkpoints }
3131
3232mkdir -p " ${ckpts_home} "
3333
@@ -48,11 +48,11 @@ torchrun --standalone --nnodes=1 --nproc_per_node=${NUM_GPUS} ${ENTRYPOINT} \
4848 trainer.default_local_dir=" ${ckpts_home} " \
4949 trainer.project_name=" ${project_name} " \
5050 trainer.experiment_name=" ${exp_name} " \
51- trainer.total_training_steps=${TOTAL_TRAIN_STEP} \
52- trainer.save_freq=${SAVE_FREQ} \
51+ trainer.total_training_steps=100 \
52+ trainer.save_freq=25 \
5353 checkpoint.save_contents=[model,optimizer,extra,hf_model] \
5454 trainer.max_ckpt_to_keep=1 \
5555 trainer.resume_mode=${RESUME_MODE} \
5656 trainer.logger=[' console' ] $@
5757
58- rm -rf " ${ckpts_home:? } /*"
58+ rm -rf " ${ckpts_home:? } /*"
0 commit comments