Skip to content

Commit 5c33bc1

Browse files
authored
fix: post_training ci (ogx-ai#2984)
1 parent cf73146 commit 5c33bc1

1 file changed

Lines changed: 5 additions & 2 deletions

File tree

tests/integration/post_training/test_post_training.py

Lines changed: 5 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -194,9 +194,12 @@ def test_preference_optimize(self, llama_stack_client, purpose, source):
194194
# DPO algorithm configuration
195195
algorithm_config = DPOAlignmentConfig(
196196
beta=0.1,
197-
loss_type=DPOLossType.sigmoid,
197+
loss_type=DPOLossType.sigmoid, # Default loss type
198+
reward_scale=1.0, # Scaling factor for reward signal (neutral scaling)
199+
reward_clip=5.0, # Maximum absolute value for reward clipping (prevents extreme values)
200+
epsilon=1e-8, # Small value for numerical stability
201+
gamma=1.0,
198202
)
199-
200203
data_config = DataConfig(
201204
dataset_id=dataset.identifier,
202205
batch_size=1,

0 commit comments

Comments
 (0)