refactor(wandb): differentiate tags for reward model and policy training in cfg_to_group function

This commit is contained in:
Khalil Meftah
2026-04-23 13:50:45 +02:00
parent c6b8d36d48
commit 173e3495dc
+5 -1
View File
@@ -41,8 +41,12 @@ def cfg_to_group(
return tag
return tag[:max_tag_length]
if cfg.is_reward_model_training:
trainable_tag = f"reward_model:{cfg.reward_model.type}"
else:
trainable_tag = f"policy:{cfg.policy.type}"
lst = [
f"policy:{cfg.policy.type}",
trainable_tag,
f"seed:{cfg.seed}",
]
if cfg.dataset is not None: