fix(train): raise ValueError for PEFT usage in reward model training

This commit is contained in:
Khalil Meftah
2026-04-23 13:59:58 +02:00
parent 173e3495dc
commit 9f739ac1ff
+2
View File
@@ -275,6 +275,8 @@ def train(cfg: TrainPipelineConfig, accelerator: "Accelerator | None" = None):
) )
if cfg.peft is not None: if cfg.peft is not None:
if cfg.is_reward_model_training:
raise ValueError("PEFT is only supported for policy training. ")
logging.info("Using PEFT! Wrapping model.") logging.info("Using PEFT! Wrapping model.")
peft_cli_overrides = dataclasses.asdict(cfg.peft) peft_cli_overrides = dataclasses.asdict(cfg.peft)
policy = policy.wrap_with_peft(peft_cli_overrides=peft_cli_overrides) policy = policy.wrap_with_peft(peft_cli_overrides=peft_cli_overrides)