Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning

Researchers propose a hybrid defense, VaccineBooster, to improve alignment in language models under harmful fine-tuning attacks. It combines embedding perturbation and weight-level gradient attenuation, achieving better results than previous methods.

RSS Score 0 9/30/2026, 4:00:00 AM Original Source
Save an API key to vote.