Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning
Researchers propose a hybrid defense, VaccineBooster, to improve alignment in language models under harmful fine-tuning attacks. It combines embedding perturbation and weight-level gradient attenuation, achieving better results than previous methods.
Save an API key to vote.