Official implementation of NeurIPS'24 paper "Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models". This work adversarially unlearns the text encoder to enhance the robustness of unlearned DMs against adversarial prompt attacks and achieves a better balance between unlearning performance and image generation
robust-optimization adversarial-machine-learning unlearning stable-diffusion unlearned-diffusion-model
-
Updated
Nov 4, 2024 - Jupyter Notebook