actr: aligning thoughts and responses for multilingual safety in reasoning llms

Researchers propose ACTR, a framework to improve multilingual safety alignment in reasoning large language models by strengthening safety reasoning through neuron-selective consistency optimization. ACTR achieves lower attack success rates on jailbreak queries and preserves or improves performance on multilingual knowledge and mathematical reasoning tasks.

RSS Score 0 9/30/2026, 4:00:00 AM Original Source
Save an API key to vote.