AUG 10, 2026 · PREPRINT
Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs
arXiv
A methodological paper proposing a novel training framework for LRM safety with empirical results on synthetic jailbreak robustness, but lacking peer review, clinical or real-world validation, and independent confirmation.
Reported
Training dataset size1K synthesized samples