Thinking Dangerously: How Reasoning Training Dilutes Safety in Language Models
Dongxin Guo, Jikun Wu, Siu Ming Yiu
2026Year
Ask about this paper
Ask your agent about it.
Lune has read the top-tier papers around this one, so every answer names the papers it rests on.
Your agent calls
Lunesearch_papers
Free to start. No credit card required.
Terminal
Install the CLIlune papers get ead7da1d-a15a-487c-94a8-c00e65fd252dRelated papers
- Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning TrainingZheng Xin Yong, Stephen H. BachICLR 2026 · 10 citations
- Finding and Reactivating Post-Trained LLMs' Hidden Safety MechanismsMingjie Li, Wai Man Si, Michael Backes, Yang Zhang et al.NeurIPS 2025 · 4 citations
- Reasoning Structure Matters for Safety Alignment of Reasoning ModelsYeonjun In, Wonjoong Kim, Sangwu Park, Chanyoung ParkACL 2026
- How Should We Enhance the Safety of Large Reasoning Models: An Empirical StudyZhexin Zhang, Xian Qi Loye, Victor Shea-Jay Huang, Junxiao Yang et al.ACL 2026 · 20 citations
- When Thinking Backfires: Mechanistic Insights into Reason-induced MisalignmentHanqi Yan, Hainiu Xu, Siya Qi, Shu Yang et al.ICLR 2026 · 3 citations
