Thinking Dangerously: How Reasoning Training Dilutes Safety in Language Models
Dongxin Guo, Jikun Wu, Siu Ming Yiu
2026年份
问问这篇 Paper
问问你的智能体。
Lune 读过与它相关的顶会 Paper,每个回答都会注明依据哪几篇。
相关 Paper
- Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning TrainingZheng Xin Yong, Stephen H. BachICLR 2026 · 被引用 10 次
- Finding and Reactivating Post-Trained LLMs' Hidden Safety MechanismsMingjie Li, Wai Man Si, Michael Backes, Yang Zhang 等NeurIPS 2025 · 被引用 4 次
- Reasoning Structure Matters for Safety Alignment of Reasoning ModelsYeonjun In, Wonjoong Kim, Sangwu Park, Chanyoung ParkACL 2026
- How Should We Enhance the Safety of Large Reasoning Models: An Empirical StudyZhexin Zhang, Xian Qi Loye, Victor Shea-Jay Huang, Junxiao Yang 等ACL 2026 · 被引用 20 次
- When Thinking Backfires: Mechanistic Insights into Reason-induced MisalignmentHanqi Yan, Hainiu Xu, Siya Qi, Shu Yang 等ICLR 2026 · 被引用 3 次
