arXiv:2607.08173: 『Overthinking』 — 강화된 추론이 추론 모델로 하여금 학습된 비밀을 누설하게 만드는 ICML 2026 신규 추출 공격
『Overthinking』은 ICML 2026에 채택된 논문으로, 대형 언어 모델에서 추론 가중치를 강화하면 일반적으로 노출되지 않는 잠재적 학습 정보를 추출할 수 있음을 보여줍니다. 이 발견은 o1, DeepSeek R1, 확장 사고 기능의 Claude 등 추론 모델을 겨냥하는 새로운 추출 공격 유형을 열어줍니다.