arXiv:2607.08173: 「Overthinking」——強化された推論がreasoningモデルに学習済み秘密を暴露させる、ICML 2026採択の新たな抽出攻撃
OvertinkingはICML 2026に採択された論文で、大規模言語モデルにおける推論の重みを増強することでモデルが通常は公開しない隠れた学習済み情報を引き出せることを示します。この発見はo1、DeepSeek R1、拡張思考機能付きClaudeなどreasoningモデルを標的とした新たなクラスの抽出攻撃の扉を開きます。