arXiv:2607.18086: エビデンス充足性プロンプトが臨床LLMの過信を減らすが、精度も低下させる
Koyar Afrasyabは、4つの臨床言語モデルと1,200組のペア比較で、構造化されたエビデンス充足性(evidence-sufficiency)プロンプトをテストしました。安全でない過信は49.3%から24.7%に低下しましたが、その改善は評価者に依存(judge-dependent)しており、診断精度も同時に80.3%から50.3%へと低下し、安全性と有用性のトレードオフを示しています。
この記事はAIにより一次情報源から生成されました。
エビデンス充足性プロンプトとは何か?
Koyar Afrasyabは、論文「Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs」(arXiv:2607.18086)において、臨床言語モデルが自らの診断結論に対して抱くoverconfidence(過信)を軽減するよう設計された構造化プロンプトをテストしています。エビデンス充足性プロンプトは、確信を持った結論を出す前に、十分な根拠があるかどうかをモデルに明示的に評価させるものです。テストは4つのモデルと1,200組のペア比較で行われました。
安全でない過信が49.3%から24.7%へ低下
安全でない過信、すなわちモデルが十分な根拠がないにもかかわらず確信を持っているように振る舞うケースは、エビデンス充足性プロンプトの導入により49.3%から24.7%へと低下しました。しかしこの改善はjudge-dependent、つまり評価者に依存しています。モデルの回答を評価する異なるシステムや人物は、同じプロンプトに対して本質的に異なる効果の大きさを得ています。
診断精度は80.3%から50.3%へ低下
同時に、モデルの診断精度は80.3%から50.3%へと大きく低下しました。Afrasyabは、臨床LLMの安全性に関する指標は絶対的な数値としてではなく、方向性のある、あるいは相対的な変化として報告すべきであり、臨床応用の前にはすべての結論に対する人間による検証が必須であると結論づけています。
よくある質問
- evidence-sufficiency promptingとは何ですか?
- evidence-sufficiency promptingとは、臨床言語モデルに対し、確信を持った診断結論を出す前に、十分な根拠があるかどうかを明示的に評価するよう求める構造化プロンプトであり、モデルの自身の主張に対するoverconfidence(過信)を軽減することを目的としています。
- なぜ安全性の改善はjudge-dependentなのですか?
- judge-dependentとは、改善の程度が評価者に依存することを意味します。モデルの回答を評価する異なるシステムや人物は、同じプロンプトに対して本質的に異なる効果の大きさを測定するため、結果を単一の普遍的・絶対的な数値として捉えることはできません。
- 安全性と診断精度の間にはどのようなトレードオフがありますか?
- evidence-sufficiency promptingにより、安全でない過信は49.3%から24.7%へと低下しますが、診断精度も同時に80.3%から50.3%へと低下し、安全性の向上がモデルの有用性における大きなコストを伴うことを示しています。
📬 AIニュースをあなたの受信箱へ
毎日のダイジェストを自分仕様に——トピック、ソース、頻度を選べます。ワンクリックで解除。