🟢 🛡️ Sicherheit Veröffentlicht: · 1 Min. Lesezeit ·

arXiv:2607.18086: Evidence-Sufficiency-Prompting senkt die Selbstüberschätzung klinischer LLMs, aber auch die Genauigkeit

arXiv:2607.18086 ↗

Darstellung des Kompromisses zwischen verringerter Selbstüberschätzung und verringerter diagnostischer Genauigkeit eines klinischen Sprachmodells

Koyar Afrasyab testet ein strukturiertes Evidence-Sufficiency-Prompt an 4 klinischen Sprachmodellen und 1.200 gepaarten Vergleichen. Unsichere Selbstüberschätzung sinkt von 49,3 % auf 24,7 %, wobei die Verbesserung judge-abhängig ist, während die diagnostische Genauigkeit gleichzeitig von 80,3 % auf 50,3 % fällt, was auf einen Kompromiss zwischen Sicherheit und Nutzen hindeutet.

🤖

Dieser Artikel wurde mithilfe von künstlicher Intelligenz aus Primärquellen erstellt.

Was ist Evidence-Sufficiency-Prompting?

Koyar Afrasyab testet im Paper „Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs” (arXiv:2607.18086) einen strukturierten Prompt, der die Overconfidence, die übermäßige Selbstsicherheit klinischer Sprachmodelle in ihre eigenen diagnostischen Schlussfolgerungen, verringern soll. Evidence-Sufficiency-Prompting fordert das Modell explizit auf zu beurteilen, ob genügend Evidenz vorliegt, bevor es eine sichere Schlussfolgerung äußert. Der Test wurde an 4 Modellen und 1.200 gepaarten Vergleichen durchgeführt.

Rückgang der unsicheren Selbstüberschätzung von 49,3 % auf 24,7 %

Unsichere Selbstüberschätzung, also Fälle, in denen das Modell trotz unzureichender Evidenz sicher auftritt, sinkt durch Evidence-Sufficiency-Prompting von 49,3 % auf 24,7 %. Die Verbesserung ist jedoch judge-abhängig: Unterschiedliche Systeme oder Personen, die die Antworten des Modells beurteilen, erhalten für denselben Prompt deutlich unterschiedliche Effektgrößen.

Diagnostische Genauigkeit fällt von 80,3 % auf 50,3 %

Gleichzeitig sinkt die diagnostische Genauigkeit des Modells deutlich, von 80,3 % auf 50,3 %. Afrasyab folgert, dass Sicherheitsmaße klinischer LLMs als direktionale oder relative Veränderungen berichtet werden sollten, nicht als absolute Zahlen, und dass vor dem klinischen Einsatz eine menschliche Validierung jeder Schlussfolgerung zwingend erforderlich ist.

Häufig gestellte Fragen

Was ist Evidence-Sufficiency-Prompting?
Evidence-Sufficiency-Prompting ist ein strukturierter Prompt, der ein klinisches Sprachmodell explizit auffordert zu beurteilen, ob ausreichend Evidenz vorliegt, bevor es eine sichere diagnostische Schlussfolgerung äußert, mit dem Ziel, Overconfidence zu verringern, also die übermäßige Selbstsicherheit des Modells in eigene Aussagen.
Warum ist die Sicherheitsverbesserung judge-abhängig?
Judge-abhängig bedeutet, dass das Ausmaß der Verbesserung vom Bewerter abhängt — verschiedene Systeme oder Personen, die die Antworten des Modells beurteilen, messen für denselben Prompt deutlich unterschiedliche Effekte, sodass das Ergebnis nicht als eine einzige universelle, absolute Zahl betrachtet werden kann.
Welchen Kompromiss gibt es zwischen Sicherheit und diagnostischer Genauigkeit?
Unsichere Selbstüberschätzung sinkt durch Evidence-Sufficiency-Prompting von 49,3 % auf 24,7 %, doch die diagnostische Genauigkeit fällt gleichzeitig von 80,3 % auf 50,3 %, was zeigt, dass der Sicherheitsgewinn mit erheblichen Kosten beim Nutzen des Modells einhergeht.

📬 KI-News in dein Postfach

Ein täglicher Digest nach deinen Regeln — Themen, Quellen und Rhythmus wählbar. Abmeldung mit einem Klick.