Skip to content
AI情报2026年8月20日AI情报
文章

大型语言模型在医学推理中表现出元认知敏感性: 公告类型:新...

摘要:大型语言模型(LLMs)在医学中越来越多地被评估和使用,但临床实用性取决于答案的准确性以及置信度是否与证据质量和不确定性相匹配。我们开发了一个受心理物理学启发的受控临床基准,用于测试医学LLM中的诊断选择和置信度行为。该基准专注于可能

Frontier 编辑部来源: arXiv
01

来源简报

大型语言模型在医学推理中表现出元认知敏感性: 公告类型:新 摘要:大型语言模型(LLMs)在医学中越来越多地被评估和使用,但临床实用性取决于答案的准确性以及置信度是否与证据质量和不确定性相匹配。我们开发了一个受心理物理学启发的受控临床基准,用于测试医学LLM中的诊断选择和置信度行为。该基准专注于可能