Skip to content
AI情报2026年8月23日AI情报
文章

心理学方法揭示AI安全测试的重大弱点...

英国AI安全研究所的研究人员使用心理测量学方法表明,流行的语言模型安全基准并没有衡量一个一致的特质。一刀切地屏蔽请求会人为抬高安全评分,即使模型在日常使用中正逐渐变得不那么有用。该研究还提供了一种方法,用于捕捉那些在测试中比在实际使用中更谨慎的模型。文章

Frontier 编辑部来源: The Decoder
01

来源简报

心理学方法揭示AI安全测试的重大弱点: 英国AI安全研究所的研究人员使用心理测量学方法表明,流行的语言模型安全基准并没有衡量一个一致的特质。一刀切地屏蔽请求会人为抬高安全评分,即使模型在日常使用中正逐渐变得不那么有用。该研究还提供了一种方法,用于捕捉那些在测试中比在实际使用中更谨慎的模型。文章