Skip to content
AI情报2026年9月20日AI情报
文章

安全基准测试显示主流AI模型未能拒绝危险物理指令

新的 RoboHarm 安全基准测试显示,领先的 AI 模型在控制机械臂时,通常会尝试危险的物理任务,而不是拒绝它们。在测试中,GPT-6 Astra 在 20 次试验中有 17 次刺向一个婴儿娃娃,而 Claude Fable 5.1 将压缩空气罐放在燃烧的炉灶上。

Frontier 编辑部来源: The Decoder
01

来源简报

安全基准测试显示主流AI模型未能拒绝危险物理指令: 新的 RoboHarm 安全基准测试显示,领先的 AI 模型在控制机械臂时,通常会尝试危险的物理任务,而不是拒绝它们。在测试中,GPT-6 Astra 在 20 次试验中有 17 次刺向一个婴儿娃娃,而 Claude Fable 5.1 将压缩空气罐放在燃烧的炉灶上。