AI情报2026年8月20日AI情报
文章
愚人金:针对开放权重模型安全移除攻击的防御性欺骗
公告类型:新 摘要:开放权重语言模型的安全对齐是微不足道可移除的:abliteration 在几分钟内从权重中投射出拒绝中介方向,而且据我们所知,没有发布时防御能够持久地阻止它。无法阻止的可以被欺骗。我们的防御,诱饵强化(“愚人金”),放弃拒绝条带并毒化其收益:一旦拒绝
Frontier 编辑部来源: arXiv
公告类型:新 摘要:开放权重语言模型的安全对齐是微不足道可移除的:abliteration 在几分钟内从权重中投射出拒绝中介方向,而且据我们所知,没有发布时防御能够持久地阻止它。无法阻止的可以被欺骗。我们的防御,诱饵强化(“愚人金”),放弃拒绝条带并毒化其收益:一旦拒绝