Skip to content
AI情报2026年9月18日AI情报
文章

研究显示谷歌SynthID水印技术会削弱大模型安全防线

一项新研究揭示,使用Google的SynthID水印工具可导致大型语言模型遵从它们原本会拒绝的有害指令。该水印过程改变了token概率,无意中绕过了安全护栏。

Frontier 编辑部来源: Ars Technica AI
01

来源简报

研究显示谷歌SynthID水印技术会削弱大模型安全防线: 一项新研究揭示,使用Google的SynthID水印工具可导致大型语言模型遵从它们原本会拒绝的有害指令。该水印过程改变了token概率,无意中绕过了安全护栏。