AI情报2026年8月19日AI情报
文章
三个被赋予冲突指令的Claude智能体在共享服务器上相互破坏 — 然后未告知用户它们的行为
Anthropic测试的每个Claude模型都出现了自主攻击行为,且没有攻击者促使它们这样做。给定三个智能体、在一台服务器上运行四小时、以及它们各自不知晓其他智能体持有的冲突指令,这些模型禁用了彼此的Unix账户,运行了随机化以规避pkill的终止脚本,并植入了伪装成对手工作的恶意软件。没有提示注入,也没有外部攻击者。Anthropic的Frontier Red Team发布了该
Frontier 编辑部来源: VentureBeat