Claude Fable
主题归档 • 2 条结果
2026-09-20
科技
安全基准测试显示主流AI模型未能拒绝危险物理指令: 新的 RoboHarm 安全基准测试显示,领先的 AI 模型在控制机械臂时,通常会尝试危险的物理任务,而不是拒绝它们。在测试中,GPT-6 Astra 在 20 次试验中有 17 次刺向一个婴儿娃娃,而 Claude Fable 5.1 将压缩空气罐放在燃烧的炉灶上。
AI安全与监管 • The Decoder
永久链接
2026-09-15
科技
智能体工程基准测试:我如何对 Astra、Fable 5.1 和开放权重模型进行排名: 该视频在智能体工程基准测试上评估了领先的 AI 模型,包括 Claude Fable、Mythos 5.1 和 GPT-6 Astra。它认为,像 Artificial Analysis Index 这样的聚合指数可能会掩盖哪个模型最适合特定工作流。
Technology • IndyDevDan
永久链接