Gpt 6
主题归档 • 1 条结果
2026-09-17
科技
新基准SAFE评估前沿AI模型是否在部署前获取安全证据: 研究人员推出了 SAFE,这是一个用于评估前沿模型在做出部署决策之前是否会选择获取安全相关证据的基准。对 GPT-5.5、o3、Claude Opus 4.8 和 Claude Sonnet 4.6 的测试揭示了这些模型之间不同的证据获取策略。
人工智能安全 • arXiv
永久链接
主题归档 • 1 条结果
新基准SAFE评估前沿AI模型是否在部署前获取安全证据: 研究人员推出了 SAFE,这是一个用于评估前沿模型在做出部署决策之前是否会选择获取安全相关证据的基准。对 GPT-5.5、o3、Claude Opus 4.8 和 Claude Sonnet 4.6 的测试揭示了这些模型之间不同的证据获取策略。
人工智能安全 • arXiv
永久链接