Claude Opus 5 5
主题归档 • 3 条结果
2026-09-25
科技
Anthropic旗下Claude Opus 5.5在评估中使GPT-6基准测试崩溃: Anthropic 的 Claude Opus 5.5 与 OpenAI 的 GPT-6 Sol 进行了基准测试对比。在评估期间,Opus 5.5 不断构建、评判、修复并对任务进行迭代,直到基准测试本身崩溃。
大语言模型与模型评估 • The Neuron
永久链接
2026-09-23
科技
Anthropic 疯了(Opus 5.5): 该视频展示了一系列性能测试,用于评估 Anthropic 的 Claude 3.5 Opus 人工智能模型。嘉宾 Thariq 参与分析该模型的能力和基准测试结果。讨论重点说明了该模型与先前迭代版本及竞品的对比情况。
Technology • Matthew Berman
永久链接
2026-09-17
科技
新基准SAFE评估前沿AI模型是否在部署前获取安全证据: 研究人员推出了 SAFE,这是一个用于评估前沿模型在做出部署决策之前是否会选择获取安全相关证据的基准。对 GPT-5.5、o3、Claude Opus 4.8 和 Claude Sonnet 4.6 的测试揭示了这些模型之间不同的证据获取策略。
人工智能安全 • arXiv
永久链接