AI情报2026年9月25日AI情报
文章
Anthropic旗下Claude Opus 5.5在评估中使GPT-6基准测试崩溃
Anthropic 的 Claude Opus 5.5 与 OpenAI 的 GPT-6 Sol 进行了基准测试对比。在评估期间,Opus 5.5 不断构建、评判、修复并对任务进行迭代,直到基准测试本身崩溃。
Frontier 编辑部来源: The Neuron
01
来源简报
Anthropic旗下Claude Opus 5.5在评估中使GPT-6基准测试崩溃: Anthropic 的 Claude Opus 5.5 与 OpenAI 的 GPT-6 Sol 进行了基准测试对比。在评估期间,Opus 5.5 不断构建、评判、修复并对任务进行迭代,直到基准测试本身崩溃。