Claude Opus 5 5
主题归档 • 1 条结果
2026-09-25
科技
Anthropic旗下Claude Opus 5.5在评估中使GPT-6基准测试崩溃: Anthropic 的 Claude Opus 5.5 与 OpenAI 的 GPT-6 Sol 进行了基准测试对比。在评估期间,Opus 5.5 不断构建、评判、修复并对任务进行迭代,直到基准测试本身崩溃。
大语言模型与模型评估 • The Neuron
永久链接
主题归档 • 1 条结果
Anthropic旗下Claude Opus 5.5在评估中使GPT-6基准测试崩溃: Anthropic 的 Claude Opus 5.5 与 OpenAI 的 GPT-6 Sol 进行了基准测试对比。在评估期间,Opus 5.5 不断构建、评判、修复并对任务进行迭代,直到基准测试本身崩溃。
大语言模型与模型评估 • The Neuron
永久链接