Skip to content
AI情报2026年8月20日AI情报
文章

DeepSeek排名第一的V4 Flash在真实智能体任务上表现不佳,而它的价格却在飙升。

DeepSeek 的 V4 Flash 自推出以来一直位居模型排行榜榜首,并被开发者誉为“全能怪兽”。但在实际测试中,它仅完成了 53.8% 的一批复杂智能体任务。Composio 让该模型在 30 个故意设计得困难的多步骤任务上,通过了八个不同的智能体测试框架,包括 Claude Code、Codex 和 OpenCode,这些任务涉及 Gmail、GitHub、Slack 和 Google 等实时工具。

Frontier 编辑部来源: VentureBeat
01

来源简报

DeepSeek排名第一的V4 Flash在真实智能体任务上表现不佳,而它的价格却在飙升。: DeepSeek 的 V4 Flash 自推出以来一直位居模型排行榜榜首,并被开发者誉为“全能怪兽”。但在实际测试中,它仅完成了 53.8% 的一批复杂智能体任务。Composio 让该模型在 30 个故意设计得困难的多步骤任务上,通过了八个不同的智能体测试框架,包括 Claude Code、Codex 和 OpenCode,这些任务涉及 Gmail、GitHub、Slack 和 Google 等实时工具。

02