DeepSeek V4 Pro测评:编程与智能体能力大幅跃升

SuperCLUE 发布了 DeepSeek V4 Pro 的中文正式测评,这款在 8 月 13 日推出的旗舰大模型在综合榜单中拿到第 2 名,尤其在智能体编程板块进步显著。DeepSeek V4 Pro 原生支持百万级长文本解析,官方称其在推理、编程与智能体任务上已进入行业第一梯队。

本次测评将 13 款国产模型同台比较,设置了六大考核项,并将智能体编程权重提高到 25%,以更看重模型完成完整工程任务的能力。与预览版相比,DeepSeek V4 Pro 的若干核心项分数有明显上升:智能体编程从 47.37 提升到 63.16,增长 15.85 分;智能体任务规划上升 6.48 分;幻觉控制从 79.70 提升到 89.73。同时推理效率也得到优化,推理耗时有所减少,不再只是堆分数。

当然,迭代中也有取舍,精确的指令遵循分数出现小幅下滑,表明开发团队优先强化了长链路智能体和深度推理能力。与 Qwen3.8 Max 横向比较时,DeepSeek V4 Pro 在幻觉和推理表现更好,但在指令遵循、智能体编程方面仍有追赶空间,智能体任务规划约落后 5 分。此次测试为纯文本场景,智能体任务规划会受到这一条件限制。 球友会

总体来看,这次更新的亮点是编程与智能体能力的增强,更适合需要写代码与处理复杂任务规划的开发者;但并非所有维度都全面提升,普通用户与开发者在选型时应结合自身需求判断。

发表评论

订阅我们的邮箱