DeepSeek V4 Pro评测出炉:第一梯队水平 编程能力强
SuperCLUE发布DeepSeek V4 Pro正式版中文测评,该模型8月13日发布,其智能体编程进步显著。其原生支持百万级长文本解析,官方称推理、编程、智能体任务达行业第一梯队。
本次测评对比13个国产模型,设六大考核项,智能体编程权重占25%。相比预览版,DeepSeek V4 Pro核心分数提升明显:智能体编程从47.37分升至63.16分,涨15.85分;智能体任务规划涨6.48分;幻觉控制从79.70分升至89.73分;推理耗时也得到优化。但精确指令遵循小幅下滑,显示团队优先强化长链路智能体与深度推理能力。
横向对比Qwen3.8 Max,其幻觉推理更优,但指令遵循、智能体编程仍有差距,智能体任务规划差约5分。测试均为纯文本场景,限制了智能体任务规划表现。
总体而言,此次更新亮点在编程与智能体能力,适合开发者处理代码及复杂任务规划。但并非全维度增强,部分能力仍需优化,用户选型应结合实际需求判断。