快科技8月14日消息,CLUE团队发布SuperCLUE-Terminal中文智能体终端编程测评榜单,新版本DeepSeek-V4-Pro-0813拿到51.52分。
这一成绩在所有参测模型里排名第二,仅落后Kimi-K3,同时拥有极低的调用成本,性价比优势十分突出。
SuperCLUE-Terminal是专门面向国内开发者的实战评测标准,全部采用本土真实编程任务,统一以Claude Code作为运行框架,公平对比各大模型理解中文需求、规划任务、调用工具、排错改代码的完整能力。
每道考题需要模型完成50至110轮交互,单题完整运行半小时到一个半小时,能真实还原日常开发里的复杂工作流程。
本次榜单里Kimi-K3以60.61分排在第一,DeepSeek-V4-Pro-0813紧随其后,分数高出GLM-5.2的48.48分、老版DeepSeek-V4-Flash的46.46分。
最亮眼的是它的成本控制,单题调用仅1.42元,大概是Kimi-K3的十四分之一、GLM-5.2的十六分之一。
测评场景覆盖前端页面、3D游戏、工程脚本修改等真实需求。实测中它能完整闭环游戏开发逻辑,碰撞、计分、结算功能全部正常,页面配色、交互反馈也摆脱模板化AI风格;只是少数创意绘图类题目会出现结构小瑕疵,整体完成度依旧处于第一梯队。
对中小企业、独立开发者来说,这款模型平衡了性能和开销。头部高分模型算力成本很高,小规模团队长期使用压力大,DeepSeek-V4-Pro-0813用更低价格接近顶级代码能力。



