DeepSeek-V4-Pro-0813登顶中文智能体编程测评性价比榜首,成本仅为Kimi-K3的1/14
SmartHey8月14日消息,据快科技报道,CLUE团队正式发布SuperCLUE-Terminal中文智能体终端编程测评榜单。新版本模型DeepSeek-V4-Pro-0813以51.52分位列第二,仅次于Kimi-K3(60.61分),显著领先GLM-5.2(48.48分)和旧版DeepSeek-V4-Flash(46.46分),同时展现出极强的成本优势——单题调用仅需1.42元,约为Kimi-K3的十四分之一、GLM-5.2的十六分之一。

SuperCLUE-Terminal是专为中国开发者打造的实战型评测标准,全部题目源自本土真实编程场景,统一基于Claude Code运行框架,全面考察模型在中文需求理解、任务规划、工具调用及代码排错与迭代等端到端开发能力。
每道测评题目需完成50至110轮人机交互,单题完整执行耗时约半小时至一个半小时,高度还原实际开发中的复杂协作与调试流程。
在覆盖前端页面构建、3D游戏逻辑实现、工程脚本优化等多类真实任务中,DeepSeek-V4-Pro-0813表现稳健:实测可闭环实现完整游戏功能,包括物理碰撞响应、实时计分系统与终局结算;UI配色与用户交互反馈自然流畅,明显摆脱模板化AI风格;仅在少量创意绘图类任务中存在细微结构瑕疵,整体完成度稳居第一梯队。
对于中小企业与独立开发者而言,该模型实现了性能与成本的优质平衡——相比头部高分模型动辄高昂的算力开销,DeepSeek-V4-Pro-0813以更亲民的价格,提供了接近顶级水平的代码生成与工程落地能力。
