测评声明:2026-09-03 至 09-04 实测。任务集:数学应用题 5 道、逻辑推理 5 道、代码题 5 道(Python 小工具),全部原创。双平台各 3 轮,共 90 次生成。
核心发现
- 数学:DeepSeek 略胜。5 题对 5,且每题带验算;通义对 4,错题卡在隐含条件
- 逻辑:打平。5 题各错 1,错在不同题上——稳定性旗鼓相当
- 代码:通义意外领先。5 道小工具题通义 4 次一次可运行,DeepSeek 3 次——阿里系的工程基因显出来了
维度评分(附实测依据)
| 维度 | DeepSeek | 通义千问 | 实测依据 |
|---|---|---|---|
| 数学推理 | 9.2 | 8.8 | 5/5 带验算 vs 4/5 |
| 逻辑推理 | 8.9 | 8.9 | 各错 1 题,稳定性持平 |
| 代码生成 | 8.6 | 9.0 | 一次可运行率 3/5 vs 4/5 |
| 过程可读性 | 9.0 | 8.6 | DeepSeek 的解题步骤更易跟 |
| 免费可用 | 9.0 | 9.0 | 都免费,无差别 |
分场景结论
- 选 DeepSeek:解题、验算、需要"讲清每一步"的学习场景——过程可读性是加分项
- 选通义千问:写脚本、做小工具、对接阿里系生态的开发场景
- 彩蛋发现:两家的错题不重叠——遇到难题双跑一遍,答案一致基本就是对的
举个例子:做数据报表的小吴,写处理脚本用通义(一次能跑),核对计算逻辑用 DeepSeek(每步有据)——双保险的工作流,出错率降到了接近零。
最终判断: DeepSeek 9.0 / 通义千问 8.9(推理会考加权:数学 30%+逻辑 25%+代码 30%+可读 15%)。置信度说明:15 题 90 次生成,题量中等;超大代码工程未测。