测评声明(B 级实测):2026 年 9 月 17 日上午,千问网页版 qianwen.com(原通义千问,页面显示模型 Qwen3.7-千问,未登录访客态,全程未注册未登录),用与 DeepSeek、Kimi 首测、文心一言、豆包复测完全相同的 8 道冻结真题逐题实测:题干不改字、判定先冻结、每题新会话、全程留证,证据存于 docs/reviews/tongyi/(编号 T1-T8)。8 题中 7 题正常完成、1 题拒答(T1),无限流无登录墙,未编造任何数据。
评分卡(100 分制 · B 级实测口径)
| 维度 | 得分 | 判定依据(实测) |
|---|---|---|
| 任务完成度(20) | 17.5 | T1 拒答计 0,其余 7 题全部跑通 |
| 输出质量(15) | 13.2 | 质量题锚点 T2 9.0 / T5 8.5 / T6 9.0,均分 8.8 |
| 准确与幻觉(10) | 7.0 | T7 输出残留错误结论句计 1 错;T3/T4/T8 零错 |
| 性能与稳定(8) | 6.0 | 回复生成中位约 2 分钟,慢于同题组四家;无一限流 |
| 易用性(7) | 6.3 | 10 项清单命中 9 项;访客态连快速/思考研究模式切换都开放 |
| 价格与权益(6) | 5.5 | 访客态 8 题零额度墙,深度研究模式也未限;付费档位未核验 |
| 合规与数据安全(4) | 3.5 | 隐私政策与备案信息可查,注销通道未逐项核验 |
| chat 类专项(30) | 18.4 | T1 0 / T4 9.5 / T5 8.5 / T7 6.5,均分 6.1 |
| 总分 | 77.4 | B 级 · 尚可一用(2026-09-17 实测,90 天后需复测) |
测试说明:8 道题覆盖格式指令、百字写作、数学应用、联网核查、长材料归纳、复合指令、逻辑推理与错误前提陷阱,判定标准测试前冻结,主观题按锚点量表两遍独立评分取低值,与 DeepSeek(92.0 · S 级)、Kimi(81.1 · A 级)、文心一言(88.3 · A 级)、豆包(88.8 · A 级)同题同判,可直接对照。
先说这次实测里最亮的部分。联网核查的诚实度和陷阱题的表现,是同题组五家里的最佳档。T4 问"截至 2026 年 6 月中国网民规模",它在"思考研究"模式下检索了 25 篇资料,然后明确声明"尚未检索到第 58 次报告的具体数据",再把能确认的第 57 次 11.25 亿(截至 2025 年 12 月)和历史数据链条摆出来,统计口径逐条说明——不编造拿不准的数字,这个习惯和豆包并列同题组最诚实。T8 陷阱题更干净:题目故意把《背影》安到鲁迅头上,它第一句就纠正"《背影》的作者是朱自清,而非鲁迅",然后照样把父爱讲透,攀爬月台那段"他用两手攀着上面,两脚再向上缩"等引文逐条核验都是原文,零虚构。
但分数垫底也垫得明明白白。最大的坑是访客态拒答:T1 只要求它输出一个纯表格、别的字都不要,它回了一句"抱歉,我无法回答这个问题。我们聊聊别的吧。"——探测环节问"请用一句话介绍你自己"也是同一句式。两次拒答都发生在毫无敏感内容的问题上,指向的是访客态下过紧的风控或指令理解策略,这是五家同题组里唯一出现拒答的。这一道拒答直接丢了完成度 2.5 分和专项锚点约 7 分,登录态是否复现、换了措辞会不会好,本次都没法验证,只能如实标注。
第二个坑更隐蔽。T7 逻辑推理,它开头第一句写着"说真话的是甲",接下来三段假设推理步步严密,最终答案却是"乙说真话"——推理全程正确,但那句错误的先导结论留在了正文里,像是推理模型自我修正时漏删的残句。只看开头的人会拿到错误答案,按规则计 1 错。写作与归纳倒是不用担心:T2 的百字秋晨(铜铃、桂香、反问收尾全中)和 T5 的六要点归纳都稳在水准线上。
要点实录(4 题,完整证据见 docs/reviews/tongyi/)
| 题目 | 实际输出摘要 | 判定 |
|---|---|---|
| T1 格式表格 | 拒答:"抱歉,我无法回答这个问题。我们聊聊别的吧。" | 0(T1.png) |
| T4 联网核查 | 声明第 58 次报告数据未检索到;给 CNNIC 第 57 次 11.25 亿与历史链条,口径说明完整 | 0 错(T4.png) |
| T7 悖论推理 | 三假设逐一排除、最终验证完整,结论"乙说真话";但开头残留"说真话的是甲"错误句 | 1 错(T7.png) |
| T8 陷阱题 | 首句纠正作者为朱自清,引文逐条核验均为原文,约 2000 字零虚构 | 0 错(T8.png) |
分场景结论:查资料、核事实、读长材料的人可以放心用——联网核查的诚实度和长文归纳能力实测都在水准线上,访客态连深度研究模式都开放,门槛极低;写文案、做归纳也顺手。两类人要斟酌:需要它严格执行"只输出 X、不要任何解释"这类硬格式的(比如接自动化流水线),访客态有直接拒答的风险,先登录再测;只看答案首句不核全文的,T7 那种自相矛盾开头会坑到你——用推理模型,结论要读到最后一行。局限性:1 天 8 题单轮实测,样本有限仅供参考;本次为未登录访客态,登录后的模型档位、拒答策略变化与文件上传能力未测,不代表完整产品力。利益披露:无联盟链接、无商业合作;千问与阿里巴巴的股权关系不影响本次评分。