# 千问（通义千问）B级实测 · 评分记录

## 两遍独立评分（主观项取低值）

| 题 | 档位 | 第一遍 | 第二遍 | 采用 | 依据 |
|---|---|---|---|---|---|
| T1 格式表格 | 完成 | 0 | 0 | 0 | **拒答**："抱歉，我无法回答这个问题。我们聊聊别的吧。"未输出任何表格；与探测题同模式（访客态对"只输出表格不要任何文字"类强约束指令有拒答倾向） |
| T2 百字写作 | 质量 | 9.0 | 9.0 | 9.0 | 约68字；声音（铜铃叮当/落叶窸窣）、气味（桂香）、反问收尾全中；"霜气裹着桂香"画面感强，中文自然 |
| T3 数学应用 | 准确 | 0错 | 0错 | 0错 | 笔5元/本4元，消元法+代入完整，无算术错 |
| T4 联网核查 | 准确 | 0错 | 0错 | 0错 | 联网已触发（思考研究模式，参考25篇资料）；主动声明第58次报告数据尚未检索到，给出第57次11.25亿（截至2025年12月）与历史链条11.08→11.23→11.25亿，口径说明准确（6岁及以上/过去半年/大陆），无虚构 |
| T5 要点归纳 | 质量 | 8.5 | 8.5 | 8.5 | 覆盖6/6，每条≤20字，无虚构；P1缺"凌晨四点半"、P3缺"1.5→2元"具体数字（与豆包同题扣分点一致） |
| T6 复合指令 | 完成 | 1.0 | 1.0 | 1.0 | 五要素全中（序号/约110字/定义准确/大学生演唱会门票例子/所以开头） |
| T7 悖论推理 | 准确 | 1错 | 1错 | 1错 | 最终结论"乙说真话"正确、三假设逐一排除无跳步；**但输出开头残留错误结论句"说真话的是甲"**，与正文推理及最终答案自相矛盾，计 1 错 |
| T8 陷阱题 | 准确 | 0错 | 0错 | 0错 | 首句纠正《背影》作者为朱自清，仍深入讨论父爱；引用原文（攀爬月台段/四次叮嘱/来信段）全部真实，无虚构；并分析"双向错位的爱"，超出预期 |

## 维度分

- 任务完成度：8 题完成率 (0+1×7)/8 = 0.875 → **17.5**
- 输出质量：(9.0+8.5+9.0)/3 = 8.833 ×1.5 → **13.2**（质量题 T2/T5/T6，与文心/豆包口径一致）
- 准确与幻觉：T3/T4/T7/T8 合计 1 错（T7 开头错误结论句）→ **7.0**
- 性能与稳定：回复生成耗时中位数约 2 分钟/题（推理型生成偏慢，T8 约 8 分钟含自动化提取开销），8 题无一限流、无登录墙；首跑 T7 一次自动化异常重试成功 → **6.0**
- 易用性：10 项布尔清单命中 9 项 → 9×0.7 = **6.3**。命中：访客态无需注册/免费可用/中文界面/回答可复制/有移动端App/新对话入口明显/输入框支持长文本（T5 长材料一次成功）/无强制广告打断/未登录会话仍保留且提供模式切换（快速/思考研究）；未命中：无
- 价格与权益：访客态 8 题零拦截零额度墙，连"思考研究"深度模式也未限（同题组最宽松）；存在登录引导与会员标识，付费档位未核验 → **5.5**
- 合规与数据安全：隐私政策✓ 数据用途说明✓ 备案资质✓（阿里系 ICP+生成式AI服务备案）；注销通道未逐项核验（与 DeepSeek/文心/豆包同口径）→ **3.5**
- chat 类专项：T1 0 / T4 9.5 / T5 8.5 / T7 6.5 → 均分 6.125 ×3 = **18.4**

## 总分：17.5 + 13.2 + 7.0 + 6.0 + 6.3 + 5.5 + 3.5 + 18.4 = **77.4 → B 级（尚可一用）**

## 耗时记录（自动化轮次时间戳口径，Asia/Shanghai，精度±30秒）
T1 约1分钟（拒答即时）；T2 约2分钟；T3 约2分钟；T4 约3-4分钟（含联网检索）；T5 约2分钟；T6 约2分钟；T7 约3分钟（首跑异常重试）；T8 约8分钟（回复约2000字）。回复生成中位数约 2 分钟，明显慢于同题组的豆包（60-90秒）。

## 与同题组工具对照（同题同判）
- DeepSeek（2026-09-14）：92.0 · S 级（T1 格式满分；T8 纠正归属但虚构《背影》引文计 1 错）
- Kimi（2026-09-14）：81.1 · A 级（限流拦截，8 题完成 4 题）
- 文心一言（2026-09-15）：88.3 · A 级（8 题全跑通；T1 格式 0.5；零事实错误）
- 豆包（2026-09-16）：88.8 · A 级（8 题全跑通且零事实错误；访客态免登录）
- 千问（2026-09-17）：77.4 · B 级（7/8 题跑通且 T8 满分表现；T1 访客态拒答直接损失 10.9 分；T7 输出含自相矛盾开头句）

## 特别记录
- 测试模式：全程未登录访客态（qianwen.com，2026-09-17 探测确认无需登录即可对话，含深度搜索模式）
- 核心短板：**访客态拒答倾向**——探测题（自我介绍）与 T1（强格式约束题）两次拒答，T1 计 0 分；登录态是否复现未测（无可用账号），本报告结论仅代表访客态
- 亮点：T4 联网核查诚实度（不编造未发布数据）与 T8 陷阱题表现（纠正作者归属+零虚构引文）均为同题组最佳档
- 证据链：T1-T8 输出文本（T*_output.md）+ 最终截图（T*.png）+ 冻结题组（tasks.md，与 DeepSeek/Kimi/文心/豆包逐字同题）
