﻿# DeepSeek B级实测 · 冻结题组

## 通用信息
- 级别：B 级标准实测（核心题组 8 题 · 1 轮）
- 冻结时间：2026-09-14 15:40（测试开始前冻结，测试中不得修改题干与判定标准）
- 同题同判：本题组同时用于 DeepSeek 与 Kimi（chat 类试点，题库未建，按《AI工具测评体系》5.3 示例题结构现场设计并冻结）
- 题目布局：基础题 4（T1-T4）· 压力题 3（T5-T7）· 陷阱题 1（T8）
- 环境：网页端，浏览器自动化逐题执行，每题新开对话（新会话原则）；账号档位见各工具章节
- 证据要求：每题留存完整输出文本（T*_output.md）+ 最终结果截图（T*.png）+ 耗时（发送→输出完毕，记录于各题证据文件头部）

## 评分口径摘要
- 完成档：完整通过=1.0 / 部分通过=0.5（>70% 要素达成且无致命错误）/ 失败=0 → 任务完成度分 = 平均完成率 × 20
- 质量档：锚点量表 0-10（10 无需修改 / 8 小修可用 / 6 需明显修改 / 4 半成品 / 2 仅参考 / 0 失败拒答严重幻觉），两遍独立评分取低值 → 输出质量分 = 质量题均分 × 1.5（质量题：T2/T5/T6）
- 准确档：按错误计数 0错=10 / 1错=7 / 2错=4 / ≥3错=0 → 准确与幻觉分（事实/推理/陷阱题错误合计：T3/T4/T7/T8）
- 性能与稳定：单题输出耗时中位数对照同类基线（主流 chat 产品 20-60 秒/题）换算，8 分制
- 类别专项（30 分，chat 类核心 4 题）：T1 / T4 / T5 / T7 按锚点量表评分，平均分 × 3
- 易用性 7 分：10 项布尔清单各 0.7 分（注册门槛、免费可用、中文界面、回答可复制导出、有移动端、历史记录、新对话入口明显、模型/模式切换、输入框支持长文本、无强制广告打断）
- 价格 6 分：免费额度实测可用性 + 付费档位与同类中位价对比
- 合规 4 分：隐私政策 / 数据用途说明 / 注销通道 / 备案或合规资质，4 项布尔各 1 分

## 冻结题组（题干原文，逐字执行）

### T1 格式指令遵循（基础 · 完成档）
题干：只输出一个 6 行 4 列的 Markdown 表格，主题为"中国五大淡水湖"，四列依次为：湖名、所在省份、面积约多少平方公里、一句话特点。不要输出表格以外的任何文字。
判定标准：(1) 输出仅含一个表格，无任何解释性文字；(2) 恰好 6 行（含表头）；(3) 恰好 4 列；(4) 五个湖名正确（鄱阳湖/洞庭湖/太湖/洪泽湖/巢湖任一合理集合，省份对应无误）。
计分：四项全中=1.0；违反格式但内容对=0.5；格式或内容严重不符=0。

### T2 中文短写作约束（基础 · 质量档）
题干：用不超过 100 字写一段描写"秋天的清晨"的文字，要求：必须出现一种声音和一种气味，且最后一句必须是反问句。
判定标准：(1) 全段 ≤100 字（容忍至 110 字）；(2) 含声音描写；(3) 含气味描写；(4) 末句为反问；(5) 中文自然、有画面感。
计分：锚点量表 0-10（要素 4 项每缺一项降 2 档内酌减，语言质量按量表定档）。

### T3 数学应用题（基础 · 准确档）
题干：小明买了 3 支笔和 2 本笔记本，花了 23 元；小红买了 5 支笔和 3 本笔记本，花了 37 元。请问一支笔多少元，一本笔记本多少元？
判定标准：唯一正确答案：笔 5 元、笔记本 4 元。核对最终答案与过程算术是否出错。
计分：答案全对且过程无算术错误=0 错（10 分档）；最终答案错=1 错；过程与答案均错=2 错。

### T4 联网信息核查（基础 · 准确档）
题干：请联网查询：截至 2026 年 6 月，中国网民规模是多少？请给出具体数字、数据来源（机构与报告名称）和统计口径说明。
判定标准：(1) 给出具体数字；(2) 注明来源机构与报告；(3) 数字与 CNNIC 公开报告一致（以评分时人工核查的权威口径为准）；(4) 如实说明口径（如 18 岁及以上/全网网民）。
计分：按事实错误计数（错 0/1/2/≥3 对应 10/7/4/0 分档）；未联网且凭旧知识作答的，在证据中标注"未触发联网"。

### T5 长材料要点归纳（压力 · 质量档）
题干：阅读下面的材料，列出 6 个关键要点，每个要点不超过 20 个字。

材料《王叔的早餐铺子》：
王叔的早餐铺开在县城二小门口，每天凌晨四点半就要起床备料，风雨无阻开了十一年。他主打现磨豆浆和手工包子，豆浆每天限卖两百碗，卖完就收摊，街坊都说他的豆浆有"小时候的味道"。2025 年年初，他把包子从一块五涨到了两块钱，本来担心客人跑光，结果销量不降反升——因为他同时搞了个扫码预点单，家长送孩子前在手机上先下单，到店直接取，早上再也不用排长队。涨价省下的功夫和预点单攒下的口碑，让小铺子反而更忙了。王叔每个月净收入能落下一万二左右，他把其中的四成雷打不动存起来，说是给儿子攒读大学的学费。儿子在省城读计算机，暑假回来劝他把铺子挂到外卖平台上，王叔嫌平台抽成太高，琢磨了半天还是没答应，只同意让儿子帮忙做了个会员储值的小程序，老顾客充两百送二十，回头客更多了。

判定标准：预埋 6 个关键点——P1 凌晨四点半备料（勤奋/开门位置）；P2 豆浆每天限卖两百碗；P3 2025 年包子从 1.5 元涨到 2 元；P4 扫码预点单让家长免排队；P5 每月净收入四成存起来（约一万二）；P6 嫌抽成高没上外卖/做了储值小程序。
计分：锚点量表 0-10，覆盖 ≥6 点且无虚构=8-10 档；覆盖 4-5 点=6 档左右；覆盖 <4 点或虚构=4 档以下；每点超 20 字酌减。

### T6 复合指令链（压力 · 完成档）
题干：分三步回答，总共不超过 150 字：1. 用一句话定义"机会成本"；2. 用一个大学生买演唱会门票的例子说明它；3. 用"所以"开头给出一句建议。三部分必须用序号 1、2、3 标注。
判定标准：(1) 三部分齐全且用序号标注；(2) 总字数 ≤150（容忍至 165）；(3) 定义准确（放弃的选项中价值最高者）；(4) 例子贴合大学生+演唱会场景；(5) 第 3 部分以"所以"开头。
计分：五项全中=1.0；缺 1 项或超字数=0.5；缺 2 项及以上=0。

### T7 逻辑推理链（压力 · 准确档）
题干：甲、乙、丙三人中只有一人说真话。甲说："乙在说谎。"乙说："丙在说谎。"丙说："甲和乙都在说谎。"请问谁说真话？请写出推理过程。
判定标准：唯一正确答案：乙说真话（甲、丙说谎）。核对：结论正确 + 推理链完整无跳步（需验证至少一种假设排除过程）。
计分：结论对+过程完整=0 错（10 分档）；结论对但过程跳步=1 错；结论错=1 错；结论错且过程自相矛盾=2 错。

### T8 陷阱题·错误前提（陷阱 · 准确档）
题干：鲁迅的散文《背影》表达了怎样的父爱？请结合原文具体语句谈谈。
判定标准：《背影》作者是朱自清而非鲁迅——(1) 明确纠正作品归属=满分；(2) 指出归属错误且仍简要讨论父爱主题=满分；(3) 未纠正、直接按"鲁迅的《背影》"作答=严重幻觉 0 分；(4) 模糊处理（如"《背影》常被认为是……"）=按 1 错计。
## DeepSeek 环境记录（测试后补全）
- 测试日期：2026-09-14
- 工具版本：待实测记录（网页端标注）
- 账号档位：免费档（13863496778 站主既有账号，见 docs/测试账号清单.md）
