先把话说在前头:这份报告里的每一个分数,都对应着一段当天留下的对话记录和截图。2026 年 9 月 14 日下午,我们用一套事先冻结的 8 道真题,逐题投喂给 DeepSeek 网页版免费档——题干不改字、判定标准先存档、每题新开对话,全程浏览器自动化留证(题组与判定原文存于本站测评档案 docs/reviews/deepseek/,证据编号 T1-T8 随文引用)。级别:B 级实测(单轮 8 题),账号为免费档普通账号,就是你我现在打开网页能用到的那一档。
评分卡(100 分制 · B 级实测口径)
| 维度 | 得分 | 判定依据(实测) |
|---|---|---|
| 任务完成度(20) | 20.0 | 8 题全部完整通过 |
| 输出质量(15) | 13.8 | 三道质量题锚点均分 9.2(两遍独立评分取低值) |
| 准确与幻觉(10) | 7.0 | 陷阱题署名纠错正确;虚构一段《背影》"原文引文",计 1 错 |
| 性能与稳定(8) | 7.0 | 单题耗时中位数约 48 秒,8 题无一失败 |
| 易用性(7) | 6.3 | 10 项清单命中 9 项(模型切换开关未逐一验证) |
| 价格与权益(6) | 5.5 | 网页与 App 全免费,实测无额度墙 |
| 合规与数据安全(4) | 3.5 | 隐私政策与备案信息可查,注销通道未逐项核验 |
| chat 类专项(30) | 28.9 | T1/T4/T5/T7 四题锚点均分 9.6 |
| 总分 | 92.0 | S 级 · 强烈推荐(2026-09-14 实测,90 天后需复测) |
测试说明:8 道题分别是——格式指令(只输出 6 行 4 列表格)、百字写作约束、数学应用题、联网事实核查、约 500 字材料六要点归纳、150 字复合指令链、说谎者悖论推理、错误前提陷阱题("鲁迅的散文《背影》")。判定标准在测试开始前冻结:完成题看要素达成率,事实题数错误,写作与归纳题按 0-10 锚点量表两遍独立评分取低值。同期用同一套题组测了 Kimi(报告另发),同类可对照。
分数之外,有三个实测发现更值得说。
第一,格式与推理这两条底线,它守得极稳。T1 只让输出一张 6 行 4 列的表格,它一个多余的字都没给,五大淡水湖与省份全对(T1.png);T7 的三人说谎悖论,它把三个假设逐一排除、验证、再收拢,结论"乙说真话"正确,过程没有跳步,末尾还附了三行简洁版方便人复查(T7.png)。这种"步骤可验"的输出习惯,在免费工具里是少见的。
第二,联网核查的诚实度是这次实测最大的亮点。T4 我们故意问了一个官方数据尚未发布的时点:"截至 2026 年 6 月的中国网民规模"。它没有编数字,而是明说"尚无官方统一口径数据",转而给出 QuestMobile 12.82 亿的月活数据并注明口径差异,又补充 CNNIC 第 57 次报告 11.25 亿的最新官方数,连"网民"与"月活"的统计边界都讲清了。我们人工检索核对,它引的每个数字都对得上官方发布。
第三,坑也是真的。T8 陷阱题开头就问"鲁迅的散文《背影》",它第一句话就把作者纠正为朱自清,陷阱本身通过了;可题目要求"结合原文语句",它随后引出一段"东洋的桔子,不如 Home 的甜"这样的对话——《背影》全文里根本没有这段。虚构引文按规则计 1 错,准确性维度因此从满分落到 7 分。这给了一个很实在的提醒:让 DeepSeek 出观点、出框架可以放心,但它嘴里的"原文",必须亲手核对。
要点实录(5 题,完整证据见 docs/reviews/deepseek/)
| 题目 | 实际输出摘要 | 判定 |
|---|---|---|
| T1 表格指令 | 6 行 4 列 Markdown 表格,零多余文字,湖名省份全对 | 完整通过(1.0) |
| T3 数学应用题 | 设元、消元,笔 5 元、本 4 元,自带验算 | 0 错(10 分档) |
| T4 联网核查 | 声明官方数据未发布,区分 MAU 与网民口径,CNNIC 数字与人工核查一致 | 0 错(10 分档) |
| T5 长材料归纳 | 6 个预埋要点全覆盖,每点不超 20 字,无虚构 | 锚点 9.5 |
| T8 陷阱题 | 首句纠正作者署名,但虚构一段原文不存在的对话 | 陷阱通过,引文计 1 错 |
落到"该不该用、怎么用"上,我们的结论很具体。学生和需要算账、捋逻辑的人,可以把默认对话当主力:解方程、写提纲、理材料,它是免费工具里最省心的那一档。做研究、写论文的人要留一个心眼:观点可以参考,引文必须核对,T8 那段编出来的《背影》就是现成的例子。做内容的人拿它起稿很顺,但发布前自己过一遍事实点,这个动作省不掉。做本地号的小周让 DeepSeek 写一篇"县中高考成绩三十年"的回顾稿,框架和过渡写得漂亮,可文中引用的年份升学率,它顺手就"补"了两个——稿子能用,数据得他自己回教育局官网一条条核。它是把好刀,但刀口朝哪,你得自己看着。
局限性也得交代:本报告基于 1 天、8 题、1 轮的实测,样本有限;深度思考模式与 API 通道未单独测试;部分耗时受自动化轮询影响略有放大;分数时效 90 天,到期需复测。利益披露:本篇无联盟链接、无商业合作,DeepSeek 不涉及返佣。
一个工具拿下 92 分不稀奇,稀奇的是它赢的方式——不是什么都强,而是该稳的地方一步不差,该认的地方一句不编。至于那段凭空长出来的"原文",就当是 92 分背后留给我们所有人的提醒。