对比评测

DeepSeek 实测报告:8 道真题 92 分,强推理下藏着一个引文陷阱

酷越AI编辑部2026-09-14约7分钟

先把话说在前头:这份报告里的每一个分数,都对应着一段当天留下的对话记录和截图。2026 年 9 月 14 日下午,我们用一套事先冻结的 8 道真题,逐题投喂给 DeepSeek 网页版免费档——题干不改字、判定标准先存档、每题新开对话,全程浏览器自动化留证(题组与判定原文存于本站测评档案 docs/reviews/deepseek/,证据编号 T1-T8 随文引用)。级别:B 级实测(单轮 8 题),账号为免费档普通账号,就是你我现在打开网页能用到的那一档。

评分卡(100 分制 · B 级实测口径)

维度得分判定依据(实测)
任务完成度(20)20.08 题全部完整通过
输出质量(15)13.8三道质量题锚点均分 9.2(两遍独立评分取低值)
准确与幻觉(10)7.0陷阱题署名纠错正确;虚构一段《背影》"原文引文",计 1 错
性能与稳定(8)7.0单题耗时中位数约 48 秒,8 题无一失败
易用性(7)6.310 项清单命中 9 项(模型切换开关未逐一验证)
价格与权益(6)5.5网页与 App 全免费,实测无额度墙
合规与数据安全(4)3.5隐私政策与备案信息可查,注销通道未逐项核验
chat 类专项(30)28.9T1/T4/T5/T7 四题锚点均分 9.6
总分92.0S 级 · 强烈推荐(2026-09-14 实测,90 天后需复测)

测试说明:8 道题分别是——格式指令(只输出 6 行 4 列表格)、百字写作约束、数学应用题、联网事实核查、约 500 字材料六要点归纳、150 字复合指令链、说谎者悖论推理、错误前提陷阱题("鲁迅的散文《背影》")。判定标准在测试开始前冻结:完成题看要素达成率,事实题数错误,写作与归纳题按 0-10 锚点量表两遍独立评分取低值。同期用同一套题组测了 Kimi(报告另发),同类可对照。

分数之外,有三个实测发现更值得说。

第一,格式与推理这两条底线,它守得极稳。T1 只让输出一张 6 行 4 列的表格,它一个多余的字都没给,五大淡水湖与省份全对(T1.png);T7 的三人说谎悖论,它把三个假设逐一排除、验证、再收拢,结论"乙说真话"正确,过程没有跳步,末尾还附了三行简洁版方便人复查(T7.png)。这种"步骤可验"的输出习惯,在免费工具里是少见的。

第二,联网核查的诚实度是这次实测最大的亮点。T4 我们故意问了一个官方数据尚未发布的时点:"截至 2026 年 6 月的中国网民规模"。它没有编数字,而是明说"尚无官方统一口径数据",转而给出 QuestMobile 12.82 亿的月活数据并注明口径差异,又补充 CNNIC 第 57 次报告 11.25 亿的最新官方数,连"网民"与"月活"的统计边界都讲清了。我们人工检索核对,它引的每个数字都对得上官方发布。

第三,坑也是真的。T8 陷阱题开头就问"鲁迅的散文《背影》",它第一句话就把作者纠正为朱自清,陷阱本身通过了;可题目要求"结合原文语句",它随后引出一段"东洋的桔子,不如 Home 的甜"这样的对话——《背影》全文里根本没有这段。虚构引文按规则计 1 错,准确性维度因此从满分落到 7 分。这给了一个很实在的提醒:让 DeepSeek 出观点、出框架可以放心,但它嘴里的"原文",必须亲手核对。

要点实录(5 题,完整证据见 docs/reviews/deepseek/)

题目实际输出摘要判定
T1 表格指令6 行 4 列 Markdown 表格,零多余文字,湖名省份全对完整通过(1.0)
T3 数学应用题设元、消元,笔 5 元、本 4 元,自带验算0 错(10 分档)
T4 联网核查声明官方数据未发布,区分 MAU 与网民口径,CNNIC 数字与人工核查一致0 错(10 分档)
T5 长材料归纳6 个预埋要点全覆盖,每点不超 20 字,无虚构锚点 9.5
T8 陷阱题首句纠正作者署名,但虚构一段原文不存在的对话陷阱通过,引文计 1 错

落到"该不该用、怎么用"上,我们的结论很具体。学生和需要算账、捋逻辑的人,可以把默认对话当主力:解方程、写提纲、理材料,它是免费工具里最省心的那一档。做研究、写论文的人要留一个心眼:观点可以参考,引文必须核对,T8 那段编出来的《背影》就是现成的例子。做内容的人拿它起稿很顺,但发布前自己过一遍事实点,这个动作省不掉。做本地号的小周让 DeepSeek 写一篇"县中高考成绩三十年"的回顾稿,框架和过渡写得漂亮,可文中引用的年份升学率,它顺手就"补"了两个——稿子能用,数据得他自己回教育局官网一条条核。它是把好刀,但刀口朝哪,你得自己看着。

局限性也得交代:本报告基于 1 天、8 题、1 轮的实测,样本有限;深度思考模式与 API 通道未单独测试;部分耗时受自动化轮询影响略有放大;分数时效 90 天,到期需复测。利益披露:本篇无联盟链接、无商业合作,DeepSeek 不涉及返佣。

一个工具拿下 92 分不稀奇,稀奇的是它赢的方式——不是什么都强,而是该稳的地方一步不差,该认的地方一句不编。至于那段凭空长出来的"原文",就当是 92 分背后留给我们所有人的提醒。

相关工具文中提到的工具,点开看详情与使用教程

相关工具:DeepSeekKimi豆包
标签:
AK

酷越AI

专注AI工具评测与使用指南,帮你发现最好用的AI产品。

RELATED READS
相关阅读
Kimi 实测报告:答完的 4 题近乎满分,限流拦下了另外 4 题 文心一言实测报告:8 道真题零事实错误,联网核查的诚实度是最大亮点 豆包 vs Kimi 长文档核对实测:五十页标书找风险,谁靠得住 豆包实测报告:8 道真题 88.8 分零事实错误,免登录才是它最狠的一招 九月大模型榜单生变:Meta新模型三天登顶,Kimi K3与GLM-5.3把国产名次顶进前十
返回首页·全部文章