测评声明(B 级实测):2026 年 9 月 16 日上午,豆包网页版(未登录访客态,全程未注册未登录),用与 DeepSeek、Kimi 首测、文心一言复测完全相同的 8 道冻结真题逐题实测:题干不改字、判定先冻结、每题新会话、全程留证,证据存于 docs/reviews/doubao/(编号 T1-T8)。8 题全部完成,无失败无限流无登录墙,未编造任何数据。
评分卡(100 分制 · B 级实测口径)
| 维度 | 得分 | 判定依据(实测) |
|---|---|---|
| 任务完成度(20) | 18.8 | 8 题全部跑通;T1 表格外多一行文字计 0.5,其余满分 |
| 输出质量(15) | 13.0 | 质量题锚点 T2 9.0 / T5 8.0 / T6 9.0,均分 8.7 |
| 准确与幻觉(10) | 10.0 | 四道事实与推理题 0 错,陷阱题首句纠正错误前提 |
| 性能与稳定(8) | 7.0 | 回复生成中位约 60-90 秒,快过文心、慢过 DeepSeek;8 题无一失败 |
| 易用性(7) | 5.6 | 10 项清单命中 8 项;未登录态不留历史、无模型切换入口 |
| 价格与权益(6) | 5.0 | 访客态 8 题零额度墙,同题组最宽松;付费档位未核验 |
| 合规与数据安全(4) | 3.5 | 隐私政策与备案信息可查,注销通道未逐项核验 |
| chat 类专项(30) | 25.9 | T1 8.0 / T4 9.5 / T5 8.0 / T7 9.0,均分 8.6 |
| 总分 | 88.8 | A 级 · 值得使用(2026-09-16 实测,90 天后需复测) |
测试说明:8 道题覆盖格式指令、百字写作、数学应用、联网核查、长材料归纳、复合指令、逻辑推理与错误前提陷阱,判定标准测试前冻结,主观题按锚点量表两遍独立评分取低值,与 DeepSeek(92.0 · S 级)、Kimi(81.1 · A 级)、文心一言(88.3 · A 级)同题同判,可直接对照。
三个发现最值得说。第一,准确与幻觉控制是满分,而且是四家同题组里做得最干净的一家之一。陷阱题开头的错误前提"鲁迅的散文《背影》",它第一句就纠正"《背影》不是鲁迅的散文,作者是朱自清",然后按题目要求引"他用两手攀着上面,两脚再向上缩"等原文语句谈父爱,引文逐条核验无误;数学、逻辑推理、联网核查也全部零错(T3/T4/T7/T8 证据见存档)。
第二,联网核查的姿态老练。T4 问"截至 2026 年 6 月中国网民规模",它联网后先给 QuestMobile 12.82 亿全网月活的商业口径,再主动补一句这"≠ CNNIC 定义的网民",最后落到第 57 次报告 11.25 亿的官方数——商业数据和官方口径分开摆,不混着说,这个习惯比答对数字本身更难得。
第三,免登录是它真正的差异化。四家同题组工具里,DeepSeek、Kimi、文心都要账号,豆包是唯一不登录就能把 8 道题完整跑完的,全程零额度墙。代价也如实记录:未登录态不留历史记录、没有模型切换入口,易用性清单因此扣掉两项。另外 T1 它也在表格上方多打了一行"表格"标签字,和文心同题同判各扣同分——格式指令的严格性,是国产大模型的共同短板。
要点实录(4 题,完整证据见 docs/reviews/doubao/)
| 题目 | 实际输出摘要 | 判定 |
|---|---|---|
| T1 格式表格 | 表格上方多一行"表格"字;6 行 4 列、五大淡水湖与省份全对 | 0.5(T1.png) |
| T4 联网核查 | QuestMobile 12.82 亿 MAU 注明商业口径,CNNIC 第 57 次 11.25 亿为官方数,第 58 次未发布 | 0 错(T4.png) |
| T5 要点归纳 | 6 要点全覆盖,缺"凌晨四点半"与涨价具体数字两处细节,无虚构 | 锚点 8.0(T5.png) |
| T8 陷阱题 | 首句纠正作者归属为朱自清,引文逐条核验均为原文 | 0 错(T8.png) |
分场景结论:不想注册、拿起就用的人,豆包是当下门槛最低的选择——浏览器打开就能问,实测质量还站得住;查资料、核事实的场景它也稳,联网口径分得清。两类人要斟酌:需要多轮项目管理、历史记录回溯的,未登录态存不了东西,登录后才有完整体验;追求极速响应接进流水线的,DeepSeek 同题组更快。局限性:1 天 8 题单轮实测,样本有限仅供参考;本次为访客态,登录后的模型档位、图片理解与深度搜索能力未测,不代表完整产品力。利益披露:无联盟链接、无商业合作;豆包与抖音同属字节跳动,不影响本次评分。