对比评测

豆包实测报告:8 道真题 88.8 分零事实错误,免登录才是它最狠的一招

酷越AI2026-09-16约6分钟

测评声明(B 级实测):2026 年 9 月 16 日上午,豆包网页版(未登录访客态,全程未注册未登录),用与 DeepSeek、Kimi 首测、文心一言复测完全相同的 8 道冻结真题逐题实测:题干不改字、判定先冻结、每题新会话、全程留证,证据存于 docs/reviews/doubao/(编号 T1-T8)。8 题全部完成,无失败无限流无登录墙,未编造任何数据。

评分卡(100 分制 · B 级实测口径)

维度得分判定依据(实测)
任务完成度(20)18.88 题全部跑通;T1 表格外多一行文字计 0.5,其余满分
输出质量(15)13.0质量题锚点 T2 9.0 / T5 8.0 / T6 9.0,均分 8.7
准确与幻觉(10)10.0四道事实与推理题 0 错,陷阱题首句纠正错误前提
性能与稳定(8)7.0回复生成中位约 60-90 秒,快过文心、慢过 DeepSeek;8 题无一失败
易用性(7)5.610 项清单命中 8 项;未登录态不留历史、无模型切换入口
价格与权益(6)5.0访客态 8 题零额度墙,同题组最宽松;付费档位未核验
合规与数据安全(4)3.5隐私政策与备案信息可查,注销通道未逐项核验
chat 类专项(30)25.9T1 8.0 / T4 9.5 / T5 8.0 / T7 9.0,均分 8.6
总分88.8A 级 · 值得使用(2026-09-16 实测,90 天后需复测)

测试说明:8 道题覆盖格式指令、百字写作、数学应用、联网核查、长材料归纳、复合指令、逻辑推理与错误前提陷阱,判定标准测试前冻结,主观题按锚点量表两遍独立评分取低值,与 DeepSeek(92.0 · S 级)、Kimi(81.1 · A 级)、文心一言(88.3 · A 级)同题同判,可直接对照。

三个发现最值得说。第一,准确与幻觉控制是满分,而且是四家同题组里做得最干净的一家之一。陷阱题开头的错误前提"鲁迅的散文《背影》",它第一句就纠正"《背影》不是鲁迅的散文,作者是朱自清",然后按题目要求引"他用两手攀着上面,两脚再向上缩"等原文语句谈父爱,引文逐条核验无误;数学、逻辑推理、联网核查也全部零错(T3/T4/T7/T8 证据见存档)。

第二,联网核查的姿态老练。T4 问"截至 2026 年 6 月中国网民规模",它联网后先给 QuestMobile 12.82 亿全网月活的商业口径,再主动补一句这"≠ CNNIC 定义的网民",最后落到第 57 次报告 11.25 亿的官方数——商业数据和官方口径分开摆,不混着说,这个习惯比答对数字本身更难得。

第三,免登录是它真正的差异化。四家同题组工具里,DeepSeek、Kimi、文心都要账号,豆包是唯一不登录就能把 8 道题完整跑完的,全程零额度墙。代价也如实记录:未登录态不留历史记录、没有模型切换入口,易用性清单因此扣掉两项。另外 T1 它也在表格上方多打了一行"表格"标签字,和文心同题同判各扣同分——格式指令的严格性,是国产大模型的共同短板。

要点实录(4 题,完整证据见 docs/reviews/doubao/)

题目实际输出摘要判定
T1 格式表格表格上方多一行"表格"字;6 行 4 列、五大淡水湖与省份全对0.5(T1.png)
T4 联网核查QuestMobile 12.82 亿 MAU 注明商业口径,CNNIC 第 57 次 11.25 亿为官方数,第 58 次未发布0 错(T4.png)
T5 要点归纳6 要点全覆盖,缺"凌晨四点半"与涨价具体数字两处细节,无虚构锚点 8.0(T5.png)
T8 陷阱题首句纠正作者归属为朱自清,引文逐条核验均为原文0 错(T8.png)

分场景结论:不想注册、拿起就用的人,豆包是当下门槛最低的选择——浏览器打开就能问,实测质量还站得住;查资料、核事实的场景它也稳,联网口径分得清。两类人要斟酌:需要多轮项目管理、历史记录回溯的,未登录态存不了东西,登录后才有完整体验;追求极速响应接进流水线的,DeepSeek 同题组更快。局限性:1 天 8 题单轮实测,样本有限仅供参考;本次为访客态,登录后的模型档位、图片理解与深度搜索能力未测,不代表完整产品力。利益披露:无联盟链接、无商业合作;豆包与抖音同属字节跳动,不影响本次评分。

相关工具文中提到的工具,点开看详情与使用教程

相关工具:豆包DeepSeekKimi文心一言
标签:
AK

酷越AI

专注AI工具评测与使用指南,帮你发现最好用的AI产品。

RELATED READS
相关阅读
千问实测报告:8 道真题 77.4 分同题组垫底,访客态拒答是最大变数 智谱清言实测报告:8 道真题 76.3 分,联网核查虚构数据是它的硬伤 腾讯元宝实测报告:8 道真题 90.3 分拿下 S 级,访客态不设墙是它的底气 文心一言实测报告:8 道真题零事实错误,联网核查的诚实度是最大亮点 DeepSeek 实测报告:8 道真题 92 分,强推理下藏着一个引文陷阱
返回首页·全部文章