对比评测

腾讯元宝实测报告:8 道真题 90.3 分拿下 S 级,访客态不设墙是它的底气

酷越AI2026-09-21约8分钟

测评声明(B 级实测):2026 年 9 月 21 日上午,腾讯元宝网页版 yuanbao.tencent.com(未登录访客态,页面左下角显示"未登录";默认模型 Hy3,快速回答模式;模型面板另提供 Hy4 preview 与 DeepSeek 入口,均未在本轮测试范围),用与 DeepSeek、Kimi 首测、文心一言、豆包、千问、智谱清言完全相同的 8 道冻结真题逐题实测:题干不改字、判定先冻结、每题新开对话、全程留证,证据存于 docs/reviews/yuanbao/(编号 T1-T8)。8 题全部跑通,全程未登录、无额度墙、未编造任何数据。

评分卡(100 分制 · B 级实测口径)

维度得分判定依据(实测)
任务完成度(20)20.08 题全部完整通过,无拒答无失败
输出质量(15)13.3质量题锚点 T2 9.0 / T5 9.0 / T6 8.5,均分 8.83
准确与幻觉(10)7.0四道准确题合计 1 错(T4 一处无法核验的断言,详见下文)
性能与稳定(8)7.0单题耗时中位约 27 秒,快于同类基线中值;8 题零失败零限流
易用性(7)7.010 项清单全命中;访客态连模型切换都开放
价格与权益(6)5.5访客态 8 题零额度墙零付费墙;付费档位未核验
合规与数据安全(4)3.5隐私政策与备案资质可查;注销通道未逐项核验
chat 类专项(30)27.0T1 10.0 / T4 7.0 / T5 9.0 / T7 10.0,均分 9.0
总分90.3S 级 · 强烈推荐(2026-09-21 实测,90 天后需复测)

测试说明:8 道题覆盖格式指令、百字写作、数学应用、联网核查、长材料归纳、复合指令、逻辑推理与错误前提陷阱,判定标准测试前冻结,主观题按锚点量表两遍独立评分取低值,与 DeepSeek(92.0 · S 级)、Kimi(81.1 · A 级)、文心一言(88.3 · A 级)、豆包(88.8 · A 级)、千问(77.4 · B 级)、智谱清言(76.3 · B 级)同题同判,可直接对照。

先说这次实测里最像"第一印象"的部分:元宝是同题组七家里,第二个没在 T1 上栽跟头的。这道题要求"只输出一个 6 行 4 列的表格,不要表格以外的任何文字",五大淡水湖的湖名、省份、面积逐格核对无误,一个多余的字都没有——此前只有 DeepSeek 做到过满分,文心、豆包、千问、智谱清言都在"多说话"上扣了分。T3 数学题用消元法三行解出笔 5 元、笔记本 4 元,还主动回头验证了第二组条件;T7 逻辑推理把三个假设逐一推演、逐一排除,结论"乙说真话"且每步自洽,是同题组里少见的零跳步答卷。

写作与归纳的质量同样在线。T2 百字秋晨拿到 9.0:竹帚扫落叶的沙沙声配桂树甜香,末句"你闻到了吗?"干净利落地收住反问;T5 长材料归纳六点全覆盖、每条都压在 20 字以内,连"嫌外卖抽成高、自己做了储值小程序"这个最容易被合并丢失的细节都留住了。全程 8 题的响应节奏也稳,单题中位约 27 秒,没有一次卡壳或限流。

真正拉开它和"满分"距离的,是 T4 联网核查里的一处细节。题目问"截至 2026 年 6 月中国网民规模",元宝的表现两头都值得说:一方面,它没有编总数——明确写出第 56 次报告(2025 年 6 月,11.23 亿)和第 57 次报告(2025 年 12 月,11.25 亿)的完整历史链条,两处数字经我们独立核验全部准确,还专门辨析了 CNNIC 网民口径与 QuestMobile 月活口径的差异,最后干脆利落地声明"截至 2026 年 6 月的官方总规模需以第 58 次报告正文为准"。但另一方面,它在同一篇回答里断言"第 58 次报告已于 2026 年 8 月发布,公开摘要披露 60 岁及以上网民 1.68 亿"——我们用多组关键词独立检索,找不到这个报告编号和这个数字存在的任何公开证据。按判定标准计 1 处事实错误,准确维度落到 7 分档。好在它给这个断言加了显著限定语("需以正文为准"),没有像智谱清言那样用编造的数字直接回答问题,危害程度低了一档,但"提到一个查无实据的报告"这件事本身,仍然是联网场景里需要警惕的行为。

T8 陷阱题则交回了教科书级的答卷:题目故意把《背影》安到鲁迅头上,它首句纠正"《背影》不是鲁迅写的,而是朱自清 1925 年发表的散文",随后从六个角度引原文谈父爱,8 处引文逐条核验全部真实,零虚构。对比同题组,DeepSeek 在这道题上纠正了作者却虚构了引文,元宝是"纠正得干脆、引用也干净"的少数派。

要点实录(4 题,完整证据见 docs/reviews/yuanbao/)

题目实际输出摘要判定
T1 格式表格6 行 4 列全对,五大淡水湖与省份、面积无误,零多余文字1.0(T1.png)
T4 联网核查56/57 次报告链条准确、主动拒绝给出未确认总数;但断言无法核验的"第 58 次报告 + 1.68 亿"1 错(T4.png)
T7 悖论推理三假设逐一排除,结论"乙说真话",每步自洽无跳步0 错(T7.png)
T8 陷阱题首句纠正作者为朱自清,8 处引文逐条核验均为《背影》原文0 错(T8.png)

分场景结论:查资料、写东西、做归纳、解逻辑题,元宝都可以放进第一梯队放心用——完成度、格式遵循、推理严谨性实测全在线,访客态免登录、模型可切换,是七家里上手门槛最低的之一,日常问答尤其适合不想注册的人。唯一要留心的还是联网场景:它给的数据链条大概率可靠,但出现"新报告、新发布"这类时效性断言时,先搜一下再引用,本轮实测里它提过一个查无实据的第 58 次报告。局限性:1 天 8 题单轮实测,样本有限仅供参考;本次为未登录访客态 Hy3 模型,Hy4 preview、DeepSeek 模式与登录后的额度体系未测,不代表完整产品力;T4 判定基于 2026-09-21 的公开信息核验,若第 58 次报告后续确认发布,该题结论需以官方为准。利益披露:无联盟链接、无商业合作;腾讯与本站无任何商业关系,不影响本次评分。

相关工具文中提到的工具,点开看详情与使用教程

相关工具:腾讯元宝DeepSeek豆包Kimi
标签:
AK

酷越AI

专注AI工具评测与使用指南,帮你发现最好用的AI产品。

RELATED READS
相关阅读
千问实测报告:8 道真题 77.4 分同题组垫底,访客态拒答是最大变数 智谱清言实测报告:8 道真题 76.3 分,联网核查虚构数据是它的硬伤 豆包实测报告:8 道真题 88.8 分零事实错误,免登录才是它最狠的一招 虎扑步行街:直男论坛聊AI,胜在没人端着说 知乎的AI讨论区:观点交锋最充分的中文现场,懂行的人反对你也写在评论区
返回首页·全部文章