测评声明(B 级实测):2026 年 9 月 21 日上午,腾讯元宝网页版 yuanbao.tencent.com(未登录访客态,页面左下角显示"未登录";默认模型 Hy3,快速回答模式;模型面板另提供 Hy4 preview 与 DeepSeek 入口,均未在本轮测试范围),用与 DeepSeek、Kimi 首测、文心一言、豆包、千问、智谱清言完全相同的 8 道冻结真题逐题实测:题干不改字、判定先冻结、每题新开对话、全程留证,证据存于 docs/reviews/yuanbao/(编号 T1-T8)。8 题全部跑通,全程未登录、无额度墙、未编造任何数据。
评分卡(100 分制 · B 级实测口径)
| 维度 | 得分 | 判定依据(实测) |
|---|---|---|
| 任务完成度(20) | 20.0 | 8 题全部完整通过,无拒答无失败 |
| 输出质量(15) | 13.3 | 质量题锚点 T2 9.0 / T5 9.0 / T6 8.5,均分 8.83 |
| 准确与幻觉(10) | 7.0 | 四道准确题合计 1 错(T4 一处无法核验的断言,详见下文) |
| 性能与稳定(8) | 7.0 | 单题耗时中位约 27 秒,快于同类基线中值;8 题零失败零限流 |
| 易用性(7) | 7.0 | 10 项清单全命中;访客态连模型切换都开放 |
| 价格与权益(6) | 5.5 | 访客态 8 题零额度墙零付费墙;付费档位未核验 |
| 合规与数据安全(4) | 3.5 | 隐私政策与备案资质可查;注销通道未逐项核验 |
| chat 类专项(30) | 27.0 | T1 10.0 / T4 7.0 / T5 9.0 / T7 10.0,均分 9.0 |
| 总分 | 90.3 | S 级 · 强烈推荐(2026-09-21 实测,90 天后需复测) |
测试说明:8 道题覆盖格式指令、百字写作、数学应用、联网核查、长材料归纳、复合指令、逻辑推理与错误前提陷阱,判定标准测试前冻结,主观题按锚点量表两遍独立评分取低值,与 DeepSeek(92.0 · S 级)、Kimi(81.1 · A 级)、文心一言(88.3 · A 级)、豆包(88.8 · A 级)、千问(77.4 · B 级)、智谱清言(76.3 · B 级)同题同判,可直接对照。
先说这次实测里最像"第一印象"的部分:元宝是同题组七家里,第二个没在 T1 上栽跟头的。这道题要求"只输出一个 6 行 4 列的表格,不要表格以外的任何文字",五大淡水湖的湖名、省份、面积逐格核对无误,一个多余的字都没有——此前只有 DeepSeek 做到过满分,文心、豆包、千问、智谱清言都在"多说话"上扣了分。T3 数学题用消元法三行解出笔 5 元、笔记本 4 元,还主动回头验证了第二组条件;T7 逻辑推理把三个假设逐一推演、逐一排除,结论"乙说真话"且每步自洽,是同题组里少见的零跳步答卷。
写作与归纳的质量同样在线。T2 百字秋晨拿到 9.0:竹帚扫落叶的沙沙声配桂树甜香,末句"你闻到了吗?"干净利落地收住反问;T5 长材料归纳六点全覆盖、每条都压在 20 字以内,连"嫌外卖抽成高、自己做了储值小程序"这个最容易被合并丢失的细节都留住了。全程 8 题的响应节奏也稳,单题中位约 27 秒,没有一次卡壳或限流。
真正拉开它和"满分"距离的,是 T4 联网核查里的一处细节。题目问"截至 2026 年 6 月中国网民规模",元宝的表现两头都值得说:一方面,它没有编总数——明确写出第 56 次报告(2025 年 6 月,11.23 亿)和第 57 次报告(2025 年 12 月,11.25 亿)的完整历史链条,两处数字经我们独立核验全部准确,还专门辨析了 CNNIC 网民口径与 QuestMobile 月活口径的差异,最后干脆利落地声明"截至 2026 年 6 月的官方总规模需以第 58 次报告正文为准"。但另一方面,它在同一篇回答里断言"第 58 次报告已于 2026 年 8 月发布,公开摘要披露 60 岁及以上网民 1.68 亿"——我们用多组关键词独立检索,找不到这个报告编号和这个数字存在的任何公开证据。按判定标准计 1 处事实错误,准确维度落到 7 分档。好在它给这个断言加了显著限定语("需以正文为准"),没有像智谱清言那样用编造的数字直接回答问题,危害程度低了一档,但"提到一个查无实据的报告"这件事本身,仍然是联网场景里需要警惕的行为。
T8 陷阱题则交回了教科书级的答卷:题目故意把《背影》安到鲁迅头上,它首句纠正"《背影》不是鲁迅写的,而是朱自清 1925 年发表的散文",随后从六个角度引原文谈父爱,8 处引文逐条核验全部真实,零虚构。对比同题组,DeepSeek 在这道题上纠正了作者却虚构了引文,元宝是"纠正得干脆、引用也干净"的少数派。
要点实录(4 题,完整证据见 docs/reviews/yuanbao/)
| 题目 | 实际输出摘要 | 判定 |
|---|---|---|
| T1 格式表格 | 6 行 4 列全对,五大淡水湖与省份、面积无误,零多余文字 | 1.0(T1.png) |
| T4 联网核查 | 56/57 次报告链条准确、主动拒绝给出未确认总数;但断言无法核验的"第 58 次报告 + 1.68 亿" | 1 错(T4.png) |
| T7 悖论推理 | 三假设逐一排除,结论"乙说真话",每步自洽无跳步 | 0 错(T7.png) |
| T8 陷阱题 | 首句纠正作者为朱自清,8 处引文逐条核验均为《背影》原文 | 0 错(T8.png) |
分场景结论:查资料、写东西、做归纳、解逻辑题,元宝都可以放进第一梯队放心用——完成度、格式遵循、推理严谨性实测全在线,访客态免登录、模型可切换,是七家里上手门槛最低的之一,日常问答尤其适合不想注册的人。唯一要留心的还是联网场景:它给的数据链条大概率可靠,但出现"新报告、新发布"这类时效性断言时,先搜一下再引用,本轮实测里它提过一个查无实据的第 58 次报告。局限性:1 天 8 题单轮实测,样本有限仅供参考;本次为未登录访客态 Hy3 模型,Hy4 preview、DeepSeek 模式与登录后的额度体系未测,不代表完整产品力;T4 判定基于 2026-09-21 的公开信息核验,若第 58 次报告后续确认发布,该题结论需以官方为准。利益披露:无联盟链接、无商业合作;腾讯与本站无任何商业关系,不影响本次评分。