测评声明(B 级实测):2026 年 9 月 15 日上午,文心一言网页版(免费档,浏览器既有登录态),用与 DeepSeek、Kimi 首测完全相同的 8 道冻结真题逐题实测:题干不改字、判定先冻结、每题新会话、全程留证,证据存于 docs/reviews/wenxin/(编号 T1-T8)。8 题全部完成,无失败无限流,未编造任何数据。
评分卡(100 分制 · B 级实测口径)
| 维度 | 得分 | 判定依据(实测) |
|---|---|---|
| 任务完成度(20) | 18.8 | 8 题全部跑通;T1 表格外多一行文字计 0.5,其余满分 |
| 输出质量(15) | 12.8 | 质量题锚点 T2 9.0 / T5 8.0 / T6 8.5,均分 8.5 |
| 准确与幻觉(10) | 10.0 | 四道事实与推理题 0 错(含陷阱题,引文逐条核验为原文) |
| 性能与稳定(8) | 6.0 | 单题耗时中位约 2 分钟,约为 DeepSeek 同题组的两倍余;8 题无一失败 |
| 易用性(7) | 6.3 | 10 项清单命中 9 项(模型/模式切换未逐一验证) |
| 价格与权益(6) | 5.0 | 免费档全程无额度墙;界面有会员与任务模式推广引导 |
| 合规与数据安全(4) | 3.5 | 隐私政策与备案信息可查,注销通道未逐项核验 |
| chat 类专项(30) | 25.9 | T1 8.0 / T4 9.5 / T5 8.0 / T7 9.0,均分 8.6 |
| 总分 | 88.3 | A 级 · 值得使用(2026-09-15 实测,90 天后需复测) |
测试说明:8 道题覆盖格式指令、百字写作、数学应用、联网核查、长材料归纳、复合指令、逻辑推理与错误前提陷阱题,判定标准测试前冻结,写作与归纳按锚点量表两遍独立评分取低值,与 DeepSeek(92.0 · S 级)、Kimi(81.1 · A 级)同题同判,可直接对照。
三个发现更值得说。第一,联网核查的诚实度是最大亮点:T4 故意问了官方数据尚未发布的"截至 2026 年 6 月网民规模",它没编数,先说明第 58 次 CNNIC 报告未发布(连招标时间线都给了),再给第 57 次 11.25 亿官方数与口径,还点名商业流传的 11.36 亿"不作为权威依据"——把"数据还没出"讲得比"数据是多少"还清楚(T4.png)。
第二,陷阱题接得干净。T8 开头的错误前提"鲁迅的散文《背影》",它首句就纠正作者为朱自清,随后引"事已如此,不必难过,好在天无绝人之路"等语句谈父爱,逐条核验均为原文,无一段虚构(T8_output_full.md);对照 DeepSeek 同题在虚构引文上翻车,它在"引用原文"这件事上反而更让人放心。
第三,扣分点实在:T1 明确要求"不要输出表格以外的任何文字",它在表格上方多打了一行"表格"标签字,格式题计 0.5;单题输出中位约 2 分钟,约为 DeepSeek 同题组(48 秒)的两倍余,准确和守规矩它做到了,快,它还没做到。
要点实录(4 题,完整证据见 docs/reviews/wenxin/)
| 题目 | 实际输出摘要 | 判定 |
|---|---|---|
| T1 格式表格 | 表格上方多一行"表格"字;6 行 4 列、五大淡水湖与省份全对 | 0.5(T1.png) |
| T4 联网核查 | 指出第 58 次报告未发布,给出第 57 次 11.25 亿官方数与口径,点名商业数据不可作权威依据 | 0 错(T4.png) |
| T5 要点归纳 | 6 要点覆盖 5.5 个,缺"凌晨四点半备料",无虚构 | 锚点 8.0(T5.png) |
| T8 陷阱题 | 首句纠正作者归属,引文逐条核验均为原文 | 0 错(T8.png) |
分场景结论:查资料、核事实、要信源的人可以放心用,本次实测它的联网诚实度是同题组三家工具里最好的;中文写作与归纳的日常场景也稳(T2 六十五字全要素命中)。要斟酌的两类人:赶时间求极速响应的,中位 2 分钟一题确实磨人;要把输出接进自动化流水线的,T1 的多余文字提醒你要留格式容错。局限性:1 天 8 题单轮实测,样本有限仅供参考;免费档既有登录态,未测会员差异。利益披露:无联盟链接、无商业合作;文心一言与百度搜索同属百度公司,不影响本次评分。