对比评测

智谱清言实测报告:8 道真题 76.3 分,联网核查虚构数据是它的硬伤

酷越AI2026-09-17约7分钟

测评声明(B 级实测):2026 年 9 月 17 日上午,智谱清言网页版 chatglm.cn(页面显示模型 GLM-Flash 极致,思考强度三档可选,页脚标识 2026 ChatGLM5;未登录访客态,系统自动分配临时访客身份,全程未注册未登录),用与 DeepSeek、Kimi 首测、文心一言、豆包、千问复测完全相同的 8 道冻结真题逐题实测:题干不改字、判定先冻结、每题新会话、全程留证,证据存于 docs/reviews/zhipu/(编号 T1-T8)。8 题全部跑通,无限流无登录墙,未编造任何数据。

评分卡(100 分制 · B 级实测口径)

维度得分判定依据(实测)
任务完成度(20)20.08 题全部跑通,无拒答无失败
输出质量(15)12.5质量题锚点 T2 9.0 / T5 8.0 / T6 8.5,均分 8.3
准确与幻觉(10)0.0T4 联网核查虚构报告数据,错误计数 3(详见下文)
性能与稳定(8)6.0回复生成中位约 2-3 分钟(极致思考模式),慢于豆包快于文心;无一限流
易用性(7)7.010 项清单全命中;访客态连三档思考强度切换都开放
价格与权益(6)5.5访客态 8 题零额度墙;付费档位未核验
合规与数据安全(4)3.5隐私政策与备案信息可查,注销通道未逐项核验
chat 类专项(30)21.8T1 10.0 / T4 2.0 / T5 8.0 / T7 9.0,均分 7.3
总分76.3B 级 · 尚可一用(2026-09-17 实测,90 天后需复测)

测试说明:8 道题覆盖格式指令、百字写作、数学应用、联网核查、长材料归纳、复合指令、逻辑推理与错误前提陷阱,判定标准测试前冻结,主观题按锚点量表两遍独立评分取低值,与 DeepSeek(92.0 · S 级)、Kimi(81.1 · A 级)、文心一言(88.3 · A 级)、豆包(88.8 · A 级)、千问(77.4 · B 级)同题同判,可直接对照。

先说好的部分,因为它确实有惊艳之处。格式指令是六家同题组里唯二满分的:T1 要求"只输出一个 6 行 4 列的表格,不要表格以外的任何文字",五大淡水湖的湖名、省份、面积逐格核对无误,一个多余的字都没有——DeepSeek 做到过,文心、豆包、千问都栽了。T8 陷阱题同样干净:题目故意把《背影》安到鲁迅头上,它首句纠正作者为朱自清,随后从四个角度谈父爱,7 处引文逐条核验全是原文,零虚构;T7 逻辑推理用三步假设反证,每一步都验证自洽,结论正确。写作题还有个小彩蛋:T2 的思考过程显示它自己写了三稿、发现第三稿漏了"气味"要素后主动重写——这种自我校验的意识,在六家里是头一份。

然后是这次实测里最扎眼的问题。T4 联网核查,它虚构了不存在的报告数据。题目问"截至 2026 年 6 月中国网民规模",它给出"11.87 亿人"、来源标注"CNNIC 第58次《中国互联网络发展状况统计报告》"。我们做了独立核验:第57次报告 2026 年 3 月 17 日发布(截至 2025 年 12 月网民 11.25 亿),全网检索不到第58次报告发布的任何证据,千问同日上午联网也明确声明"尚未检索到第58次数据";它的检索笔记里甚至出现了"第59次、第60次报告"这种根本不存在的编号,历史数据链条也对不上(第57次标 11.62 亿,实际 11.25 亿)。错误计数 3,这道题直接归零。数字格式都对、来源姿态也像模像样,恰恰是这类幻觉最危险的地方——它看起来比任何一家都权威,却在不存在的报告里填了编造的数。

这个发现把它的画像描清楚了:任务执行力一流(完成度满分、易用性清单十项全中,是六家唯一),中文写作与推理都在水准线上,但联网场景下的幻觉控制是明显短板。对比同题组:豆包、千问联网时宁可说"没查到"也不编数,DeepSeek 在引文上栽过跟头,智谱清言则是在报告编号和数字上踩了更大的坑。

要点实录(4 题,完整证据见 docs/reviews/zhipu/)

题目实际输出摘要判定
T1 格式表格6 行 4 列全对,五大淡水湖与省份、面积无误,零多余文字1.0(T1.png)
T4 联网核查"11.87 亿"标注为不存在的第58次报告数据;思考区引用第59/60次报告编号3 错(T4.png)
T7 悖论推理三步假设反证完整,结论"乙说真话"正确,逻辑自洽0 错(T7.png)
T8 陷阱题首句纠正作者为朱自清,7 处引文逐条核验均为《背影》原文0 错(T8.png)

分场景结论:写东西、改格式、做归纳、解逻辑题,可以放心交给它——执行力、格式遵循和中文质感实测都在第一梯队,访客态免登录还有三档思考强度可调,门槛极低。一类人必须警惕:拿它查数据、核事实、写报告的人,它的联网结论必须交叉核验再用,实测中它编造过看起来有鼻子有眼的官方报告数据,这比"答不上来"危险得多。局限性:1 天 8 题单轮实测,样本有限仅供参考;本次为未登录访客态(GLM-Flash 极致档),登录后的 GLM-5.3 及深度研究模式未测,不代表完整产品力;T4 判定基于 2026-09-17 的公开信息核验,若第58次报告后续确认发布,该题数据需以官方为准。利益披露:无联盟链接、无商业合作;智谱与本站无任何商业关系,不影响本次评分。

相关工具文中提到的工具,点开看详情与使用教程

相关工具:智谱清言ChatGLMDeepSeek豆包
标签:
AK

酷越AI

专注AI工具评测与使用指南,帮你发现最好用的AI产品。

RELATED READS
相关阅读
千问实测报告:8 道真题 77.4 分同题组垫底,访客态拒答是最大变数 豆包实测报告:8 道真题 88.8 分零事实错误,免登录才是它最狠的一招 腾讯元宝实测报告:8 道真题 90.3 分拿下 S 级,访客态不设墙是它的底气 2026中国算力大会晒年度成绩单:十五项技术突破背后,国产算力的考题换了 九月大模型榜单生变:Meta新模型三天登顶,Kimi K3与GLM-5.3把国产名次顶进前十
返回首页·全部文章