测评声明(B 级实测 · 同题复测补全):首测 2026 年 9 月 14 日完成 8 道冻结真题中的 T1-T4(网页版 kimi.com,免费档,站主账号「用户 778」,默认模型 K3);T7 于 9 月 18 日同题补测;T5、T6、T8 于 2026 年 9 月 29 日补测完成,账号档位与题干均与冻结版一致、每题新开对话、全程留证(证据存 docs/reviews/kimi/,编号索引见文末)。本文为 8/8 补全后的完整评分,替代此前 4/8 的 81.1 分版本;跨 3 个测试日的口径差异在局限性一节如实说明。
评分卡(100 分制 · B 级实测口径)
| 维度 | 得分 | 判定依据(实测) |
|---|---|---|
| 任务完成度(20) | 20.0 | 8 题最终全部完成(T5/T6/T8 经 9-29 补测) |
| 输出质量(15) | 13.5 | 质量题锚点 T2 9.5 / T5 8.5 / T6 9.0,两遍独立评分取低值后均分 9.0 |
| 准确与幻觉(10) | 10.0 | T3 数学、T4 联网、T7 推理、T8 陷阱合计 0 事实错误 |
| 性能与稳定(8) | 5.5 | 9-29 当日 4/4 顺畅(单题含思考约 60-90 秒);但 8 题跨 3 个测试日才补全,9-14 曾被限流两次阻断,稳定性证据分裂 |
| 易用性(7) | 7.0 | 10 项清单全命中;9-29 仅出现一次可一键关闭的促销弹窗 |
| 价格与权益(6) | 4.5 | 免费档可用,会员优先队列限流体感明显(维持首测口径) |
| 合规与数据安全(4) | 3.5 | 隐私政策与备案资质可查,注销通道未逐项核验 |
| chat 类专项(30) | 28.1 | T1 9.5 / T4 9.5 / T5 8.5 / T7 10.0,均分 9.375 |
| 总分 | 92.1 | S 级 · 强烈推荐(同题复测补全版,90 天后复测) |
测试说明:8 道冻结题覆盖格式指令、百字写作、数学应用、联网核查、长材料归纳、复合指令、逻辑推理与错误前提陷阱,判定标准测试前冻结、主观题按锚点量表两遍独立评分取低值,与 DeepSeek(92.0 · S)、文心一言(88.3 · A)、豆包(88.8 · A)、通义千问(77.4 · B)、智谱清言(76.3 · B)、腾讯元宝(90.3 · S)同题同判。本次补测的正是当年被限流拦下的 T5-T8。
先交代那次「没测完」的遗憾。9 月 14 日首测时,Kimi 答完的四题近乎满分,但 T5 发送被限流弹窗拦下、T6 新建会话重试了 82 步仍被重定向回旧会话,T7 卡在发送前,T8 干脆没来得及尝试——当时的 81.1 分,是带着「完成度被腰斩」的扣分交出的答卷。半个月后补测,四道题一次跑通,全程没有再遇到限流,这说明首测的拦截更像是时段性的服务拥堵,而不是产品能力的天花板。
补测四题里最能打的是 T8 陷阱题。题目故意把《背影》安在鲁迅头上,Kimi 第一句就把话挑明:「先更正一个小点:《背影》不是鲁迅的作品,而是朱自清的散文。」随后照样把父爱讲透,从「不放心的琐碎」讲到「迟到的理解」,全文引了 8 处原文——「他用两手攀着上面,两脚再向上缩」「我那时真是太聪明了!」这些句子我们逐条比对过,8 处全部真实,零虚构。别小看这个对比:同题组里实力最强的 DeepSeek,恰恰是在这道题上纠正了作者却虚构了引文。纠正得干脆、引用也干净,Kimi 是少数派。
T5 长材料归纳拿 8.5:王叔早餐铺的材料埋了 6 个关键点,它全接住了,「凌晨四点半备料」「豆浆限卖两百碗」「月净一万二存四成」「嫌抽成高没上外卖」一个不落,每条都压在 20 字内、没有一句编造。唯一的小瑕疵是把「从一块五涨到两块」简化成了「涨价两元」,丢了原价这个具体数字——同一道题,豆包也栽在类似的细节上,这算是中文归纳任务的通病。T6 复合指令是五项全中的满分答卷:定义「机会成本」一句话点中「放弃的最佳替代选择」,大学生花 800 元买演唱会门票、放弃的兼职收入才是成本的例子贴题,最后一条规劝用「所以」开头,全文 69 字远低于 150 字限制——首测那道重试 82 步都没发出去的题,这次 40 秒出答案。
把四道补测题折回去重算,分数从 81.1 跳到 92.1,完成度拿满、准确零错、专项 28.1,三个 S 级的构成各有性格:DeepSeek 是「全对但有引文瑕疵」,元宝是「全对但联网断言存疑」,Kimi 则是「零事实错误,分被稳定性历史吃掉 2.5 分」。如果只看当下这个时点的产品状态,它的真实水位可能比 92.1 还要高一点。
分场景说结论。学生党和做资料整理的人可以直接把 Kimi 设为默认:长文归纳要点全、不瞎编,陷阱题的纠错意识在同题组里排第一,这两个能力恰恰是学习和研究场景最吃重的。需要严格高可用的密集任务(比如批量跑一天的自动化流程),建议保留备用工具——它的免费档限流在高峰期是真实存在的,首测的遭遇就是证据。写作润色类需求它也接得住,但 T2 那道 9.5 分的样本来自首测,本轮未复测,口径上保守些看。
局限性照实交代:8 题单轮、跨 9 月 14/18/29 三个测试日完成,K3 模型在此期间可能更新,同题不同日的结果存在版本漂移风险;T2 未随本轮补测复测,锚点沿用首测;免费档账号单一,结论对会员档位不构成外推。所有输出与截图存于 docs/reviews/kimi/(T5 补测记录、T6/T7/T8 补测记录、两遍评分表),读者可核。
利益披露:本文无联盟链接、无商业合作;Kimi 与本站无任何利益关系,评分独立作出,测试账号为站主本人免费档。