这份报告写起来有点拧巴:实测跑通的 4 道题,Kimi 几乎交出了满分答卷;可另外 4 道题,我们根本没能送进它的输入框。2026 年 9 月 14 日下午,我们用与 DeepSeek 完全相同的一套 8 道冻结真题测试 Kimi 网页版免费档(默认模型,站点标注 K3 上线),题干不改字、判定先冻结、每题新会话、全程留证(题组与证据存于 docs/reviews/kimi/,证据编号 T1-T8)。结果 8 题只跑完 4 题——不是题目做不出,是消息发不出去:限流弹窗一次次弹出,"和Kimi聊天的人太多了,订阅会员可进入优先队列"。所有未完成项如实标注,未编造任何数据。
评分卡(100 分制 · B 级实测口径,限流扣分已含)
| 维度 | 得分 | 判定依据(实测) |
|---|---|---|
| 任务完成度(20) | 10.0 | 8 题完成 4 题;未完成 4 题均因服务端限流,非回答质量 |
| 输出质量(15) | 14.3 | 实测 1 道质量题锚点 9.5(样本单一,已标注) |
| 准确与幻觉(10) | 10.0 | 实测 2 道事实与推理题 0 错(样本 2 题) |
| 性能与稳定(8) | 2.5 | 限流弹窗两次阻断发送;完成题耗时中位数约 2 分钟 |
| 易用性(7) | 7.0 | 10 项清单全中 |
| 价格与权益(6) | 4.5 | 免费可用,但会员优先队列的限流体感明显 |
| 合规与数据安全(4) | 3.5 | 隐私政策与备案信息可查,注销通道未逐项核验 |
| chat 类专项(30) | 29.3 | 核心 4 题实测 2 题(锚点 9.5、10),另 2 题未测 |
| 总分 | 81.1 | A 级 · 值得使用(2026-09-14 实测口径,90 天后需复测) |
测试说明:题组与判定标准与 DeepSeek 报告完全一致(同题同判)。T5(长材料归纳)输入完成后,发送被限流弹窗拦截,按流程恢复重试一次仍被拦;T6(复合指令链)遭遇站点状态异常——新建会话被重定向回旧会话,输入无法正常提交,自动化重试 82 步无果;T7(推理链)单独重试时页面响应超时;T8 未再尝试。以下所有结论,只基于跑通的 4 题。
先说答得好的部分,因为它真的好。T2 让它用不超过 100 字写"秋天的清晨",声音、气味、反问句三个约束一个不落,"日光迟迟不敢落稳"这种句子是有观察的(T2_output.md);T3 二元一次方程组,消元、代入、验算一步不少,答案全对;最惊艳的是 T4 联网核查:面对"截至 2026 年 6 月中国网民规模",它不仅说明官方第 58 次报告尚未发布、给出第 57 次报告 11.25 亿与 80.1% 普及率,还专门提醒"网上把 11.23 亿说成 2026 年 6 月的,多半是误植——11.23 亿对应的是第 56 次、截至 2025 年 6 月",连统计口径都交代到了"6 周岁以上、过去半年用过网、固定电话加手机双重抽样"这一层。这份较真,是我们两场实测里见过最扎实的信源态度。
再说限流,这是这份报告绕不开的主角。实测时间是周一下午四点——不是深夜,不算极端高峰。T5 那道长材料归纳题,我们一字不差输进了约 500 字材料,点击发送,弹窗跳出来:想插队,开会员。按流程恢复重试,还是这个弹窗。之后的新会话异常、页面响应超时,大概率也是同一套服务端限流的连锁反应。对免费用户来说,限流不是分数问题,是"关键时刻用不用得上"的问题:日常零散提问也许碰不到,可一旦赶上连续作业——比如一次性核对十份材料——中途被拦的体验,会直接决定你还愿不愿意回来。
速度也值得一句提醒:跑通的 4 题,耗时中位数约 2 分钟,而 DeepSeek 同题组的中位数约 48 秒。K3 的思考过程更细、输出更厚,慢有慢的道理,但排队加生成的时间叠在一起,免费档的体感确实偏重。
要点实录(4 题,完整证据见 docs/reviews/kimi/)
| 题目 | 实际输出摘要 | 判定 |
|---|---|---|
| T2 写作约束 | 约 75 字短文,声音、气味、反问全中,画面感强 | 锚点 9.5 |
| T3 数学应用题 | 消元法 x=5、y=4,附验算 | 0 错(10 分档) |
| T4 联网核查 | 官方未发布→引第 57 次 11.25 亿/80.1%,并纠正 11.23 亿误传 | 0 错(10 分档) |
| T5 长材料归纳 | 输入完成,发送被限流弹窗拦截,重试一次仍被拦 | 未完成(限流) |
所以这份报告的结论,得拆成两半说。如果你每天就问几个问题、读几份文件,Kimi 的答案质量对得起任何期待,长文档和信源核查尤其见功力——写毕业论文的小陈这类人最合适:把几十页综述丢给它列要点,它连哪个数字常被张冠李戴都会提醒你。可如果你的用法是"连续高强度作业",免费档的限流就是实打实的天花板,要么错峰用,要么把会员钱算进成本再对比。它像一辆动力很足的车,只是加油站排不排队,不看车的脸色。
局限性必须说得比平时更重:本报告实测样本为 1 天 4 题(另有 4 题未完成),且限流发生在特定时段(周一下午),能力面结论仅基于跑通的题目;K3 各模式未分开测试;分数时效 90 天,到期需复测——届时我们会优先补测完整题组。利益披露:本篇无联盟链接、无商业合作。
4 道题、近乎满分;另有 4 道题,连门都没进去。Kimi 的这份成绩单,一半是能力证明,一半是稳定性提醒——下个月复测时,我们最关心的不是它能答多好,而是那道没送进去的题,这次能不能发出去。