测评声明:2026-08-30 至 09-01 实测,Kimi 网页版、ChatGPT 网页版。测试语料:一份约 20 万字的上市公司年报 PDF + 一份 8 万字行业报告;任务集 6 项:数值检索 2、跨章节总结 2、观点归纳 1、表格复现 1。每任务双平台各执行 3 次。
核心发现
- 检索命中率打平:6 任务中两者都找齐了关键数值,但 Kimi 的页码/章节引用更细,ChatGPT 的转述更流畅
- 跨章节总结 Kimi 略胜:年报分散在四处的风险提示,Kimi 聚合得更完整;ChatGPT 有 1 次漏掉附录中的次要风险
- 中文表格复现 ChatGPT 略胜:复杂表格结构还原更完整,Kimi 出现 1 次列错位
维度评分(附实测依据)
| 维度 | Kimi | ChatGPT | 实测依据 |
|---|---|---|---|
| 检索命中率 | 9.0 | 9.0 | 6 任务关键信息全中,打平 |
| 引用规范度 | 9.2 | 8.5 | Kimi 标注章节位置更利于人工复核 |
| 跨章节聚合 | 9.0 | 8.6 | 风险提示聚合完整度 5/5 vs 4/5 |
| 表格复现 | 8.3 | 8.8 | ChatGPT 结构还原更稳,Kimi 1 次列错位 |
| 免费可用度 | 9.0 | 8.0 | Kimi 免费档对长文更宽松,ChatGPT 高峰有额度限制 |
分场景结论
- 适合 Kimi:中文长文档的核查型任务(年报/合同/论文)——引用规范让"AI 找的"能被人工验证,这对严肃场景是刚需
- 适合 ChatGPT:英文资料、需要把长文转写成流畅中文汇报的场景
- 都不适合:希望 AI 替你对数字负责任的场景——两者都需人工复核关键数值,AI 是加速器不是签字人
举个例子:审计助理小吴用 Kimi 预筛年报中的关联交易描述,章节引用让她直接跳页核对,半小时干完过去半天的活;换 ChatGPT 版本更顺口,但少了页码,复核反而多花时间。
最终判断: Kimi 8.9 / ChatGPT 8.7(长文档场景加权:引用 25%+聚合 25%+检索 25%+表格 15%+免费度 10%)。置信度说明:基于 2 份文档 6 任务 18 次执行,英文语料未覆盖。