财报季是所有研究者的体能测试:百页 PDF,营收、现金流、风险提示散落各处,人工摘一家的数据要半天。长文档模型这两年进步飞快,通义千问和智谱清言都把"财报速读"当招牌,我们用真实的半年报实测了一轮,发现两家的强项恰好错开。
测评声明
时间:2026 年 9 月 5-10 日。环境:两家网页版长文档模式,上传同一组 3 家上市公司的 2026 年半年报 PDF,最厚 187 页。任务集:每份报告固定五问——营收结构与同比、现金流变化、风险提示要点、管理层展望、可疑数字挑错——答案由两人对照原文逐条核验。
核心发现
①数字准确性,通义千问略胜。15 组关键数字提取(营收、同比、毛利率),通义答对 14 组,清言 13 组。出错的场景高度一致:跨页合并表格——通义把并排两年的数据读串了一次,清言漏了一处脚注小字。
②"承认不知道"的意愿,清言更让人放心。管理层展望一问,半年报没写的那家公司,清言明确回答"报告未披露相关表述";通义则拿发布会公开信息补了一段——内容没错,但混淆了"报告内"和"报告外"的信源边界,做严谨研究时这个差别很要命。
③表格还原两家都过关。复杂跨页表格的引用定位,清言给出的页码更完整,回查时省时间。
维度评分
| 维度 | 通义千问 | 智谱清言 | 实测依据 |
|---|---|---|---|
| 数字准确 | 9.1 | 8.7 | 15 组关键数字:对 14 对 13 |
| 结构还原 | 8.9 | 9.0 | 跨页表格与脚注定位,清言页码引用更完整 |
| 信源边界 | 8.0 | 9.2 | "未披露"问题:清言明确拒答报告外内容,通义自行补信息 |
| 响应速度 | 8.5 | 8.3 | 百页 PDF 解析均在 3 分钟内,问答响应差距不明显 |
| 性价比 | 8.6 | 8.5 | 两家免费额度均够财报季使用,按公开价格估算 |
分场景结论
做数据核对、要往底稿里抄数字的——选通义,数字提取稳,配合"给出页码"的要求更好用;快速形成观点、写综述的——选清言,信源边界清晰,结论不容易被"报告外"信息污染。两家共同的底线:关键数字必须对照原文复核,AI 负责找,人负责对。投研实习生小何现在的流程是清言出初稿、通义做数字核对,一家公司的财报速读从半天压到 40 分钟,导师复核错误为零。
横向对比
跟以长文档见长的 Kimi 相比,通义和清言的差距不在"读得下",在"读得准"和"答得诚实"——财务场景真正的分水岭就在这里。共同的短板是图表:报告里的折线图、饼图两家都只能按图注理解,图里的趋势细节读不出来。
最终判断:\u003cstrong>数字核对选通义,观点提炼选清言,组合使用效果最好。\u003c/strong>以上基于 3 份报告×5 问×双模型的实测,样本有限,仅供参考。