体制内写材料的痛苦,一半在格式:标题层级、称谓口径、结尾套话,差一点味道就不对。我们把同一组公文任务交给DeepSeek和文心一言,看谁的"官腔"更正、谁更省改。
测评声明
时间:2026 年 9 月 9-12 日。环境:DeepSeek网页版与文心一言网页版。任务集:五种常见文种——通知、请示、工作总结、会议纪要、汇报材料开头段,每文种双模型各生成3次,共30次,由一位十年办公室经验的"笔杆子"按"可直接交/小改可用/重写"三档盲评。
核心发现
①格式合规度,文心一言占优。请示的"妥否,请批示"收尾、通知的主送机关位置,18次相关生成里只有2次失手;DeepSeek偶有格式自由发挥,把请示写成了情况说明。
②内容生成力,DeepSeek更强。工作总结的"成绩-问题-打算"结构里,它给的问题分析更具体,能落到具体环节;文心偏向四平八稳的排比句,架子漂亮,肉少。
③两家共同雷区:数字和案例会"编"。凡涉及真实数据、真实人名的地方都是占位符性质,必须人工填空核实——公文里这条红线碰不得。
维度评分
| 维度 | DeepSeek | 文心一言 | 实测依据 |
|---|---|---|---|
| 格式合规 | 8.2 | 9.0 | 三档盲评:"可直接交"文心10/18次,DeepSeek 6/18次 |
| 内容具体度 | 8.8 | 7.5 | 总结的问题分析段:DeepSeek出现具体归因的比例明显更高 |
| 语言风格 | 8.0 | 8.8 | 文心的机关口径用语更贴近行文习惯,改得少 |
| 修改成本 | 8.5 | 8.0 | 到"小改可用"的平均迭代:DeepSeek 1.6轮,文心2.2轮 |
| 响应速度 | 9.0 | 8.0 | 千字成稿:DeepSeek约20秒,文心约40秒 |
分场景结论
急稿、初稿选DeepSeek——快、骨架全,格式自己把一把;正式上报的文种选文心——格式和口径稳,改起来心惊肉跳的次数少。区政府办的小赵的分工:DeepSeek搭架子填内容,文心按文种过一遍格式,两道工序之后自己只改事实层。
横向对比
和WPS AI这类文档内嵌功能比,两家的优势在"整篇生成"而不是片段润色;和其他通用大模型比,文心的价值就在那层"机关语感"——平时觉得没用,交稿的时候最要命。
最终判断:公文写作的AI现状:格式可以放心交给机器,事实必须留给人类——它俩背的责任不一样。以上基于5文种30次生成盲评,样本有限,仅供参考。