问 AI"今天有什么大新闻",是检验联网能力的照妖镜:有的模型支支吾吾说知识截止于去年,有的张口就来但数字全错。我们拿 15 个"当天发生的事"去实测 Grok 和 ChatGPT,看谁配当你每天的嘴替。
测评声明
时间:2026 年 9 月 4-6 日。环境:网页端,Grok 开启 X 实时模式,ChatGPT 开启联网搜索。任务集:15 个当天热点问题,覆盖体育赛果(3)、政策发布(3)、科技新闻(4)、价格变动(3)、突发事件追问(2),每题双平台同问,答案逐条用搜索引擎人工交叉核实。
核心发现
①时效性,Grok 快半个身位。昨晚发生在 X 上的舆论事件,Grok 早上就能说出传播脉络,ChatGPT 要到当天下午才检索到像样的报道——这是 X 数据池的直接红利。
②准确率,ChatGPT 更稳。15 题里 ChatGPT 答对 14 题,Grok 答对 12 题,Grok 的翻车集中在数字细节(比分、金额),态度都对、数字飘了。
③风格差异肉眼可见。Grok 敢下判断、敢引用网友说法,ChatGPT 稳妥保守,每句话都留着退路。做快讯爱前者,做引用爱后者。
④中文体验,ChatGPT 胜出。Grok 追问到第三轮偶尔夹英文语序,ChatGPT 全程中文语感在线。
维度评分
| 维度 | Grok | ChatGPT | 实测依据 |
|---|---|---|---|
| 时效性 | 9.3 | 8.4 | 15 题中 Grok 平均早 4-10 小时检索到信源 |
| 准确率 | 8.0 | 9.3 | 人工核实 12/15 vs 14/15,Grok 错误集中在数字 |
| 溯源能力 | 8.5 | 8.8 | 两家都能给来源链接,ChatGPT 引用媒体更规范 |
| 中文体验 | 8.2 | 9.2 | 多轮追问中 Grok 出现 3 次中英夹杂 |
| 性价比 | 8.5 | 7.5 | Grok 绑定 X 会员更划算,ChatGPT Plus 贵一档 |
分场景结论
追热点、看舆论场、做快讯选题——Grok 的时效值得开会员;查事实、要规范引用、写正式材料——ChatGPT 的准头让人放心。做科技快讯的兼职编辑老范的用法很典型:早上用 Grok 扫昨晚 X 上的大事当雷达,再用 ChatGPT 交叉核实数字当质检,"一个负责快,一个负责对"。
横向对比
顺手提一句 Perplexity:引用最全、来源列得最规矩,但速度慢半拍,更像"查资料的工具"而不是"聊新闻的对象"。三家各占一头——Grok 占快、ChatGPT 占准、Perplexity 占全。
最终判断
一句话:热点问答没有单一王者,双持才是完全体。置信度说明:3 天 15 题,热点样本随机性大、事件类型偏科技圈,结论仅供参考;重要的数字信息,无论谁答的都请二次核实。