半年前你纠结的可能是"用哪家AI比较好",现在这个问题每个月都要重新回答一次——大模型榜单的换脸速度,已经快过手机发布会。
进入九月,多家第三方评测榜单陆续刷新。最抢眼的是Meta:9月2日上线的Muse Spark 1.3,发布三天就登上榜首,把OpenAI和Anthropic都压在了身后。国产这边也有实质性进展,Kimi K3排在第六,智谱的GLM-5.3拿下第八,前十名里国产模型占了两席。
先看"三天登顶"背后的信息量。发布三天就冲到第一,说明头部模型的差距已经小到"一次版本更新就能换座次"的程度——这不是某一家突然封神,而是整个头部梯队挤在同一个身位上互咬。对用户来说,"哪家最强"正在变成一个伪问题,"哪家最适合我的活儿"才是真问题。
国产两个席位的位置也值得展开。Kimi K3和GLM-5.3挤进前十,意义不在名次本身,而在于国产模型完成了从"追平国际先进"到"参与头部竞争"的心态切换。榜单只是横切面,真正决定胜负的变量已经从单纯的答题分数,转向上下文长度、Agent能力、API价格这些"能不能干活"的硬指标——用户拿真金白银投票的时候,是不看跑分的。
做跨境电商文案的运营阿May,选型思路就很实在:她把同一份商品描述分别投给三家模型,各生成十个版本的卖点文案,投到店铺里跑两周点击率,最后留下数据最好的那家。三个月后榜单变了,她又重跑了一遍测试,换了模型,流程没变。在她的世界里,榜单是月抛型工具,转化率才是年抛资产。
落到不同人身上:普通用户基本可以躺赢,免费档的能力跟着头部水涨船高,隔几个月换个新模型试试,体验只会更好;开发者是这轮变化的最大受益者,接口越来越标准化,换模型的成本从"重写代码"降到"改个参数",按场景挑模型成了常态操作;企业采购则建议把"听发布会"改成"按自己的业务场景跑分",三轮测试下来,答案比任何榜单都诚实。
眼下能做的两件事:把你工作中最高频的那个任务,拿给榜单前五的模型各跑一遍,你的私人榜单十分钟就能建好;另外留意各家长文本与Agent能力的实测,下一个拉开差距的地方,大概率在那里。
榜单月月换脸,看个热闹就好。真正的选型逻辑从来只有一条:谁把你的活儿干得又快又对,谁就是当月的榜首。