这一两个月,视频生成模型最显眼的变化不是"更真了",而是"更长了"。可灵、Sora、Runway 几家先后把单次可生成时长从 10 秒、30 秒一路拉到 60 秒,分辨率站稳 1080P,镜头里人物的动作连贯性也肉眼可见地变好。我的判断很直接:这场时长竞赛争的根本不是数字,而是 AI 视频能不能从"炫技片段"变成"正经生产素材"。
把事实摆平。过去一年 AI 视频最大的吐槽就是"短"——十秒出头,讲不完一句话,做一条像样的短视频得把好几段拼起来,转场处人物忽胖忽瘦、背景凭空跳变,观众一眼就看出来是拼的。现在 60 秒一口气出来,且中段不崩,这件事的性质就变了。
为什么是现在而不是更早?两条曲线同时到位。一是推理算力成本被持续压低,生成长时序视频的账单终于到了"能批量用"的区间;二是时序一致性模型成熟,AI 终于学会"记住"前几秒里人物的脸和衣服,不再每帧重新发明一遍。技术越能扛住长镜头,短视频创作的门槛就越从"会剪"滑向"会写"。
对创作者的真实影响,比"能生成更久"要具体得多。以前一条三十秒的科普视频,得先生成三个十秒片段,再在剪辑软件里对轨、补转场、调色统一,最怕的就是接缝处穿帮;现在一次出一段四十五秒的连贯讲解,对轨这道最磨人的工序直接没了。做知识科普的小林跟我说,他上个月试了新时长档,原本要折腾一晚上的片子,现在下班前就能发,"省下的不是几分钟,是那种对着接缝较劲的烦躁"。
落到三类人身上差别很清楚。普通短视频创作者:你的素材库变厚了,一条成片里能塞进一个完整的起承转合,不用再靠剪辑硬凑;电商商家:产品故事能一次讲完,卖点演示不再被十秒截断;广告公司:分镜脚本得重写,过去"拆成 N 段生成再拼"的 SOP 该进博物馆了。当然也得泼盆冷水——60 秒对讲完一个完整故事仍然不够,更复杂的内容还是得靠段落拼接,只是这次拼接的单元从"秒"变成了"段"。
你现在能做的:去各家试一下 60 秒档,重点看"中段人物会不会崩""运镜顺不顺",别只盯着首页那几条精选。本站收录的可灵、Sora、Runway 都值得挨个对比,看谁的家底更厚。
时长这把尺子还会继续拉长,但真正决定 AI 视频命运的,从来不是它能生成多长,而是它生成的东西,观众愿不愿意当成"作品"而不是"demo"。