拍过视频的人都知道一个行当叫场记,负责盯着演员每场戏的服装、发型、道具别穿帮。现在这个岗位的AI版难题刚刚有了像样的答案:国内多家视频模型厂商这个月集中升级了跨镜头一致性能力,同一个角色换机位、换场景、换时间段,脸不糊、衣服不换、气质不散。
表面上看,这是生成质量榜单又往前挪了一格。但对干这行的人来说,变化的不是画质,是生产方式。以前的文生视频,一段提示词对应一段孤立的画面,想讲一个三十秒、有三个场景的小故事,就得祈祷三段生成出来的是"同一个人"--多数时候不是。脸型微调、衣服变色、发型漂移,行业里管这叫抽卡,抽出能用的连贯素材,靠的是数量堆和运气好。一致性能力上线之后,同一个角色设定可以跨镜头沿用,创作逻辑从“抽卡碰运气”变成了“先定角、再分镜”。
往底层看,一致性是文生视频从玩具走向工具的分水岭。扩散模型天生带随机性,同样的描述跑两次就给你两张不同的脸,这在"生成一段好看画面"的语境里无伤大雅,在"讲一个完整故事"的语境里就是硬伤。厂商把资源砸在角色锁定、场景沿用这些能力上,说明竞争的重心已经从"单帧多惊艳"挪到了"叙事多可靠"--前者比的是演示效果,后者才决定谁被真正用到生产线上。而生产线意味着真金白银:短剧、电商产品视频、广告片,这三类内容的预算表里,"重拍"和"废片"一直是隐形的成本大头。
影响的顺序会从行业末端往前端传导。对普通创作者来说,原来只能做十五秒卡点混剪,现在可以试着讲一个三镜头的小故事,门槛的降低是实打实的。对从业者来说,短剧团队里"生成素材筛选员"这类临时工种会收缩,而懂分镜语言、能把剧本拆成提示词的AI导演助理会吃香——工具淘汰的从来不是工种,是工种里重复的那部分。对企业来说,一支产品广告的制作周期可能从周级压到天级,预算表里给拍摄团队留的那块,要重新谈。
做珠宝短视频的小娜对这个变化感受很直接。她的产品视频需要模特手部特写,以前每次生成都要在一堆废片里挑那只"没变形的手",一条六十秒的视频要抽上百次卡;上个月她把模特的手部特征写成固定描述词跨镜头复用,三段素材里的手是同一只,戒指的款式也没在第二段里自己长出碎钻。她算了一笔账,单条视频的生成成本降了将近一半,省下的主要是反复重抽的电费和她的睡眠时间。
技术把"选角费"和"废片率"打下来之后,接下来拉开差距的,是谁更会讲故事。工具越可靠,创意越值钱--这句话在视频行业验证过的次数,比任何地方都多。