Veo 3 和 Kling:AI 视频的技术细分

Andrew Altair, Founder
Veo 3 和 Kling:AI 视频的技术细分
Vishal Bansal / unsplash

突破:超越 GIF

多年来,人工智能视频生成一直是一个令人沮丧的新奇事物。像 Runway Gen-1 或 Stable Video Diffusion 这样的早期模型产生的输出看起来就像狂热的梦境:面孔融化,物理完全被忽略,长度超过三秒的视频变成了混乱的噪音。它们是动态图片,但不是商业意义上的“视频”。

到 2026 年初,随着 Google 的 Veo 3 和快手的 Kling 的广泛使用,情况发生了巨大变化。突然之间,各机构可以通过精确的摄像机控制和完美的物理一致性来生成 60 秒、逼真的 4K 视频剪辑。

这一飞跃不仅仅是“更大的 GPU”的结果。这是对神经网络如何理解时间

的根本性重新设计。

上下文:时间一致性问题

要理解这一突破,我们必须了解AI视频的核心问题:时间一致性。

AI 图像生成器(如 Midjourney)在真空中生成单帧。视频生成器必须每秒生成 24 帧,并且每一帧都必须记住其之前帧的上下文。

如果你提示一个早期的人工智能生成一个“男人拿着咖啡杯”的视频,人工智能可能会在第 1 帧中生成一个完美的杯子。但是到了第 12 帧,杯子可能会变成一个玻璃杯,到第 24 帧,这个男人可能有六个手指。神经网络对其所创建的对象的物理定律没有“记忆”。

深入研究:潜在空间和物理引擎

最终破解密码的模型, Veo 3 和 Kling, 是通过将潜在扩散与时空注意力层结合起来实现的。

以下是这些模型在幕后实际工作原理的技术细分:

  • 3D 时空转换器:这些新架构不是将视频处理为一系列独立的 2D 图像,而是将视频处理为单个 3D 数据块(宽度、高度和时间)。当模型在第 5 秒计算角色脸部的光照时,它直接引用第 1 秒建立的光源。
  • 潜在物理模拟:Veo 3 在其潜在空间中引入了一个基本的“世界模型”。它不仅仅根据像素猜测飞溅的波浪是什么样子;它对流体动力学有统计上的了解。如果汽车驶过水坑,水会真实地溅起,因为该模型在将潜在表示解码为可见像素之前将数学物理规则应用于潜在表示。
  • 通过 ControlNet 进行轨迹控制:之前,您输入提示并祈祷相机能够正确移动。现在,模型使用时间 ControlNet。您可以上传一个简单的手绘箭头(运动画笔),人工智能会将相机轨迹锁定到该精确的数学矢量,从而实现完美的好莱坞式起重机拍摄或无人机扫掠。

影响:花絮的结束

这种技术飞跃的直接商业受害者是股票视频和幕后花絮行业。

为什么营销机构要花费 500 美元从 Getty Images 购买“女人在咖啡馆喝咖啡”的通用 4K 剪辑,而他们可以使用 Veo 3 以几美分的价格生成完全相同的场景?此外,他们可以提示人工智能让女性穿着客户特定的品牌颜色,并设置灯光以完美匹配活动的气氛。

但其影响比影视素材更深远。独立电影制作人现在正在使用这些工具进行预可视化。导演无需绘制故事板,而是可以生成整部电影的粗略完整动画版本,以测试节奏和摄像机角度,然后再花一美元购买实体布景。

要点:停止拍摄一切

如果您的业务严重依赖视频营销,那么您的制作流程需要立即进行架构审查。

对需要视频的默认反应不应再是“让我们雇用一个摄制组”。默认反应应该是“我们可以生成这个吗?”

现在,实体制作应严格保留给那些需要绝对、无可争议的真实性的事物(例如首席执行官的信息或纪录片)。其他一切, 产品演示、抽象花絮、背景视觉效果和社交媒体挂钩, 都可以而且应该生成。接受这一转变的公司将以 1/10 的成本生产 10 倍的内容。

想要探索 AI 视频如何取代昂贵的制作拍摄?

请求 AI 视频审核


常见问题解答

Veo 3 能否在多个视频中生成一致的字符?

是的。通过使用一种称为“角色引用”的技术(或提供特定的种子值和参考图像),您可以确保人工智能在不同的场景和不同的提示下生成完全相同的人,具有相同的面部特征。

渲染过程是否缓慢?

使用这些高级模型生成 10 秒 4K 视频仍然需要大量的计算能力。通过 API 渲染通常需要大约 3 到 5 分钟。然而,这比传统 3D 渲染或物理视频制作所需的数天或数周要快得多。