Veo 3 و Kling: The Technical Breakdows of the AI ​​Video

Andrew Altair, Founder
Veo 3 و Kling: The Technical Breakdows of the AI ​​Video
Vishal Bansal / unsplash

پیشرفت: حرکت فراتر از GIF

برای سال‌ها، تولید ویدئو با هوش مصنوعی یک تازگی ناامیدکننده بود. مدل‌های اولیه مانند Runway Gen-1 یا Stable Video Diffusion خروجی‌هایی تولید می‌کردند که شبیه رویاهای تب بود: چهره‌ها ذوب شدند، فیزیک کاملاً نادیده گرفته شد و ویدیوهای طولانی‌تر از سه ثانیه به نویز آشفته تبدیل شدند. آنها تصاویر متحرک بودند، اما به معنای تجاری «ویدئو» نبودند.

در اوایل سال 2026، با در دسترس بودن گسترده Veo 3 گوگل و Kling Kuaishou، چشم انداز به طرز چشمگیری تغییر کرد. ناگهان، آژانس‌ها می‌توانند کلیپ‌های ویدیویی 60 ثانیه‌ای، واقع‌گرایانه و 4K با کنترل دقیق دوربین و سازگاری فیزیکی کامل تولید کنند.

این جهش فقط در نتیجه "GPUهای بزرگتر" نبود. این یک طراحی مجدد اساسی در نحوه درک شبکه های عصبی از زمان

بود

زمینه: مشکل سازگاری زمانی

برای درک این پیشرفت، باید مشکل اصلی ویدیوی هوش مصنوعی را درک کنیم: سازگاری زمانی.

یک مولد تصویر هوش مصنوعی (مانند Midjourney) یک فریم واحد را در خلاء تولید می کند. یک تولید کننده ویدئو باید 24 فریم در ثانیه تولید کند و هر فریم باید زمینه فریم قبل از خود را به خاطر بسپارد.

اگر از هوش مصنوعی اولیه بخواهید ویدیویی از "مردی که یک فنجان قهوه در دست دارد" تولید کند، هوش مصنوعی ممکن است یک فنجان عالی در قاب 1 ایجاد کند. اما در فریم 12، فنجان ممکن است به یک لیوان تبدیل شود و در فریم 24، مرد ممکن است شش انگشت داشته باشد. شبکه عصبی هیچ "حافظه ای" از قوانین فیزیکی حاکم بر اشیایی که ایجاد می کرد، نداشت.

غواصی عمیق: موتورهای فضای پنهان و فیزیک

مدل‌هایی که در نهایت کد را شکستند - Veo 3 و Kling - این کار را با ازدواج Latent Diffusion با لایه‌های Spatial-Temporal Attention انجام دادند.

در اینجا جزئیات فنی نحوه عملکرد واقعی این مدل ها در زیر کاپوت آورده شده است:

  • ترانسفورماتورهای فضایی و زمانی سه بعدی: به جای پردازش یک ویدیو به عنوان دنباله ای از تصاویر دو بعدی مستقل، این معماری های جدید ویدئو را به عنوان یک بلوک سه بعدی از داده ها (عرض، ارتفاع و زمان) پردازش می کنند. وقتی مدل نورپردازی صورت شخصیت را در 5 دوم محاسبه می‌کند، مستقیماً به منبع نوری که در دوم 1 تعیین شده است ارجاع می‌دهد.
  • شبیه سازی فیزیک نهفته: Veo 3 یک "مدل جهانی" ابتدایی را در فضای پنهان خود معرفی کرد. این فقط حدس نمی زند که یک موج پاشش بر اساس پیکسل ها چگونه به نظر می رسد. درک آماری از دینامیک سیالات دارد. اگر خودرویی از میان گودال عبور کند، آب به طور واقع بینانه پاشیده می‌شود، زیرا این مدل قوانین فیزیک ریاضی را قبل از رمزگشایی آن به پیکسل‌های قابل مشاهده در نمایش نهفته اعمال می‌کند.
  • کنترل مسیر از طریق ControlNets: قبلاً یک درخواست تایپ می‌کردید و دعا می‌کردید که دوربین به درستی حرکت کند. اکنون، مدل‌ها از ControlNets زمانی استفاده می‌کنند. می‌توانید یک فلش ساده با دست (یک قلم مو) را آپلود کنید و هوش مصنوعی مسیر دوربین را روی همان بردار ریاضی قفل می‌کند و عکس‌های جرثقیل یا جاروهای هواپیمای بدون سرنشین به سبک هالیوود را امکان‌پذیر می‌کند.

پیامها: پایان بی رول

تلفات تجاری فوری این جهش فنی صنعت استوک ویدیو و B-roll است.

چرا یک آژانس بازاریابی باید 500 دلار برای یک کلیپ 4K عمومی از "زنی در حال نوشیدن قهوه در یک کافه" از Getty Images بپردازد، در حالی که آنها می توانند دقیقاً همان صحنه را با استفاده از Veo 3 برای چند سنت ایجاد کنند؟ علاوه بر این، آنها می‌توانند از هوش مصنوعی بخواهند که زن را وادار کند رنگ‌های برند خاص مشتری را بپوشد و نورپردازی را کاملاً مطابق با حال و هوای کمپین تنظیم کند.

اما پیامدها عمیق تر از فیلم های موجود است. اکنون فیلمسازان مستقل از این ابزارها برای پیش نمایش استفاده می کنند. یک کارگردان می‌تواند به جای ترسیم استوری‌بورد، نسخه‌ای خشن و کاملاً متحرک از کل فیلم خود بسازد تا قبل از خرج کردن یک دلار برای یک مجموعه فیزیکی، سرعت و زوایای دوربین را آزمایش کند.

The Takeaway: توقف فیلمبرداری همه چیز

اگر کسب و کار شما به شدت به بازاریابی ویدیویی متکی است، خط لوله تولید شما نیاز به بررسی معماری فوری دارد.

واکنش پیش‌فرض به نیاز به ویدیو دیگر نباید «بیایید یک خدمه دوربین استخدام کنیم» باشد. واکنش پیش فرض باید "آیا ما این را تولید کنیم؟" باشد.

اکنون باید تولید فیزیکی صرفاً برای چیزهایی که به اصالت مطلق و غیرقابل انکار نیاز دارند (مانند پیام مدیر عامل یا یک مستند) اختصاص داده شود. هر چیز دیگری - نمایش محصول، B-roll انتزاعی، تصاویر پس‌زمینه، و قلاب‌های رسانه‌های اجتماعی - می‌تواند و باید تولید شود. شرکت هایی که از این تغییر استقبال می کنند، 10 برابر محتوا را با 1/10 هزینه تولید می کنند.

می‌خواهید کشف کنید که چگونه ویدیوی هوش مصنوعی می‌تواند جایگزین فیلم‌های تولیدی گران قیمت شما شود؟

درخواست بازرسی ویدیویی هوش مصنوعی


سؤالات متداول

آیا Veo 3 می‌تواند کاراکترهای ثابتی را در چندین ویدیو ایجاد کند؟

بله. با استفاده از تکنیکی به نام «ارجاع شخصیت» (یا ارائه یک مقدار مشخص و یک تصویر مرجع)، می‌توانید اطمینان حاصل کنید که هوش مصنوعی دقیقاً همان فرد را با ویژگی‌های صورت یکسان، در صحنه‌های مختلف و اعلان‌های مختلف تولید می‌کند.

آیا فرآیند رندر کند است؟

تولید یک ویدیوی 4K 10 ثانیه ای با استفاده از این مدل های پیشرفته همچنان به قدرت محاسباتی قابل توجهی نیاز دارد. معمولاً 3 تا 5 دقیقه طول می کشد تا از طریق API ارائه شود. با این حال، این به طور تصاعدی سریع‌تر از روزها یا هفته‌های مورد نیاز برای رندر سه بعدی سنتی یا تولید ویدیوی فیزیکی است.