E Elecay
5.6.2.1 Tip: mekanizma Seri: Sıfırdan Başlayanlar

Metinden Videoya Modeller Nasıl Çalışır? Zamanın Eklediği Fark

Video üretimi neden görselden kat kat pahalı, klipler neden bu kadar kısa ve neden bir fotoğraftan başlamak daha kontrollü? Mekanizmasıyla, ürün adı vermeden.

Seviye
Giriş — teknik bilgi gerekmiyor
Ön koşul
Yapay Zeka Görseli Nasıl Üretiyor? Cümleden Resme Giden Yol (isteğe bağlı)
Okuma süresi
~9 dakika

Bir görsel saniyeler içinde geliyor. Üç saniyelik bir klip için beklemeniz gerekiyor, üstelik çok daha pahalıya mal oluyor.

Fark, görselin yanına “biraz daha görsel” eklenmesinden gelmiyor. Zaman, mekanizmaya yeni bir eksen ekliyor ve o eksen her şeyi değiştiriyor: maliyeti, klip uzunluğunu, kontrol edilebilirliği.

Bu yazı o ekseni anlatıyor. Nasıl video üretileceğini değil — onu ayrı bir yazı anlatıyor → Yapay Zeka ile Video Oluşturma: Prompt'tan Çıktıya İş Akışı

Video, arka arkaya dizilmiş görsel değil

En yaygın yanlış anlama bu ve neredeyse bütün şaşkınlıklar buradan doğuyor.

Model kareleri tek tek üretip sonra birleştirmiyor. Öyle olsaydı her kare kendi başına makul, ama peş peşe izlendiğinde titreyen bir dizi çıkardı: gömlek her karede renk değiştirir, arka plandaki masa yer değiştirirdi.

Bunun yerine model klibi bir bütün olarak üretiyor. Zaman, genişlik ve yükseklik gibi üçüncü bir boyut olarak işin içinde. Bir kareyi belirleyen şey yalnızca prompt değil, komşu karelerin de aynı anda şekilleniyor olması.

Pratik karşılığı şu: bir klibin içinden tek bir kareyi ayrı düzeltemezsiniz. Görselde beğenmediğiniz köşeyi maskeleyip yeniden üretebilirsiniz; videoda o işlemin karşılığı yok, çünkü o kare tek başına üretilmedi.

Zaman ekseni mekanizmaya ne ekliyor?

Görsel üretiminin üç durağı burada da geçerli: cümle bir hedefe çevrilir, rastgele bir gürültü o hedefe doğru adım adım temizlenir, sonuç büyütülür. → Yapay Zeka Görseli Nasıl Üretiyor? Cümleden Resme Giden Yol

Videoda temizlenen şey tek bir kare değil, kare yığını. Gürültü baştan itibaren zaman boyutu taşıyor ve her temizleme adımı bütün yığına birden uygulanıyor.

Buradan iki sonuç çıkıyor.

Hareket, karelerin farkından doğuyor. Model “yürüme” diye bir eylemi ayrıca çalıştırmıyor; komşu kareler arasındaki tutarlı kaymayı üretiyor. Bir figürün yürümesi, o kaymanın bacaklarda belirli bir düzende olması demek.

Tutarlılık üretimin yan ürünü, garantisi değil. Kareler birlikte şekillendiği için birbirine benziyorlar — ama bu bir kural değil, bir eğilim. Eğilimin nerede ve neden zayıfladığı ayrı bir konu → Yapay Zeka Videolarında Karakter Neden Değişiyor? Zamansal Tutarlılık

Neden klipler bu kadar kısa?

Çünkü maliyet süreyle birlikte hızlı büyüyor ve model belirli bir uzunlukta çalışmak üzere eğitilmiş durumda.

Bir saniyelik akıcı görüntü onlarca kare demek. Model bunların hepsini aynı anda tutup, hepsine birden temizleme adımları uyguluyor. Süreyi iki katına çıkarmak yalnızca iki kat kare eklemiyor; karelerin birbiriyle ilişkisini de büyütüyor, çünkü her kare giderek daha uzaktaki karelerle uyumlu kalmak zorunda.

İkinci sınır eğitimden geliyor. Model belirli bir uzunluk aralığındaki kliplerle çalışmayı öğrendi. O aralığın dışına çıkıldığında alışık olmadığı bir işi yapıyor ve sonuç öngörülemez hâle geliyor.

Bu yüzden kısa klip sınırı bir ürün tercihi değil, mekanizmanın kendi sınırı. Uzun bir video isteyen kişinin yolu tek klibi uzatmak değil, kısa klipleri kurguda birleştirmek.

Üç şey aynı bütçeyi paylaşıyor

Görselde tek bir çözünürlük vardı. Videoda üç ayrı büyüklük var ve üçü aynı hesap bütçesinden besleniyor:

Süre — klip kaç saniye. Çözünürlük — her karenin kaç piksel olduğu. Kare hızı — saniyede kaç kare üretildiği, yani hareketin ne kadar akıcı göründüğü.

Birini artırmak diğerlerinden kısıyor. Aynı bütçeyle ya uzun ve düşük çözünürlüklü, ya kısa ve keskin bir klip alırsınız. Sistemlerin önünüze sabit seçenekler koymasının sebebi bu: üçünü birden serbest bıraksalar çoğu kombinasyon çalışmazdı.

Pratik sonucu, işi baştan doğru sıralamak: hangisinden vazgeçebileceğinize önce karar verin. Sosyal medya için kısa ve keskin, bir arka plan görüntüsü için uzun ve yumuşak — ikisi aynı üretimden çıkmıyor.

Ara kareler: model her kareyi üretmiyor olabilir

Akıcı görünen bir klipteki karelerin hepsi aynı yoldan gelmemiş olabilir.

Yaygın bir yaklaşım şu: model belirli aralıklarla anahtar kare üretiyor, aradaki kareler ise bu ikisi arasında yumuşak bir geçiş hesaplanarak dolduruluyor. Buna ara doldurma deniyor.

Bunu bilmek iki tuhaflığı açıklıyor.

Hareket bazen fazla yumuşak, fazla “kaygan” görünüyor. Ara kareler hesaplanmış geçişler olduğu için gerçek hareketin ani duraklarını, sarsıntılarını taşımıyor. Sonuç, gerçekten çekilmiş bir görüntüden farklı bir akıcılık hissi veriyor.

Hızlı hareketlerde bozulma artıyor. İki anahtar kare arasında çok şey değiştiyse, aradaki geçişi hesaplamak zorlaşıyor. Yavaş bir kamera kaymasında sorun çıkmayan sistem, hızlı bir el hareketinde dağılabiliyor.

Neden görselden başlamak daha kontrollü?

Video iş akışında sık verilen bir tavsiye var: doğrudan metin yazmak yerine önce bir başlangıç karesi hazırlayın. → Yapay Zeka ile Video Oluşturma: Prompt'tan Çıktıya İş Akışı

Bunun mekanizma tarafındaki sebebi şu: metinden videoya üretimde model, hem “ne görünecek” hem “nasıl hareket edecek” sorularını aynı anda çözüyor. Cümle her ikisi için de tek kaynak. Kadraj, ışık, karakterin yüzü, rengi — hepsi modelin serbest seçimine kalıyor ve o seçim her üretimde değişiyor.

Başlangıç karesi verildiğinde birinci soru kapanmış oluyor. Model artık “ne görünecek”i tartışmıyor; yalnızca “bu görüntü nasıl hareket edecek”i çözüyor. Tek değişkenli bir problem, iki değişkenliden hem daha ucuz hem daha tekrarlanabilir.

Aynı sebeple, birden fazla çekimin aynı dünyada geçmesini sağlamanın pratik yolu bu. İki ayrı metin promptundan çıkan iki klibin aynı karakteri taşıması beklenmemeli — ikisi de kendi serbest seçimini yapmış olur.

Model ne gördü? Video verisi kıt

Görsel modelleri devasa miktarda etiketli görselden öğrendi. Video tarafında durum farklı ve bu fark çıktıya yansıyor.

Video verisi hem daha az hem daha pahalı. Bir görselin ne anlattığını bir cümleyle tarif etmek kolay; bir klipte ne olduğunu tarif etmek hareketi, süreyi ve nedenselliği de anlatmayı gerektiriyor. Bu yüzden video eğitim verisi, görsel verisine göre hem daha küçük hem daha kaba etiketli.

Sonuçları şurada görünüyor:

Sık görülen hareketler güçlü. Yürümek, dönmek, kamera kayması, su akması — bunlar bol örnekle temsil edilmiş.

Nadir ve karmaşık hareketler zayıf. Belirli bir el işi, alışılmadık bir spor tekniği, iki nesnenin özel bir etkileşimi. Model burada da “bilmiyorum” demiyor; en yakın bildiğine kayıyor ve kendinden emin bir yanlış üretiyor.

Nedensellik en zayıf halka. Bir bardağın devrilip dökülmesi gibi sıralı olayların doğru sırada gelmesi, modelin en zorlandığı yer. Çünkü bu bir görünüm meselesi değil, bir sonuç meselesi.

Bu konuda anlaşmazlık var: model fiziği mi öğreniyor?

Görüş A — Bir dünya modeli oluşuyor. Tutarlı hareket üretebilmek için nesnelerin nasıl davrandığına dair içsel bir temsil gerekir; model bunu eğitim sırasında kuruyor. Yoksa sıvıların akışı ya da kumaşın dalgalanması bu kadar ikna edici olmazdı.

Görüş B — Ortada fizik bilgisi yok. Üretilen şey, birlikte görünme eğilimlerinin zamana yayılmış hâli. Model suyun aktığını bilmiyor; su görüntülerinin nasıl değiştiğini biliyor. İkisi dışarıdan aynı görünüyor.

Durum — (Bu bir değerlendirme, ölçülmüş bir tespit değil.) Tartışma açık ve iki taraf da aynı çıktıyı açıklayabiliyor. Ayrım ancak modelin hiç görmediği bir durumda ortaya çıkıyor: alışılmadık bir fizik senaryosunda A tarafı doğru davranış bekler, B tarafı en yakın tanıdık görüntüye kaymayı bekler. Pratikte gözlenen çoğu zaman ikincisi — ama bu, birincisini çürütecek bir kanıt değil.

Sınırlar

Bu anlatım bir basitleştirmedir. Sistemler arasında ayrıntılar değişiyor: bazıları zamanı farklı ele alıyor, bazıları ara doldurmayı hiç kullanmıyor. Anlatılan şey ortak davranış, tek bir mimari değil.

Mekanizma bilmek video üretmeyi öğretmez. İkisi ayrı beceri; bu yazı “neden böyle davranıyor”u anlatıyor → Yapay Zeka ile Video Oluşturma: Prompt'tan Çıktıya İş Akışı

Bugünkü sınırlar kalıcı değil. Klip uzunluğu ve nedensellik zayıflığı bugünkü durumu tarif ediyor. Nerede olduğumuz ayrı bir yazının konusu → Ücretsiz Yapay Zeka ile Video Oluşturma: Bugün Gerçekten Ne Alıyorsunuz?

Sayı vermedik. Kare sayısı, klip süresi ve maliyet oranları hızla değişiyor ve sistemler arasında farklı. Kaynağını ve tarihini göremediğiniz rakama güvenmeyin.

Özet

Video modeli kareleri tek tek üretip birleştirmiyor; klibi zaman boyutuyla birlikte bir bütün olarak üretiyor. Hareket, komşu kareler arasındaki tutarlı kaymadan doğuyor.

Klipler kısa çünkü maliyet süreyle birlikte hızlı büyüyor ve model belirli bir uzunlukta çalışmayı öğrendi. Uzun video, tek klibi uzatarak değil kısa klipleri birleştirerek yapılıyor.

Başlangıç karesi vermek işi kolaylaştırıyor çünkü modelin çözdüğü iki sorudan birini — “ne görünecek” — kapatıyor.

Video eğitim verisi görsel verisine göre kıt ve kaba etiketli. Bu yüzden sık görülen hareketler güçlü, nadir hareketler ve nedensellik zayıf.

Sık sorulanlar

Yapay zeka videoyu nasıl üretiyor?

Rastgele bir gürültüyü, zaman boyutuyla birlikte bir bütün olarak, cümlenizin işaret ettiği hedefe doğru adım adım temizleyerek. Kareleri tek tek üretip birleştirmiyor.

Yapay zeka videoları neden bu kadar kısa?

Maliyet süreyle hızlı büyüdüğü ve model belirli bir uzunluk aralığında çalışmayı öğrendiği için. Bu bir ürün tercihi değil, mekanizmanın sınırı.

Metinden videoya mı, görselden videoya mı daha iyi?

Görselden başlamak daha kontrollü, çünkü modelin çözmesi gereken iki sorudan biri kapanmış oluyor. Metinden başlamak daha hızlı ama her üretimde farklı bir dünya veriyor.

Yapay zeka video modelleri fiziği anlıyor mu?

Bu tartışmalı. Tutarlı hareket üretiyorlar ama bunun bir fizik bilgisinden mi yoksa görüntü eğilimlerinden mi geldiği açık değil; ayrım ancak modelin hiç görmediği durumlarda ortaya çıkıyor.

Üretilen videodaki tek bir kareyi düzeltebilir miyim?

Hayır. Kareler birlikte üretildiği için bir karenin ayrı düzenlenmesi mekanizmada karşılık bulmuyor; klip yeniden üretilir.

Aynı promptla aynı videoyu tekrar üretebilir miyim?

Görselde başlangıç gürültüsünü belirleyen sayıyı sabitlemek çoğu zaman yeterli oluyordu. Videoda bu daha kırılgan: sabitlenmesi gereken tek bir başlangıç noktası değil, zamana yayılmış bir yığın var. Tekrarlanabilirlik isteyen kişi için daha güvenilir yol, promptu değil başlangıç karesini sabitlemek.

İlgili yazılar

Yayında olanlar

Henüz yayında değil — konu ağacında yerini aldı, yazısı sırada:

  • 4.5.3.1yakında Difüzyon sezgisi — Gürültüden geri dönüşün teknik anlatımı.