Video verilerinin işlenmesi, sürekli uzamsal görsel sinyaller ile sıralı dizisel yapıların bir bileşimi niteliğindedir. Ancak zaman boyutunun eklenmesiyle ortaya çıkan yüksek veri boyutluluğu, yoğun bilgi fazlalığı ve karmaşık hareket dinamiklerinin modellenmesi ihtiyacı, bilgisayarlı görü alanında özgün zorluklar yaratmaktadır. Klasik evrişimli mimarilerin yerel önyargılarına alternatif olarak geliştirilen Transformer modelleri, tüm ögeler arası küresel ilişkileri kurabilme yetenekleriyle öne çıkmaktadır. Buna karşın, öz-dikkat mekanizmasının girdi dizisi uzunluğuna bağlı olarak karesel ölçeklenmesi, video verilerinin yüksek boyutluluğu ile birleştiğinde ciddi bir hesaplama darboğazı oluşturmaktadır. Bu çalışma, söz konusu teorik ve pratik kısıtlamaları aşmak adına geliştirilen Video Transformer mimarilerini bütüncül bir yaklaşımla incelemektedir.
Derleme çalışmasında, literatürde yer alan 100'ün üzerinde Video Transformer modeli metodolojik bir taksonomi çerçevesinde çözümlenmektedir. İnceleme süreci, video verisinin modele beslenmeden önceki girdi ön işleme adımlarından başlayarak mimari tasarım tercihlerine ve eğitim rejimlerine kadar uzanan üç ana aşamada yürütülmektedir. Girdi düzeyinde gömme ve belirteçleştirme stratejileri ayrıştırılmakta; mimari düzeyde karesel karmaşıklığı azaltmayı amaçlayan kısıtlanmış ve birleştirilmiş öz-dikkat yaklaşımları kategorize edilmektedir. Ayrıca uzun süreli zamansal ilişkileri yakalamaya dönük bellek ve yineleme mekanizmaları ile çoklu görünüm odaklı tasarımlar sistematik bir matris üzerinde değerlendirilmektedir. Performans karşılaştırmalarında ise Kinetics-400 ve Something-Something-v2 kıyaslama veri kümeleri temel alınmaktadır.
Sentezlenen bulgular, Video Transformer tasarımlarının başarısında ön eğitim stratejilerinin ve uzamsal-zamansal hiyerarşik yapıların belirleyici rol oynadığını göstermektedir. Özellikle MViT ve Video Swin gibi kademeli hiyerarşik mimariler, uzamsal fazlalığı azaltırken zamansal doğruluğu korumakta ve hesaplama maliyetlerini belirgin şekilde düşürmektedir. Eğitim rejimleri açısından değerlendirildiğinde, Maskeli Belirteç Modellemesi biçimindeki kendi kendine denetimli ön eğitim yaklaşımlarının, etiketsiz video verilerinden hareket ve görünüm dinamiklerini öğrenmede en yüksek başarımı sergilediği saptanmıştır. Kinetics-400 benchmark sonuçları, Video Transformer yapılarının geleneksel 3D evrişimli sınır ağlarına kıyasla daha düşük TFLOPs değerlerinde dahi daha yüksek sınıflandırma doğruluğuna ulaştığını kanıtlamaktadır.
Sonuç olarak bu derleme, video işleme hattının her aşamasında sunulan tasarım tercihlerinin teorik ve pratik yansımalarını kapsamlı bir biçimde ortaya koymaktadır. Araştırmacılar için Video Transformer modellerinin açık kalan yönleri, açıklanabilirlik eksikliği ve farklı dizi uzunluklarına genellenebilirlik sınırları üzerinden tartışılmaktadır. Çalışma, Türk araştırmacıların video analizi, hareket tanıma ve çoklu modlu yapay zeka alanlarında yürütecekleri tez ve makale çalışmalarında metodolojik bir rehber işlevi görmekte; doğru belirteçleştirme, verimli mimari seçimi ve öz-denetimli ön eğitim stratejilerinin kurgulanması adına somut bir kuramsal zemin sunmaktadır.
Kuramsal ve kavramsal çerçeve
Çalışmanın kuramsal zemini, doğal dil işlemede dizisel bağımlılıkları ve uzun erimli etkileşimleri paralelleştirilebilir öz-dikkat mekanizmasıyla çözen özgün Transformer mimarisine dayanmaktadır. Görüntü ve video alanına uyarlanan bu kuramsal çerçeve, evrişimli sınır ağlarının yerel uzamsal önyargılarını ortadan kaldırarak küresel bağlam etkileşimlerini doğrudan öğrenebilmeyi mümkün kılar. Ancak video verisinin zamansal boyutuyla katlanarak artan karesel hesaplama karmaşıklığı O(N^2) ve veriye olan yüksek bağımlılık, girdi ön işleme, sınırlı ve hiyerarşik öz-dikkat mekanizmaları ile özel ön eğitim rejimlerinin kuramsal olarak tasarlanmasını zorunlu kılmaktadır.
Makalenin ele aldığı literatür
İncelenen literatür, genel vizyon Transformer taramalarının, doğal dil işleme odaklı modellerin veya çoklu modlu yapıların yüzeysel kaldığı video odaklı tasarım ihtiyaçlarına odaklanmaktadır. Makale, ViT, Video Swin, MViT, TimeSformer, ViViT ve VideoMAE gibi 100'den fazla öncü Video Transformer çalışmasını girdi işleme, mimari verimlilik düzenlemeleri, zamansal modelleme yetenekleri ve kendi kendine denetimli ön eğitim stratejileri bakımından karşılaştırmalı olarak ele almaktadır.
Araştırma Tasarımı
- Evren veya inceleme alanı
- Video Transformer modellerini konu alan 100'den fazla akademik yayın ile Kinetics-400 ve Something-Something-v2 kıyaslama veri setleri.
- Örneklem veya araştırma materyali
- Aksiyon sınıflandırma ve video temsil öğrenimi alanında 2017-2023 yılları arasında yayımlanmış 100'ü aşkın makale ve bunlara ait başarım metrikleri.
- Veri toplama süreci
- Literatürdeki mevcut Video Transformer mimarilerinin, girdi dönüştürme, dikkat kısıtlama, bellek mekanizmaları ve ön eğitim rejimlerinin taksonomik derlemesi.
- Veri analiz yöntemi
- Kinetics-400 ve Something-Something-v2 veri setlerindeki top-1 doğruluk, TFLOPs ve parametre sayılarına dayalı sistematik nitel ve nicel karşılaştırma.
Video TransformersSelf-AttentionMasked Token ModelingSpatiotemporal RedundancyInductive BiasAction Classification
01Girdi ön işleme aşamasında derin CNN gömme ağlarının kullanımı, verilerin yüksek boyutluluğunu ve uzamsal-zamansal fazlalığını azaltarak Transformer modelinin öğrenme sürecini kolaylaştırmaktadır(Selva et al., 2023).
02Aşamalı hiyerarşik mimariler, uzamsal boyuttaki fazlalığı kademeli olarak küçültürken tüm seviyelerde zamansal özellikleri koruyarak ince taneli hareket özniteliklerinin kaybolmasını önlemektedir(Selva et al., 2023).
03Kendi kendine denetimli Maskeli Belirteç Modellemesi (MTM), yüksek maskeleme oranları sayesinde modelin hem küresel semantik bağlamı hem de yerel hareket dinamiklerini öğrenmesini zorunlu kılmaktadır(Selva et al., 2023).
04Eğitim rejimlerinde gömme ağları ile Transformer yapısının uçtan uca birlikte eğitilmesi, durğan öznitelik çıkarımına kıyasla daha yüksek temsil kapasitesi ve başarım sağlamaktadır(Selva et al., 2023).