---
type: "Akademik Makale Analizi"
title: "Video Transformer Modelleri: Kapsamlı Bir Literatür Taraması ve Sınıflandırma Çalışması"
description: "Video verilerinin işlenmesi, sürekli görsel sinyaller olan görüntüler ile sıralı bir yapı sunan doğal dil işlemenin kesişim noktasında yer alır. Ancak video alanı, eklenen zaman boyutu nedeniyle yüksek verisel boyutluluk, yüksek derecede bilgi fazlalığı ve dinamik hareket yapılarını modelleme gereks"
resource: "https://makaleanalizi.com/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/video-transformer-modelleri-kapsamli-bir-literatur-taramasi-ve-siniflandirma-calismasi"
doi: "10.1109/tpami.2023.3243465"
authors: ["Javier Selva", "Anders Skaarup Johansen", "Sérgio Escalera", "Kamal Nasrollahi", "Thomas B. Moeslund", "Albert Clapés"]
citation: "Selva, J., Johansen, A. S., Escalera, S., Nasrollahi, K., Moeslund, T. B., Clapés, A. (2023). Video Transformers: A Survey. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(11), 12922-12943. https://doi.org/10.1109/tpami.2023.3243465"
publicationType: "systematic-review"
discipline: "Mühendislik ve Teknoloji"
subDiscipline: "Bilgisayar ve Elektrik Mühendisliği"
evidenceCount: 12
tags: ["Yapay Zeka", "Bilgisayarlı Görü", "Öz-Dikkat", "Transformer Modelleri", "Video Temsilleri"]
timestamp: "2026-08-12T14:06:59.086Z"
---

# Video Transformer Modelleri: Kapsamlı Bir Literatür Taraması ve Sınıflandırma Çalışması

Özgün başlık: Video Transformers: A Survey
DOI: https://doi.org/10.1109/tpami.2023.3243465
Künye (APA 7): Selva, J., Johansen, A. S., Escalera, S., Nasrollahi, K., Moeslund, T. B., Clapés, A. (2023). Video Transformers: A Survey. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(11), 12922-12943. https://doi.org/10.1109/tpami.2023.3243465

Bilim alanı: [Mühendislik ve Teknoloji](/okf/muhendislik-ve-teknoloji/index.md) › Bilgisayar ve Elektrik Mühendisliği

# Alan bağlamı

Video verilerinin işlenmesi, sürekli görsel sinyaller olan görüntüler ile sıralı bir yapı sunan doğal dil işlemenin kesişim noktasında yer alır. Ancak video alanı, eklenen zaman boyutu nedeniyle yüksek verisel boyutluluk, yüksek derecede bilgi fazlalığı ve dinamik hareket yapılarını modelleme gereksinimi gibi kendine özgü zorluklar barındırmaktadır. Transformer modelleri uzun erimli bağımlılıkları modellemede başarılı olsa da karesel hesaplama karmaşıklığı ve uzamsal-zamansal türevlenebilir önyargıların eksikliği nedeniyle video verilerinde ciddi verimlilik sorunlarıyla karşılaşmaktadır. Literatürdeki mevcut taramalar genel vizyon veya çok modlu yapılara odaklanırken, doğrudan ham video dizilerinin ve uzamsal-zamansal görsel özniteliklerin Transformer yapılarıyla işlenmesine ilişkin derinlemesine analiz eksik kalmıştır.

# Akademik özet

Video verilerinin işlenmesi, sürekli uzamsal görsel sinyaller ile sıralı dizisel yapıların bir bileşimi niteliğindedir. Ancak zaman boyutunun eklenmesiyle ortaya çıkan yüksek veri boyutluluğu, yoğun bilgi fazlalığı ve karmaşık hareket dinamiklerinin modellenmesi ihtiyacı, bilgisayarlı görü alanında özgün zorluklar yaratmaktadır. Klasik evrişimli mimarilerin yerel önyargılarına alternatif olarak geliştirilen Transformer modelleri, tüm ögeler arası küresel ilişkileri kurabilme yetenekleriyle öne çıkmaktadır. Buna karşın, öz-dikkat mekanizmasının girdi dizisi uzunluğuna bağlı olarak karesel ölçeklenmesi, video verilerinin yüksek boyutluluğu ile birleştiğinde ciddi bir hesaplama darboğazı oluşturmaktadır. Bu çalışma, söz konusu teorik ve pratik kısıtlamaları aşmak adına geliştirilen Video Transformer mimarilerini bütüncül bir yaklaşımla incelemektedir.

Derleme çalışmasında, literatürde yer alan 100'ün üzerinde Video Transformer modeli metodolojik bir taksonomi çerçevesinde çözümlenmektedir. İnceleme süreci, video verisinin modele beslenmeden önceki girdi ön işleme adımlarından başlayarak mimari tasarım tercihlerine ve eğitim rejimlerine kadar uzanan üç ana aşamada yürütülmektedir. Girdi düzeyinde gömme ve belirteçleştirme stratejileri ayrıştırılmakta; mimari düzeyde karesel karmaşıklığı azaltmayı amaçlayan kısıtlanmış ve birleştirilmiş öz-dikkat yaklaşımları kategorize edilmektedir. Ayrıca uzun süreli zamansal ilişkileri yakalamaya dönük bellek ve yineleme mekanizmaları ile çoklu görünüm odaklı tasarımlar sistematik bir matris üzerinde değerlendirilmektedir. Performans karşılaştırmalarında ise Kinetics-400 ve Something-Something-v2 kıyaslama veri kümeleri temel alınmaktadır.

Sentezlenen bulgular, Video Transformer tasarımlarının başarısında ön eğitim stratejilerinin ve uzamsal-zamansal hiyerarşik yapıların belirleyici rol oynadığını göstermektedir. Özellikle MViT ve Video Swin gibi kademeli hiyerarşik mimariler, uzamsal fazlalığı azaltırken zamansal doğruluğu korumakta ve hesaplama maliyetlerini belirgin şekilde düşürmektedir. Eğitim rejimleri açısından değerlendirildiğinde, Maskeli Belirteç Modellemesi biçimindeki kendi kendine denetimli ön eğitim yaklaşımlarının, etiketsiz video verilerinden hareket ve görünüm dinamiklerini öğrenmede en yüksek başarımı sergilediği saptanmıştır. Kinetics-400 benchmark sonuçları, Video Transformer yapılarının geleneksel 3D evrişimli sınır ağlarına kıyasla daha düşük TFLOPs değerlerinde dahi daha yüksek sınıflandırma doğruluğuna ulaştığını kanıtlamaktadır.

Sonuç olarak bu derleme, video işleme hattının her aşamasında sunulan tasarım tercihlerinin teorik ve pratik yansımalarını kapsamlı bir biçimde ortaya koymaktadır. Araştırmacılar için Video Transformer modellerinin açık kalan yönleri, açıklanabilirlik eksikliği ve farklı dizi uzunluklarına genellenebilirlik sınırları üzerinden tartışılmaktadır. Çalışma, Türk araştırmacıların video analizi, hareket tanıma ve çoklu modlu yapay zeka alanlarında yürütecekleri tez ve makale çalışmalarında metodolojik bir rehber işlevi görmekte; doğru belirteçleştirme, verimli mimari seçimi ve öz-denetimli ön eğitim stratejilerinin kurgulanması adına somut bir kuramsal zemin sunmaktadır.

# Araştırmanın amacı

Bu çalışma, video verilerinin modellenmesinde Transformer mimarilerinin sunduğu yenilikleri, karşılaşılan kısıtları, girdi ön işleme adımlarını, mimari verimlilik uyarlamalarını ve kendi kendine denetimli öğrenme stratejilerini kapsayıcı bir taksonomi çerçevesinde incelemeyi amaçlamaktadır.

# Yöntem ve tasarım

Çalışmada, 100'den fazla Video Transformer yayını girdi ön işleme, verimli mimari tasarımları ve eğitim stratejileri ekseninde sistematik bir taksonomiyle çözümlenmiştir.

# Bulgular ve önermeler

1. Girdi ön işleme aşamasında derin CNN gömme ağlarının kullanımı, verilerin yüksek boyutluluğunu ve uzamsal-zamansal fazlalığını azaltarak Transformer modelinin öğrenme sürecini kolaylaştırmaktadır.
2. Aşamalı hiyerarşik mimariler, uzamsal boyuttaki fazlalığı kademeli olarak küçültürken tüm seviyelerde zamansal özellikleri koruyarak ince taneli hareket özniteliklerinin kaybolmasını önlemektedir.
3. Kendi kendine denetimli Maskeli Belirteç Modellemesi (MTM), yüksek maskeleme oranları sayesinde modelin hem küresel semantik bağlamı hem de yerel hareket dinamiklerini öğrenmesini zorunlu kılmaktadır.
4. Eğitim rejimlerinde gömme ağları ile Transformer yapısının uçtan uca birlikte eğitilmesi, durğan öznitelik çıkarımına kıyasla daha yüksek temsil kapasitesi ve başarım sağlamaktadır.

# Yazarın tartışması

Video Transformer modellerinin incelenmesi, derin CNN gömme ağlarının yüksek boyutlu video verilerini sıkıştırmadaki ve yerel öznitelikleri yakalamadaki kritik rolünü göstermektedir. Bu yapıların tümevarımsal eğilim sunması, Transformer katmanlarının daha derin bağımlılıkları öğrenmesini kolaylaştırmaktadır.

Yazarlar, mimari verimliliği sağlamak için geliştirilen kısıtlı ve hiyerarşik dikkat mekanizmalarının uzamsal fazlalığı azalttığını, ancak zamansal sadakatin erken aşamalarda yitirilmemesi gerektiğini savunmaktadır. Aşamalı hiyerarşik tasarımlar, düşük seviyeli hareket dinamiklerinin korunmasına olanak tanımaktadır.

Tartışma bölümünde literatürdeki denetimli ve kendi kendine denetimli eğitim rejimleri karşılaştırılmakta, Maskeli Belirteç Modellemesinin (MTM) yüksek maskeleme oranlarıyla küresel semantik bağlamı etkili biçimde öğrendiği vurgulanmaktadır. Bu durum, yalnızca görüntü tabanlı ön eğitime dayanan modellere kıyasla belirgin bir başarım üstünlüğü getirmektedir.

Sonuç olarak, Video Transformer araştırmalarının geleceğinde hesaplama yükünü azaltan verimli mimariler ile çoklu modlu kendi kendine denetimli öğrenme yaklaşımlarının birleşimi öne çıkmaktadır. Uzun süreli zamansal etkileşimlerin korunması ve açıklanabilirlik araçlarının geliştirilmesi, alanın temel gelişim yönlerini oluşturmaktadır.

# Yazarın sonucu

Çalışma, Video Transformer modellerinin aksiyon sınıflandırma ve video temsil öğreniminde 3D ConvNet yapılarını geride bıraktığını, ancak yüksek hesaplama yükü ve tümevarımsal eğilim eksikliği gibi temel kısıtların aşılması için aşamalı hiyerarşik mimariler ile maskeli belirteç modellemesine dayalı kendi kendine denetimli ön eğitim stratejilerinin belirleyici olduğunu ortaya koymaktadır.

# Literatürdeki işlevi

Bu derleme çalışmasi, video tabanlı Transformer modellerini giris on isleme, mimari tasarimlar ve eğitim rejimleri olmak üzere uc temel boyutta sistematik bir taksonomiye oturtarak literatürde birlestirici bir kopru gorevi ustlenmektedir. Genel vizyon derlemelerinin aksine, zamansal boyutun getirdigi yüksek karesel hesaplama karmasikligi ve bilgi fazlaligi gibi video-spesifik zorluklara odaklanmaktadir. Çalışma, araştırmacilara farklı modellerin uzamsal-zamansal ilişkileri nasıl modelledigini ve verimlilik ile basarim arasindaki odunlesimleri nasıl yonettigini gösteren teorik bir harita sunmaktadir.

Önceki çalışmalarla ilişkisi: Çalışma, Vaswani ve diğerleri (2017) tarafindan önerilen orijinal Transformer yapisindan baslayarak, bu yapinin dogal dil isleme disindaki alanlara, özellikle Dosovitskiy ve diğerleri (2021) tarafindan geliştirilen ViT modeli üzerinden goruntu alanina ve nihayetinde video alanina geçişini tarihsel bir süreklilik icinde ele almaktadır. Goruntu tabanlı modellerin zamansal dinamikleri yakalamadaki yetersizligini ortaya koyarak, Bertasius ve diğerleri (2021) gibi oncullerin uzamsal-zamansal ayristirma yaklaşimlari ile Fan ve diğerleri (2021) tarafindan önerilen cok ölçekli tasarimlarin bu sınırliliklari nasıl astigini tartismaktadir. Boyylelikle, önceki literatürun parca parca sundugu çözümleri butuncul bir kuramsal çerçevede sentezlemektedir.

Literatür taramasına katkısı: Çalışmanın literatür taramalarina sağladigi en buyuk katkı, Kinetics-400 ve Something-Something v2 gibi standart veri kumesi performanslarini yalnizca ham sayilarla degil, modellerin on eğitim stratejileri ve hesaplama maliyetleri ile ilişkilendirerek sunmasidir. Kendi kendine denetimli öğrenme rejimlerini, özellikle Maskeli Belirteç Modellemesi ve kontrastif öğrenme yaklaşimlarini ayrintili sekilde çözümlemektedir. Bu analizler, Turk araştırmacilarin kendi ampirik çalışmalarında hangi mimari tasarimi veya eğitim stratejisini secmeleri gerektigine dair rasyonel gerekceler ve ampirik dayanaklar sağlamaktadir.

# Tez ve makale araştırmalarında kullanım

- **Video verilerinde zamansal boyutun islenmesi, yüksek bilgi fazlaligi ve karesel hesaplama yuku nedeniyle geleneksel Transformer yapilarinda optimizasyon gerektirir.** — Tezin literatür taramasi bolumunde, video verilerinin özgün dogasindan kaynaklanan boyutluluk ve karesel karmasiklik problemlerini temellendirmek amaciyla bu çalışmadaki girdi ve mimari analizlerinden yararlanilacaktir.
- **Video Transformer boru hattinda ham verilerin yamalara bolunmeden once derin CNN aglariyla gomulmesi, modele güçlü yerel tumevarimsal egilimler kazandirir.** — Önerilen yeni modelin kavramsal çerçevesinde, uctan uca öğrenme ile dondurulmus oznitelik cikarimi arasindaki mimari ve kuramsal farklari açıklamak ve CNN-Transformer melez tasarimlarini gerekcelendirmek için kullanılacaktir.
- **Uzamsal boyutlarda erken hiyerarsik sikistirma yapilmasi, daha sonraki katmanlarda ince taneli zamansal hareket ozniteliklerinin modellenmesini engelleyebilir.** — Tez çalışmasinda elde edilen model sonuçlarının tartisilmasi asamasinda, uzamsal ve zamansal havuzlama islemlerinin ince taneli hareket takibi üzerindeki olumsuz etkilerini kuramsal olarak açıklamak için bu tespitten faydalanilacaktir.

# Türetilebilir araştırma soruları

- **Hiyerarsik Video Transformer modellerinde uzamsal havuzlamanin erken katmanlarda uygulanmasi, Something-Something v2 gibi zamansal yon bagimli eylemlerin siniflandirma basarisini nasıl etkiler?**
  - Desen: Farklı asamali hiyerarsik havuzlama stratejilerine sahip uc farklı Video Transformer modeli tasarlanacak, modeller Something-Something v2 veri kumesinde egitilecek ve zamansal sadakat ile uzamsal fazlalik azaltimi arasindaki basarim farklari veri doygunluguna ulasana kadar analiz edilecektir.
  - Gerekçe: Yazarlarin Bolum 4.4 te belirttigi üzere, uzamsal özelliklerin erken asamada hiyerarsik olarak birlestirilmesi ince taneli hareket özelliklerinin olusumunu engelleyebilir. Bu öneri, erken hiyerarsik sikistirmanın eylem algilama üzerindeki etkisini doğrudan test etmeyi amaçlamaktadir.
- **Kendi kendine denetimli Video Transformer on eğitiminde, piksel rekonstruksiyonu ile HOG oznitelik regresyonunun Kinetics-400 üzerindeki ince ayar basarimi ve eğitim suresi acisindan farklari nelerdir?**
  - Desen: Ayni ViT-B omurgasi kullanılarak iki ayri kendi kendine denetimli on eğitim modeli oluşturulacaktir. Ilk model piksel duzeyinde kayip ile egitilirken, ikinci model HOG oznitelik eslesmesiyle egitilecektir. On eğitimlerin ardindan her iki model de Kinetics-400 üzerinde ince ayar islemine tabi tutulacak ve yakinsama sureleri ile basarim egrileri karşılaştırilacaktir.
  - Gerekçe: Bolum 5.3 teki tartismaya dayanarak, piksel tabanlı MTM nin yüksek frekansli detaylara odaklanma riski tasirken ucuz oldugu, oznitelik tabanlı HOG yönteminin ise deformasyonlara karsi kismi dayaniklilik sundugu tespiti deneysel olarak test edilmek istenmektedir.
- **Uctan uca egitilen bir Video Transformer modelinde zamansal katmanlardan gelen geri besleme, CNN gombe katmanlarinin uzamsal oznitelik kalitesini dondurulmus oznitelik cikaricilara kiyasla ne ölçude artirir?**
  - Desen: Bir ResNet-50 gombe agi ve Transformer omurgasindan olusan hibrit model, dondurulmus gombe ve uctan uca eğitim modlarinda ayni veri kumesinde egitilecektir. Gombe aginin ara katmanlarindaki oznitelik haritalarinin gradyan analizi ve temsil gucu karşılaştırilarak zamansal geri beslemenin etkisi ölçulecektir.
  - Gerekçe: Yazarlar Bolum 5.1 de, Transformer katmanlarindan gelen uzun vadeli zamansal geri besleme sayesinde gombe aglarinin oznitelik kalitesinin arttigini ve uctan uca egitilen modellerin dondurulmus yapılara kiyasla daha yüksek temsil kapasitesi sundugunu tartismaktadir.

# Kaynak izleri

Her iddia, özgün yayının belirtilen sayfasındaki birebir alıntıya bağlıdır.

| Kanıt | Bölüm | PDF sayfası | Basılı sayfa | Alıntı |
|---|---|---|---|---|
| ev-o-1 | 1 INTRODUCTION | 1 | — | In this survey, we comprehensively analyze advances and limitations of Transformers when considering the particularities of modeling video data. |
| ev-o-4 | ABSTRACT | 1 | — | In this survey, we analyze the main contributions and trends of works leveraging Transformers to model video. |
| ev-s-1 | 1 INTRODUCTION | 1 | — | In this survey, we comprehensively analyze advances and limitations of Transformers when considering the particularities of modeling video data. |
| ev-s-2 | 3.4 Discussion on input pre-processing | 5 | — | Most VTs employ large CNN embeddings to reduce input dimensionality (aiding with data redundancy) and to exploit their ability to produce strong representations (thanks to local in |
| ev-s-3 | 4.4 Discussion on Architecture | 9 | — | Reducing spatial redundancy may be desirable, as it will allow focusing on more relevant parts of the video (e.g., through aggregation or sub-sampling of tokens). |
| ev-s-4 | 6.3 Discussion on performance | 15 | — | Among pre-training strategies, video-based ones, either supervised (e.g., on K400/K600 before fine-tuning SSv2) or self-supervised, are superior to image-based pre-training alone. |
| ev-s-5 | 5.1 Training regime | 10 | — | Empirical studies on both image [144], [145] and video [114] Transformers have consistently found improvements when training Transformers and CNN embedding layers end-to- end. |
| ev-s-6 | 1 INTRODUCTION | 1 | — | In this survey, we analyze the main contributions and trends of works leveraging Transformers to model video. |
| ev-l-1 | Abstract | 1 | — | While there are surveys analyzing the advances of Transformers for vision, none focus on an in-depth analysis of video-specific designs. |
| ev-l-2 | Abstract | 1 | — | Specifically, we delve into how videos are handled at the input level first. Then, we study the architectural changes made to deal with video more efficiently |
| ev-l-3 | 3 INPUT PRE-PROCESSING | 3 | — | In the context of video, embedding often comes before tokenization: a separate network embeds the raw data into a continuous and compact representation |
| ev-l-4 | 4.4 Discussion on Architecture | 9 | — | Reducing spatial redundancy may be desirable, as it will allow focusing on more relevant parts of the video (e.g., through aggregation or sub-sampling of tokens). |

# İlgili kavramlar

- [Türkiye'nin Tarımsal Kredi Performansının K-ortalamalar Kümeleme Algoritması ile Analizi](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/turkiyenin-tarimsal-kredi-performansinin-k-ortalamalar-kumeleme-algoritmasi-ile-analizi.md)
- [Lineament Analizine Dayalı Olarak Almalyk-Angren Sanayi Bölgesinin Sismik Aktivitesinin İncelenmesi](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/lineament-analizine-dayali-olarak-almalyk-angren-sanayi-bolgesinin-sismik-aktivitesinin-incelenmesi.md)
- [Yazılım Geliştirmede Üretken Yapay Zeka Modellerinin Performans ve Güvenilirliği: C# Tabanlı Bir Analiz](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/yazilim-gelistirmede-uretken-yapay-zeka-modellerinin-performans-ve-guvenilirligi-c-tabanli-bir-analiz.md)
- [Dinamik Hareket Uyumlaması İçin İnsan İlhamlı Duyumotor Denetleyici: Mafsallı Robot Kolları Üzerine Bir İnceleme](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/dinamik-hareket-uyumlamasi-icin-insan-ilhamli-duyumotor-denetleyici-mafsalli-robot-kollari-uzerine-bir-inceleme.md)
- [Twitch Platformundaki Nefret Baskınları: Canlı Yayın Topluluklarında Gerçek Zamanlı İnsan-Bot Koordineli Saldırıların Anlaşılması](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/twitch-platformundaki-nefret-baskinlari-canli-yayin-topluluklarinda-gercek-zamanli-insan-bot-koordineli-saldirilarin-anlasilmasi.md)
- [Üretken Yapay Zekanın İlaç Yönetimi Görevlerinde Kullanım Bağlamı Değerlendirme Çerçevesi](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/uretken-yapay-zekanin-ilac-yonetimi-gorevlerinde-kullanim-baglami-degerlendirme-cercevesi.md)
- [Zaman Serisi Tahmini İçin Derin Öğrenme: Model Mimarisi Paradigmaları, Özellik Çıkarımı ve Gelecek Yönelimleri Üzerine Kapsamlı Bir İnceleme](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/zaman-serisi-tahmini-icin-derin-ogrenme-model-mimarisi-paradigmalari-ozellik-cikarimi-ve-gelecek-yonelimleri-uzerine-kapsamli-bir-inceleme.md)
- [Betonarme Yapıların Kentsel Dönüşümünde Hızlı Tarama Parametrelerinin Değerlendirilmesi ve Öneriler](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/betonarme-yapilarin-kentsel-donusumunde-hizli-tarama-parametrelerinin-degerlendirilmesi-ve-oneriler.md)

# Şeffaflık

- Analiz tarihi: 2026-08-12T14:06:59.086Z
- Kanıt sayısı: 12
- Üretim sürümü: makale-analizi-v3.0.0
- Kanonik sayfa: https://makaleanalizi.com/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/video-transformer-modelleri-kapsamli-bir-literatur-taramasi-ve-siniflandirma-calismasi
