Kamuoyu araştırmalarında geleneksel rastgele telefon aramasi veya temsil edici panel yöntemleri, yüksek maliyetler ve dusen yanit oranlari nedeniyle ciddi kisitlarla karsi karsiya kalmaktadir. Sosyal medya platformlari ve çevrim ici mecralar, yüksek frekansli ve düşük maliyetli veri sunmalarina ragmen, ciddi secim yanliligi ve temsil edici olmayan veri yapisi tasimaktadir. Bu durum, sosyal medya verilerinden hareketle alt ulusal seviyede siyasal tercihler ve kamuoyu egilimleri hakkinda gecerli istatistiksel cikarimlar yapilmasini zorlastirmaktadir. Mevcut Cok Duzeyli Regresyon ve Art-Tabakalastirma (MrP) modelleri, katılım yanliligini kismen duzeltse de assiri derecede yanli ve bagimli değişkene bağlı çevrim ici secim mekanizmalarinda yetersiz kalmaktadir. Bu araştırma, sosyal medyanin temsil gucu zayif veri yapisini metodolojik ve istatistiksel araclarla dönüşturerek guvenilir kamuoyu tahminleri elde etme sorununu ele almaktadir.
Çalışmanın temel amaci, ucuz ve temsil edici olmayan yüksek frekansli sosyal medya verilerinden il duzeyinde temsil kabiliyeti yüksek kamuoyu tahminleri ureten yapay zeka destekli butonlesik bir anket yöntemi geliştirmektir. Araştırmada ilk olarak, bagimli değişken üzerinden secilimin ozel bir bicimi olan çevrim ici secim mekanizmasi tanımlanmis ve lojistik regresyon yapisina King ve Zeng tarzi sapma duzeltme terimi eklenerek yanlilik duzeltmeli MrP modeli kurulmustur. Yöntemin istatistiksel özellikleri kapsayici bir simulasyon çalışmasiyla sinandiktan sonra, 2020 ABD Baskanlik Secimleri süreçinde Twitter akisindan toplanan veriler kullanılmistir. Kullanicilarin sosyo-demografik ve siyasal tutum oznitelikleri GPT-3.5-Turbo buyuk dil modeli aracıligiyla yapilandirilmis anket formatina dönüşturulmus, uretilen etiketler Amazon Mechanical Turk insan değerlendirmecileriyle karşılaştırilmistir. Toplanan veriler Stan ortaminda Bayesci hiyerarsik modelleme ile analiz edilerek eyalet duzeyinde oy oranlari tahmin edilmiştir.
Metodolojik simulasyon ve ampirik uygulama sonuçları, önerilen yapay zeka destekli kamuoyu araştırmasi yaklaşiminin yüksek tahmin doğruluguna ulastigini göstermektedir. Yanlilik duzeltmeli MrP modeli, simulasyon senaryolarinda geleneksel Duzeltilmemis MrP yaklaşimlarina kiyasla Ortalama Karekok Hatasini (RMSE) belirgin sekilde dusurmus ve kapsama oranini artirmistir. 2020 ABD Baskanlik Secimi uygulamasinda, 10 tweet bağlami sağlanan GPT-3.5-Turbo ile etiketlenen Twitter verileri üzerinden yapilan eyalet bazli oy payi tahminleri, FiveThirtyEight gibi ust duzey anket birlestiricileri ve ANES gibi yüksek maliyetli temsil edici örneklemlerle elde edilen sonuçlarla yarisir bir performans sergilemistir. Buyuk dil modelinin kullanicilarin demografik ve siyasal özelliklerini tespit etmedeki basarisi insan değerlendirmecilerle yüksek duzeyde ortusmus, sistem geleneksel telefon tabanlı anketlere gore maliyeti 500 ila 2500 kat arasinda azaltmistir.
Elde edilen bulgular, kamuoyu araştırmalari literatürunde rastgele örnekleme bagimliligini azaltarak hiyerarsik Bayesci modelleme ve yapay zeka veri cikarma tekniklerinin birlestirilmesiyle temsil edici cikarimlar yapilabilecegini kanıtlamaktadir. Yazar, tartisma bolumunde buyuk dil modellerinin veri etiketleme yetenegini geleneksel anket veri toplama yöntemlerinin yerine koymak yerine, ham sosyal medya izlerini yapilandirilmis anket objelerine dönüşturen veri isleme katmani olarak konumlandirmaktadir. Bu çalışma, siyaset bilimi, veri bilimi ve istatistiksel modelleme alanlarinda çalışan araştırmacilar için sosyal medya verileriyle anlik ve düşük maliyetli bölgesel tahmin yapma olanagi sunmaktadir. Gelecek araştırmalar için cok modlu yapay zeka kullanimi, farklı sosyal medya platformlarinin birlesik örneklenmesi ve değişken secimi otomasyonu gibi somut metodolojik geliştirme alanlari tanımlanmaktadir.
Araştırma Tasarımı
- Evren veya inceleme alanı
- 24 Temmuz 2020 ile 3 Kasım 2020 tarihleri arasında Twitter (X) platformundan 'Biden' veya 'Trump' anahtar kelimeleriyle çekilen 492.539 benzersiz kullanıcı ve 3.019.184 tweetlik veri derlemi ile 2020 ABD yetişkin nüfusu tabakalaştırma çerçevesi.
- Örneklem veya araştırma materyali
- Büyük dil modeli (gpt-3.5-turbo) ile analiz edilen 10 tweetlik geniş bağlamlı 4.453 Twitter kullanıcısı ve 5 tweetlik dar bağlamlı 29.276 Twitter kullanıcısı; doğrulama amacıyla 2.492 Amazon Mechanical Turk çalışanı ve insan etiketli 4.293 Twitter kullanıcısı.
- Veri toplama süreci
- Twitter Streaming API ve rtweet R paketi aracılığıyla ABD bölge merkezli coğrafi filtreleme kullanılarak yüksek frekanslı tweet akışı toplanmış; OpenAI API kullanılarak gpt-3.5-turbo modeline profil, isim ve tweet metinleri gönderilip anket yapısında yapılandırılmış veriye dönüştürülmüştür.
- Veri analiz yöntemi
- Stan ve rstan araçlarıyla Hamiltonian Monte Carlo (HMC) tabanlı No-U-Turn Sampler kullanılarak hiyerarşik Bayesyen modelleme uygulanmış; bağımlı değişkene dayalı online seçim yanlılığını düzeltmek için King & Zeng önsel oran offset terimi lojistik regresyon yapısına eklenmiştir.
Yapay Zeka Destekli Kamuoyu Araştırması (AI Polling)Çok Düzeyli Regresyon ve Art-Tabakalaştırma (MrP)Online Seçim Yanlılığı (Online Selection)King & Zeng Yanlılık DüzeltmesiBüyük Dil Modelleri (LLMs)gpt-3.5-turboYapılandırılmamış Sosyal Medya Verisi
01King & Zeng mantığıyla geliştirilen offset terimli Bayesyen lojistik MrP modeli, şiddetli çevrim içi seçim yanlılığı altında bile klasik uncorrected MrP modellerine kıyasla mutlak yanlılığı ortalama 0,077 oranında düşürmekte ve RMSE değerini önemli ölçüde azaltmaktadır(Cerina & Duch, 2023).
02Geniş bağlamlı (10 tweetlik) gpt-3.5-turbo modeliyle etiketlenen sosyal medya verileri üzerinden üretilen eyalet düzeyindeki oy oranı tahminleri, FiveThirtyEight gibi gelişmiş anket derleyicileriyle aynı düzeyde doğru ve yüksek korelasyonlu sonuçlar vermektedir(Cerina & Duch, 2023).
03Büyük dil modelleri (LLMs), sosyal medya kullanıcılarının demografik, sosyo-ekonomik ve siyasi eğilimlerini etiketlemede insan değerlendirmeciler ile çok yüksek düzeyde uyum ve örtüşme sergilemektedir(Cerina & Duch, 2023).
04Metin bağlamının genişletilmesi (5 tweet yerine 10 tweet verilmesi) yapay zekanın profil etiketleme niteliğini ve dolayısıyla nihai MrP modelinin tahmin performansını olumlu yönde etkilemektedir(Cerina & Duch, 2023).