Hesaplamalı araştırma makalesi incelemesi
DOI: 10.48550/arxiv.2309.06029Yapay Zeka Destekli Kamuoyu Araştırmasi: Sosyal Medya Verilerinden Temsili Cikarim İçin Yanlilik Duzeltmeli Cok Duzeyli Regresyon
Kamuoyu araştırmalari ve alt ulusal siyasal tercih tahminleri, geleneksel rastgele örnekleme yöntemlerinin artan maliyetleri ve dusen yanit oranlari nedeniyle metodolojik bir kriz yasamaktadir.
Makalenin anahtar kelimeleri
- Yazar
- Roberto Cerina & Raymond Duch
- Yayın
- UvA-DARE (University of Amsterdam)
- Tarih
- 2023-09-12
Makalenin Kapsamı ve Akademik İçeriği
Kamuoyu araştırmalarında geleneksel rastgele telefon aramasi veya temsil edici panel yöntemleri, yüksek maliyetler ve dusen yanit oranlari nedeniyle ciddi kisitlarla karsi karsiya kalmaktadir. Sosyal medya platformlari ve çevrim ici mecralar, yüksek frekansli ve düşük maliyetli veri sunmalarina ragmen, ciddi secim yanliligi ve temsil edici olmayan veri yapisi tasimaktadir. Bu durum, sosyal medya verilerinden hareketle alt ulusal seviyede siyasal tercihler ve kamuoyu egilimleri hakkinda gecerli istatistiksel cikarimlar yapilmasini zorlastirmaktadir. Mevcut Cok Duzeyli Regresyon ve Art-Tabakalastirma (MrP) modelleri, katılım yanliligini kismen duzeltse de assiri derecede yanli ve bagimli değişkene bağlı çevrim ici secim mekanizmalarinda yetersiz kalmaktadir. Bu araştırma, sosyal medyanin temsil gucu zayif veri yapisini metodolojik ve istatistiksel araclarla dönüşturerek guvenilir kamuoyu tahminleri elde etme sorununu ele almaktadir.
Çalışmanın temel amaci, ucuz ve temsil edici olmayan yüksek frekansli sosyal medya verilerinden il duzeyinde temsil kabiliyeti yüksek kamuoyu tahminleri ureten yapay zeka destekli butonlesik bir anket yöntemi geliştirmektir. Araştırmada ilk olarak, bagimli değişken üzerinden secilimin ozel bir bicimi olan çevrim ici secim mekanizmasi tanımlanmis ve lojistik regresyon yapisina King ve Zeng tarzi sapma duzeltme terimi eklenerek yanlilik duzeltmeli MrP modeli kurulmustur. Yöntemin istatistiksel özellikleri kapsayici bir simulasyon çalışmasiyla sinandiktan sonra, 2020 ABD Baskanlik Secimleri süreçinde Twitter akisindan toplanan veriler kullanılmistir. Kullanicilarin sosyo-demografik ve siyasal tutum oznitelikleri GPT-3.5-Turbo buyuk dil modeli aracıligiyla yapilandirilmis anket formatina dönüşturulmus, uretilen etiketler Amazon Mechanical Turk insan değerlendirmecileriyle karşılaştırilmistir. Toplanan veriler Stan ortaminda Bayesci hiyerarsik modelleme ile analiz edilerek eyalet duzeyinde oy oranlari tahmin edilmiştir.
Metodolojik simulasyon ve ampirik uygulama sonuçları, önerilen yapay zeka destekli kamuoyu araştırmasi yaklaşiminin yüksek tahmin doğruluguna ulastigini göstermektedir. Yanlilik duzeltmeli MrP modeli, simulasyon senaryolarinda geleneksel Duzeltilmemis MrP yaklaşimlarina kiyasla Ortalama Karekok Hatasini (RMSE) belirgin sekilde dusurmus ve kapsama oranini artirmistir. 2020 ABD Baskanlik Secimi uygulamasinda, 10 tweet bağlami sağlanan GPT-3.5-Turbo ile etiketlenen Twitter verileri üzerinden yapilan eyalet bazli oy payi tahminleri, FiveThirtyEight gibi ust duzey anket birlestiricileri ve ANES gibi yüksek maliyetli temsil edici örneklemlerle elde edilen sonuçlarla yarisir bir performans sergilemistir. Buyuk dil modelinin kullanicilarin demografik ve siyasal özelliklerini tespit etmedeki basarisi insan değerlendirmecilerle yüksek duzeyde ortusmus, sistem geleneksel telefon tabanlı anketlere gore maliyeti 500 ila 2500 kat arasinda azaltmistir.
Elde edilen bulgular, kamuoyu araştırmalari literatürunde rastgele örnekleme bagimliligini azaltarak hiyerarsik Bayesci modelleme ve yapay zeka veri cikarma tekniklerinin birlestirilmesiyle temsil edici cikarimlar yapilabilecegini kanıtlamaktadir. Yazar, tartisma bolumunde buyuk dil modellerinin veri etiketleme yetenegini geleneksel anket veri toplama yöntemlerinin yerine koymak yerine, ham sosyal medya izlerini yapilandirilmis anket objelerine dönüşturen veri isleme katmani olarak konumlandirmaktadir. Bu çalışma, siyaset bilimi, veri bilimi ve istatistiksel modelleme alanlarinda çalışan araştırmacilar için sosyal medya verileriyle anlik ve düşük maliyetli bölgesel tahmin yapma olanagi sunmaktadir. Gelecek araştırmalar için cok modlu yapay zeka kullanimi, farklı sosyal medya platformlarinin birlesik örneklenmesi ve değişken secimi otomasyonu gibi somut metodolojik geliştirme alanlari tanımlanmaktadir.
Araştırmanın amacı
Bu çalışmanın amaci, sosyal medya verilerinden temsil edici cikarimlar yapmayi sağlayan yapay zeka destekli ve yanlilik duzeltmeli Cok Duzeyli Regresyon ve Art-Tabakalastirma (MrP) metodolojisini geliştirmek ve 2020 ABD Baskanlik Secimi verileriyle doğrulamaktir(Cerina & Duch, 2023).
İnceleme ve modelleme yöntemi
Çalışma, yüksek düzeyde temsil dışı ve çevrim içi seçim yanlılığına sahip sosyal medya verilerinden temsili kamuoyu çıkarımları yapmak amacıyla yapılı Bayesyen Çok Düzeyli Regresyon ve Art-Tabakalaştırma (MrP) yaklaşımını King & Zeng tarzı bir önsel oran offset terimi ile birleştiren ampirik ve yöntemsel bir araştırmadır(Cerina & Duch, 2023).
Kuramsal ve kavramsal çerçeve
Çalışma, Bayesci hiyerarsik modelleme, Cok Duzeyli Regresyon ve Art-Tabakalastirma (MrP) kurami ile King ve Zeng tarafindan geliştirilen niyetlenilmis / eksojen bagimli değişken seciliminde sapma duzeltmesi kuramsal çerçevesine dayanmaktadir.
Makalenin ele aldığı literatür
Araştırma, Lauderdale ve diğerlerinin çevrim ici panellerle yaptigi MrP uygulamalarıni, Wang ve diğerlerinin Xbox verileri üzerindeki alt ulusal tahmin çalışmalarini ve Argyle ve diğerlerinin buyuk dil modelleriyle sentetik anket uretimi yaklaşimlarini ele alarak bunlardaki temsil eksikliklerini ve açıklanamayan veri uretim mekanizmasi sorunlarini tartismaktadir.
Araştırma Tasarımı
- Evren veya inceleme alanı
- 24 Temmuz 2020 ile 3 Kasım 2020 tarihleri arasında Twitter (X) platformundan 'Biden' veya 'Trump' anahtar kelimeleriyle çekilen 492.539 benzersiz kullanıcı ve 3.019.184 tweetlik veri derlemi ile 2020 ABD yetişkin nüfusu tabakalaştırma çerçevesi.
- Örneklem veya araştırma materyali
- Büyük dil modeli (gpt-3.5-turbo) ile analiz edilen 10 tweetlik geniş bağlamlı 4.453 Twitter kullanıcısı ve 5 tweetlik dar bağlamlı 29.276 Twitter kullanıcısı; doğrulama amacıyla 2.492 Amazon Mechanical Turk çalışanı ve insan etiketli 4.293 Twitter kullanıcısı.
- Veri toplama süreci
- Twitter Streaming API ve rtweet R paketi aracılığıyla ABD bölge merkezli coğrafi filtreleme kullanılarak yüksek frekanslı tweet akışı toplanmış; OpenAI API kullanılarak gpt-3.5-turbo modeline profil, isim ve tweet metinleri gönderilip anket yapısında yapılandırılmış veriye dönüştürülmüştür.
- Veri analiz yöntemi
- Stan ve rstan araçlarıyla Hamiltonian Monte Carlo (HMC) tabanlı No-U-Turn Sampler kullanılarak hiyerarşik Bayesyen modelleme uygulanmış; bağımlı değişkene dayalı online seçim yanlılığını düzeltmek için King & Zeng önsel oran offset terimi lojistik regresyon yapısına eklenmiştir.
Araştırmanın Bulguları
King & Zeng mantığıyla geliştirilen offset terimli Bayesyen lojistik MrP modeli, şiddetli çevrim içi seçim yanlılığı altında bile klasik uncorrected MrP modellerine kıyasla mutlak yanlılığı ortalama 0,077 oranında düşürmekte ve RMSE değerini önemli ölçüde azaltmaktadır(Cerina & Duch, 2023).
Geniş bağlamlı (10 tweetlik) gpt-3.5-turbo modeliyle etiketlenen sosyal medya verileri üzerinden üretilen eyalet düzeyindeki oy oranı tahminleri, FiveThirtyEight gibi gelişmiş anket derleyicileriyle aynı düzeyde doğru ve yüksek korelasyonlu sonuçlar vermektedir(Cerina & Duch, 2023).
Büyük dil modelleri (LLMs), sosyal medya kullanıcılarının demografik, sosyo-ekonomik ve siyasi eğilimlerini etiketlemede insan değerlendirmeciler ile çok yüksek düzeyde uyum ve örtüşme sergilemektedir(Cerina & Duch, 2023).
Metin bağlamının genişletilmesi (5 tweet yerine 10 tweet verilmesi) yapay zekanın profil etiketleme niteliğini ve dolayısıyla nihai MrP modelinin tahmin performansını olumlu yönde etkilemektedir(Cerina & Duch, 2023).
Bulguların Tartışılması ve Araştırmanın Sonucu
Bulguların Yazarlar Tarafından Yorumlanışı
Çalışmanın ampirik bulguları, temsil gücü bulunmayan ve çevrim içi katılım mekanizmaları nedeniyle yüksek oranda yanlı olan sosyal medya verilerinin doğru istatistiksel düzeltmelerle yüksek kalitede kamuoyu tahminlerine dönüştürülebileceğini göstermektedir.
Yazarlar bu durumu, büyük dil modellerinin ham metinlerden sosyo-demografik ve siyasal tutum özniteliklerini başarıyla çıkarabilmesi ve King & Zeng tarzı önsel offset teriminin bağımlı değişkene dayalı online seçim yanlılığını etkili şekilde sönümlemesiyle açıklamaktadır.
Tartışma bölümünde literatürdeki Argyle ve arkadaşlarının sentetik veri üretme yaklaşımından farklı olarak, gerçek zamanlı ve sürekli gözlemlenen sosyal medya izlerinin etiketlenmesinin zamansal değişimleri yakalamadaki üstünlüğü vurgulanmaktadır.
Sonuç olarak önerilen yapay zeka destekli kamuoyu araştırması yaklaşımı, seçim anketlerinin yanı sıra toplumsal tutum, tüketici davranışı ve halk sağlığı takibi gibi alanlarda düşük maliyetli ve ölçeklenebilir bir tahmin çerçevesi sunmaktadır.
Bulguların Önceki Araştırmalarla Karşılaştırılması
Argyle ve arkadaşları büyük dil modellerini koşullandırarak sentetik insan örneklemleri üretmeye odaklanırken, bu çalışmada LLM'ler doğrudan sentetik veri üretmek için değil, var olan yüksek frekanslı, ucuz ve temsil gücü düşük ham sosyal medya izlerini anket verisine dönüştürüp etiketlemek amacıyla kullanılmıştır(Cerina & Duch, 2023).
King & Zeng tarafından nadir olaylar ve dışsal örneklem seçimi için geliştirilen önsel oran düzeltmesi mantığı, bu çalışmada sosyal medyadaki bağımlı değişkene dayalı online seçim yanlılığını engellemek üzere Bayesyen MrP lojistik regresyon yapısına entegre edilmiş ve yüksek performans elde edilmiştir(Cerina & Duch, 2023).
Sonuç Bölümünün Sunduğu Çıkarımlar
Yazarlar, yapay zeka destekli kamuoyu araştırması metodolojisinin ucuz, yüksek frekanslı ve temsil dışı sosyal medya verilerinden eyalet düzeyinde yüksek kaliteli kamuoyu tahminleri üretebildiğini ve pre-election kamuoyu araştırmalarının maliyetini geleneksel telefon anketlerine göre 500 ila 2500 kat düşürerek araştırmayı demokratikleştirdiğini sonuçuna varmaktadır(Cerina & Duch, 2023).
Literatür Taraması İçin Sunduğu Çerçeve
Bu çalışma, kamuoyu araştırmalari literatürunde son derece kritik bir islevi yerine getirmektedir. Geleneksel anket yöntemlerinin karsilastigi yüksek maliyet ve düşük yanit orani krizine karsi, sosyal medya gibi düşük maliyetli ve temsili olmayan buyuk veri kaynaklarindan nasıl bilimsel ve guvenilir cikarimlar yapilabilecegini göstermektedir. Geliştirilen yapay zeka destekli anket yöntemi, literatürde veri toplama protokolunun mukemmelligine odaklanan klasik paradigmalari sarsarak, istatistiksel modellemenin ve yanlilik duzeltme algoritmalarinin veri kalitesindeki eksiklikleri telafi edebilecegini ampirik ve teorik olarak ortaya koymaktadir. Boylece sosyal bilimlerde veri demokratiklesmesi süreçine metodolojik bir zemin kazandirmaktadir.
Çalışma, önceki literatürle son derece organik ve genisletici bir ilişki kurmaktadir. Klasik Cok Duzeyli Regresyon ve Art-Tabakalastirma (MrP) modellerinin (Gelman ve Little, 1997; Lax ve Phillips, 2009) sınırlarini, özellikle bagimli değişkene bağlı secilim durumlarinda asmaktadir. Wang ve arkadaslarinin (2015) Xbox çalışmasinda sundugu temsili olmayan buyuk veri yaklaşimini metodolojik olarak bir adim oteye tasimaktadir. King ve Zeng'in (2001) lojistik regresyon çerçevesindeki nadir olaylar için geliştirdigi onsel duzeltme terimini MrP modeline entegre ederek, online katılım yanliligina karsi direncli yeni bir Bayesyen istatistiksel yaklaşim önermektedir. Ayrıca sentetik simulasyon yapan Argyle ve arkadaslarinin (2023) aksine, gercek dijital izleri etiketleyerek literatürde yeni bir yon acmaktadir.
Bu makale, modern kamuoyu araştırma tekniklerine yonelik literatür taramalarina benzersiz bir metodolojik katkı sunmaktadir. Klasik anketor tabanlı anketler ile buyuk dil modellerinin otomatik oznitelik cikarimi yapabilme gucunu birlestiren butunsel bir çerçeve sunmaktadir. Metodoloji incelemelerinde, veri toplama maliyetlerinin 500 ila 2500 kat arasinda nasıl azaltilabilecegine dair somut maliyet-fayda analizleri sunmakta ve geleneksel yöntemlere kiyasla doğrulugu kanıtlanmis alternatif bir yol haritasi cizmektedir. Yanlilik duzeltme mekanizmasinin simulasyon çalışmalariyla desteklenmesi, literatürdeki tahmin modellerinin guvenilirligi konusundaki kuskulari gidermekte ve gelecek araştırmalar için sağlam referans noktalari oluşturmaktadir.
Kaynakça
- Argyle, L. P., Busby, E. C., Fulda, N., Gubler, J. R., Rytting, C., & Wingate, D. (2023). Out of one, many: Using language models to simulate human samples. Political Analysis, 31(3), 337-351.
- King, G., & Zeng, L. (2001). Logistic Regression in Rare Events Data. Political Analysis, 9(2), 137-163.
Tez ve Makale Araştırmalarında Kullanım
Makalenin doğrulanmış yöntemi, bulguları ve kuramsal çerçevesi; tez ve makale çalışmalarında kullanılacağı bölümle birlikte aşağıdaki üç araştırma taslağına dönüştürülmüştür.
Tez veya makalede kullanım · method
Sosyal medya verilerinden temsil edici cikarimlar yapmak için yanlilik duzeltmeli MrP modeli kullanılabilir.
Çalışma, online katılım yanliligini duzeltmek için King & Zeng offset teriminin Bayesyen Cok Duzeyli Regresyon ve Art-Tabakalastirma çerçevesine nasıl basariyla eklenecegini formuller ve Stan kodlari esliginde metodolojik olarak sunmaktadir(Cerina & Duch, 2023).
Turkiye Siyasal Tercihlerinin Twitter Verileri Üzerinden Yapay Zeka Yardimiyla Izlenmesi
- Araştırma sorusu
- Turkiye'deki Twitter kullanicilarinin paylasimlarindan elde edilen oy tercihleri, yanlilik duzeltmeli MrP yöntemiyle il duzeyinde ne derece doğru tahmin edilebilir?
- Yöntem taslağı
- Twitter API üzerinden belirli anahtar kelimeler kullanılarak genis bir tweet havuzu toplanacaktir. Turkce buyuk dil modelleri kullanılarak profillerin demografik ve oy tercihleri etiketlenecektir. Elde edilen veriler, TUIK nufus tabakalandirma matrisine gore yanlilik duzeltmeli Bayesyen MrP ile analiz edilecektir.
Makaleyle bağlantısı: Makalede sunulan, unrepresentative Twitter verilerinden King & Zeng tarzi bias-corrected MrP modeli ile eyalet bazinda yüksek doğrulukta tahmin uretme metodolojisine ve bu modelin temsil edilmeyen gruplari nufus duzeyinde temsil etme yetenege dayanmaktadir(Cerina & Duch, 2023).
Tez veya makalede kullanım · Kavramsal çerçeve
Buyuk dil modelleri insan kodlayicilar kadar basarili sekilde sosyal medya profil verilerini etiketleyebilir.
Yazarlar, gpt-3.5-turbo modelinin Twitter kullanicilarinin demografik, sosyo-ekonomik ve politik özelliklerini etiketlemede insan kodlayicilar ile cok yüksek oranda uyum sergiledigini ampirik olarak ortaya koymustur(Cerina & Duch, 2023).
Buyuk Dil Modellerinin Siyasal Tutum Etiketleme Performansinin Insan Kodlayicilarla Karşılaştırilmasi
- Araştırma sorusu
- Turkce siyasi tweet atan kullanicilarin sosyo-demografik ve ideolojik özelliklerini etiketlemede GPT-4 ve insan kodlayicilar arasindaki uyum duzeyi nedir?
- Yöntem taslağı
- Rastgele secilen 1000 Turkce Twitter kullanicisinin son 10 paylasimi hem eğitimli insan kodlayicilara hem de buyuk dil modeline etiketletilecektir. Kodlayicilar arasi uyum, makaledeki Bayesyen Poisson karmasik modeli ve klasik Cohen's Kappa ile analiz edilecektir.
Makaleyle bağlantısı: Makaledeki, gpt-3.5-turbo'nun insan kodlayicilarla demografik ve siyasal etiketlemede broad agreement gösterdiğini kanıtlayan ve bu uyumu Bayesyen ag analiziyle inceleyen doğrulanmis metodolojiye dayanmaktadir(Cerina & Duch, 2023).
Tez veya makalede kullanım · Tartışma
Temsil kabiliyeti düşük örneklemlerden yapilan MrP tahminleri, veri miktarindan ziyade istatistiksel model iyilestirmelerine bağlıdir.
Çalışma, veri toplama protokolundeki eksikliklerin veya temsil disi örneklem yapilarinin, veri hacmini artirmak yerine istatistiksel modelleme iyilestirmeleri ve yanlilik duzeltmeleriyle basarili sekilde telafi edilebilecegini göstermektedir(Cerina & Duch, 2023).
Çevrim Ici Tuketici Yorumlarindan Temsili Marka Tercihi Cikarimi
- Araştırma sorusu
- Sosyal medyada paylasilan marka yorumlarindan elde edilen tuketici memnuniyeti, katılım yanliligi duzeltilmis MrP modeli ile ulke genelinde temsili sekilde raporlanabilir mi?
- Yöntem taslağı
- Belirli sektörlerdeki çevrim ici yorumlar buyuk dil modelleriyle demografik kategorilere gore etiketlenecektir. Tuketicilerin online ortamlara secilim orani, pazar payi tabakalari kullanılarak offset-terimli Bayesyen modelle sonumlenecektir.
Makaleyle bağlantısı: Yazarlarin, katılımcıların çevrim ici platformlara katilma dürtüsunun getirdigi 'online selection penalty' kavramini King & Zeng bias correction ile cozme yaklaşimina ve bu yöntemin pazar araştırmalarina uyarlanabilirligine dayanmaktadir(Cerina & Duch, 2023).