Makine öğrenimi yöntemlerinin biyotıp ve veri bilimi araştırmalarında yaygınlaşması, güvenilir model kestirimleri için ne kadarlık bir örneklem büyüklüğünün yeterli olduğu sorusunu gündeme getirmiştir. Geleneksel istatistiksel güç analizi ve etki büyüklüğü formülleri, genellikle geçmiş çalışmalardan alınan ortalama ve varyans değerlerine dayandığından yayın yanlılığı ve deneysel detay eksikliği nedeniyle makine öğrenimi senaryolarında yetersiz kalmaktadır. Küçük örneklemler veri kümesindeki gürültüden etkilenerek aşırı öğrenmeye (overfitting) ve yapay yüksek doğruluk oranlarına yol açarken, gereğinden fazla büyük örneklemler ise yüksek hesaplama maliyeti ve kaynak israfına sebep olmaktadır. Bu bağlamda araştırma, makine öğrenimi sınıflandırıcılarının başarımı ile veri kümesinin ortalama ve genel etki büyüklükleri arasındaki dinamik ilişkiyi çözümlemeyi odak noktasına almaktadır.
Araştırmanın temel amacı, makine öğrenimi uygulamalarında karar verilen örneklem büyüklüğünün yeterliliğini değerlendirmek üzere istatistiksel etki büyüklüğü ile sınıflandırma başarımını birleştiren objektif kriterler ortaya koymaktır. Yazar kadrosu bu doğrultuda 16 ile 2500 arasında değişen örneklem boyutlarında simüle edilmiş veri kümeleri ile aritmik kalp ritmi (arrhythmia), kalp krizi (heart attack) ve uyku düzeni olmak üzere üç farklı gerçek biyotıp verisini incelemiştir. Destek vektör makineleri (SVM), lojistik regresyon (LR), karar ağaçları (DT), yapay sınır ağları (NN) ve Naive Bayes (NB) olmak üzere beş farklı sınıflandırıcı algoritması kullanılmış, modellerin doğruluğu ve kararlılığı 10 katlı çapraz doğrulama yöntemi ile 100 iterasyon boyunca sınanmıştır.
Elde edilen deneysel bulgular, iki sınıfı ayırma gücü yüksek (etki büyüklüğü en az 0,5 olan) iyi nitelikli veri kümelerinde örneklem boyutu arttıkça sınıflandırma doğruluğunun arttığını ve etki büyüklüğündeki varyansın azalarak kararlı bir platoya ulaştığını göstermektedir. Aritmi ve kalp krizi veri kümelerinde sınıflandırma doğruluğu yüzde 80 eşiğini aşarken, ortalama ve genel etki büyüklükleri arasındaki farkın tespit edilmesi örneklem değerlendirmesindeki taraflılığı önlemiştir. Belirsiz özellikler taşıyan uyku veri kümesinde ise örneklem boyutu 1500 seviyesine çıkarılsa dahi başarım yüzde 70'in altında kalmış ve etki büyüklüğü düşmeye devam etmiştir. Buradan hareketle çalışma, bir örneklemin uygun sayılması için en az 0,5 etki büyüklüğü ve en az yüzde 80 makine öğrenimi doğruluğu sağlanması gerektiğini kanıtlamıştır.
Tartışma ve sonuç bölümünde vurgulandığı üzere, kritik bir örneklem eşiğine ulaşıldıktan sonra örneklem sayısını daha fazla artırmak sınıflandırma başarımında ve etki büyüklüğünde anlamlı bir iyileşme sağlamamakta, yalnızca maliyeti artırmaktadır. Çalışmanın literatüre sağladığı temel katkı, geçmiş araştırmaların taraflı parametrelerine bağımlı kalmaksızın mevcut veri üzerinden hem ortalama hem de genel etki büyüklüğünü makine öğrenimi doğruluğuyla entegre eden iki aşamalı pratik bir değerlendirme çerçevesi sunmasıdır. Araştırmacılar ve hakemler için geliştirilen bu kriterler, veri toplama süreçlerinde maliyet-etkinlik dengesini kurmaya yardımcı olmakta ve ampirik çalışmalarda örneklem yeterliliğinin metodolojik olarak doğrulanmasını kolaylaştırmaktadır.
Araştırma Tasarımı
- Evren veya inceleme alanı
- Makine öğrenimi tabanlı biyotıp ve sağlık bilgi sistemleri uygulamaları ile klinik teşhis araştırmaları.
- Örneklem veya araştırma materyali
- Simüle edilmiş 16-2500 örneklemli veri kümeleri; UCI Machine Learning Repository'den alınan 276 hastaya ait 14 öznitelikli kalp krizi verisi, PhysioNet'ten alınan 5000 kalp atımı içeren MIT-BIH Aritmi verisi ve 120 kadın uyku günlüğünden elde edilen 3000 örneklemli uyku veri kümesi.
- Veri toplama süreci
- Aritmi ve kalp krizi verileri açık erişimli PhysioNet ve UCI Machine Learning veri tabanlarından; uyku verileri bir aylık süreçte tutulan 120 kadın uyku günlüğünden derlenmiş, simüle veriler ise ortalama ve varyans parametreleri değiştirilerek denklem temelinde üretilmiştir.
- Veri analiz yöntemi
- 10 katlı çapraz doğrulama ile desteklenen 5 farklı makine öğrenimi algoritmasının (SVM, LR, DT, NN, NB) sınıflandırma başarımları hesaplanmış; ortalama ve genel Cohen d etki büyüklükleri formüle edilerek 100 tekrarlı rastgele örnekleme simülasyonlarıyla analiz edilmiştir.
Örneklem BüyüklüğüOrtalama Etki BüyüklüğüGenel Etki BüyüklüğüSınıflandırma DoğruluğuAşırı Öğrenme (Overfitting)Çapraz Doğrulama
01İyi ayırt etme gücüne ve yüksek etki büyüklüğüne (0.5 ve üzeri) sahip veri kümelerinde, örneklem büyüklüğü arttıkça makine öğrenimi modellerinin doğruluk oranları artmakta ve etki büyüklüklerindeki varyans belirgin şekilde daralmaktadır(Rajput et al., 2023).
02Ayırt etme gücü zayıf ve etki büyüklüğü düşük olan belirsiz veri kümelerinde, örneklem büyüklüğünün artırılması sınıflandırma doğrusallığını ve modellerin başarısını iyileştirmemekte, doğruluk oranı %70'in altında kalmaktadır(Rajput et al., 2023).
03Düşük örneklem büyüklüklerinde (16-64 arası) rastgele örnekleme etkisinden dolayı etki büyüklüğü ve doğruluk değerlerinde yüksek varyans ve dalgalanmalar gözlenirken, kritik bir örneklem eşiğinden sonra performans plato seviyesine ulaşmaktadır(Rajput et al., 2023).
04Kalp krizi gibi veri kümelerinde ortalama ve genel etki büyüklükleri arasında belirgin farklılıklar bulunmaktadır; bu durum ortalama ve genel hesaplamaların birlikte değerlendirilmesinin önemini ortaya koymaktadır(Rajput et al., 2023).