---
type: "Akademik Makale Analizi"
title: "Makine Öğrenimi Uygulamalarında Karar Verilen Örneklem Büyüklüğünün Değerlendirilmesi"
description: "Makine öğrenimi çalışmalarında yetersiz örneklem büyüklüğü veride aşırı öğrenmeye (overfitting) ve gerçek etkilerin tespit edilememesine yol açarken, aşırı büyük örneklemler yüksek maliyet ve zaman kaybına sebep olmaktadır. Geleneksel istatistiksel yaklaşımlar (etki büyüklüğü, ortalama fark, istatis"
resource: "https://makaleanalizi.com/sosyal-bilimler/egitim-bilimleri/makine-ogrenimi-uygulamalarinda-karar-verilen-orneklem-buyuklugunun-degerlendirilmesi"
doi: "10.1186/s12859-023-05156-9"
authors: ["Daniyal Rajput", "Wei-Jen Wang", "Chun‐Chuan Chen"]
citation: "Rajput, D., Wang, W., Chen, C. (2023). Evaluation of a decided sample size in machine learning applications. BMC Bioinformatics, 24(1), 48-48. https://doi.org/10.1186/s12859-023-05156-9"
publicationType: "quantitative-empirical"
discipline: "Sosyal Bilimler"
subDiscipline: "Eğitim Bilimleri"
evidenceCount: 9
tags: ["Örneklem büyüklüğü", "Makine öğrenimi", "Etki büyüklükleri", "Kriterler"]
timestamp: "2026-08-15T09:05:50.597Z"
---

# Makine Öğrenimi Uygulamalarında Karar Verilen Örneklem Büyüklüğünün Değerlendirilmesi

Özgün başlık: Evaluation of a decided sample size in machine learning applications
DOI: https://doi.org/10.1186/s12859-023-05156-9
Künye (APA 7): Rajput, D., Wang, W., Chen, C. (2023). Evaluation of a decided sample size in machine learning applications. BMC Bioinformatics, 24(1), 48-48. https://doi.org/10.1186/s12859-023-05156-9

Bilim alanı: [Sosyal Bilimler](/okf/sosyal-bilimler/index.md) › Eğitim Bilimleri

# Alan bağlamı

Makine öğrenimi çalışmalarında yetersiz örneklem büyüklüğü veride aşırı öğrenmeye (overfitting) ve gerçek etkilerin tespit edilememesine yol açarken, aşırı büyük örneklemler yüksek maliyet ve zaman kaybına sebep olmaktadır. Geleneksel istatistiksel yaklaşımlar (etki büyüklüğü, ortalama fark, istatistiksel güç) standart sapma ve etki büyüklüğü hesaplamalarındaki hatalar veya yayın yanlılığı nedeniyle makine öğrenimi modelleri için taraflı sonuçlar verebilmektedir. Alanın temel tartışması, makine öğrenimi sınıflandırıcılarının performansı ile veri kümesinin istatistiksel etki büyüklüğü arasındaki ilişkiyi eş zamanlı dikkate alan pratik bir örneklem değerlendirme standardının bulunmamasıdır.

# Akademik özet

Makine öğrenimi yöntemlerinin biyotıp ve veri bilimi araştırmalarında yaygınlaşması, güvenilir model kestirimleri için ne kadarlık bir örneklem büyüklüğünün yeterli olduğu sorusunu gündeme getirmiştir. Geleneksel istatistiksel güç analizi ve etki büyüklüğü formülleri, genellikle geçmiş çalışmalardan alınan ortalama ve varyans değerlerine dayandığından yayın yanlılığı ve deneysel detay eksikliği nedeniyle makine öğrenimi senaryolarında yetersiz kalmaktadır. Küçük örneklemler veri kümesindeki gürültüden etkilenerek aşırı öğrenmeye (overfitting) ve yapay yüksek doğruluk oranlarına yol açarken, gereğinden fazla büyük örneklemler ise yüksek hesaplama maliyeti ve kaynak israfına sebep olmaktadır. Bu bağlamda araştırma, makine öğrenimi sınıflandırıcılarının başarımı ile veri kümesinin ortalama ve genel etki büyüklükleri arasındaki dinamik ilişkiyi çözümlemeyi odak noktasına almaktadır.

Araştırmanın temel amacı, makine öğrenimi uygulamalarında karar verilen örneklem büyüklüğünün yeterliliğini değerlendirmek üzere istatistiksel etki büyüklüğü ile sınıflandırma başarımını birleştiren objektif kriterler ortaya koymaktır. Yazar kadrosu bu doğrultuda 16 ile 2500 arasında değişen örneklem boyutlarında simüle edilmiş veri kümeleri ile aritmik kalp ritmi (arrhythmia), kalp krizi (heart attack) ve uyku düzeni olmak üzere üç farklı gerçek biyotıp verisini incelemiştir. Destek vektör makineleri (SVM), lojistik regresyon (LR), karar ağaçları (DT), yapay sınır ağları (NN) ve Naive Bayes (NB) olmak üzere beş farklı sınıflandırıcı algoritması kullanılmış, modellerin doğruluğu ve kararlılığı 10 katlı çapraz doğrulama yöntemi ile 100 iterasyon boyunca sınanmıştır.

Elde edilen deneysel bulgular, iki sınıfı ayırma gücü yüksek (etki büyüklüğü en az 0,5 olan) iyi nitelikli veri kümelerinde örneklem boyutu arttıkça sınıflandırma doğruluğunun arttığını ve etki büyüklüğündeki varyansın azalarak kararlı bir platoya ulaştığını göstermektedir. Aritmi ve kalp krizi veri kümelerinde sınıflandırma doğruluğu yüzde 80 eşiğini aşarken, ortalama ve genel etki büyüklükleri arasındaki farkın tespit edilmesi örneklem değerlendirmesindeki taraflılığı önlemiştir. Belirsiz özellikler taşıyan uyku veri kümesinde ise örneklem boyutu 1500 seviyesine çıkarılsa dahi başarım yüzde 70'in altında kalmış ve etki büyüklüğü düşmeye devam etmiştir. Buradan hareketle çalışma, bir örneklemin uygun sayılması için en az 0,5 etki büyüklüğü ve en az yüzde 80 makine öğrenimi doğruluğu sağlanması gerektiğini kanıtlamıştır.

Tartışma ve sonuç bölümünde vurgulandığı üzere, kritik bir örneklem eşiğine ulaşıldıktan sonra örneklem sayısını daha fazla artırmak sınıflandırma başarımında ve etki büyüklüğünde anlamlı bir iyileşme sağlamamakta, yalnızca maliyeti artırmaktadır. Çalışmanın literatüre sağladığı temel katkı, geçmiş araştırmaların taraflı parametrelerine bağımlı kalmaksızın mevcut veri üzerinden hem ortalama hem de genel etki büyüklüğünü makine öğrenimi doğruluğuyla entegre eden iki aşamalı pratik bir değerlendirme çerçevesi sunmasıdır. Araştırmacılar ve hakemler için geliştirilen bu kriterler, veri toplama süreçlerinde maliyet-etkinlik dengesini kurmaya yardımcı olmakta ve ampirik çalışmalarda örneklem yeterliliğinin metodolojik olarak doğrulanmasını kolaylaştırmaktadır.

# Araştırmanın amacı

Bu çalışmanın amacı, simüle edilmiş ve gerçek veri kümeleri üzerinde makine öğrenimi sınıflandırıcılarının performansı ile genel ve ortalama etki büyüklükleri arasındaki ilişkiyi inceleyerek makine öğrenimi araştırmalarında belirlenen örneklem büyüklüğünü değerlendirmeye yönelik pratik kriterler geliştirmektir.

# Yöntem ve tasarım

Çalışmada, makine öğrenimi modellerinde örneklem büyüklüğünün performans ve etki büyüklükleri üzerindeki etkisini değerlendirmek amacıyla simüle edilmiş veri kümeleri ile aritmi, kalp krizi ve uyku durumlarını içeren üç farklı gerçek veri kümesi kullanılarak deneysel ve nicel bir simülasyon yaklaşımı benimsenmiştir.

# Bulgular ve önermeler

1. İyi ayırt etme gücüne ve yüksek etki büyüklüğüne (0.5 ve üzeri) sahip veri kümelerinde, örneklem büyüklüğü arttıkça makine öğrenimi modellerinin doğruluk oranları artmakta ve etki büyüklüklerindeki varyans belirgin şekilde daralmaktadır.
2. Ayırt etme gücü zayıf ve etki büyüklüğü düşük olan belirsiz veri kümelerinde, örneklem büyüklüğünün artırılması sınıflandırma doğrusallığını ve modellerin başarısını iyileştirmemekte, doğruluk oranı %70'in altında kalmaktadır.
3. Düşük örneklem büyüklüklerinde (16-64 arası) rastgele örnekleme etkisinden dolayı etki büyüklüğü ve doğruluk değerlerinde yüksek varyans ve dalgalanmalar gözlenirken, kritik bir örneklem eşiğinden sonra performans plato seviyesine ulaşmaktadır.
4. Kalp krizi gibi veri kümelerinde ortalama ve genel etki büyüklükleri arasında belirgin farklılıklar bulunmaktadır; bu durum ortalama ve genel hesaplamaların birlikte değerlendirilmesinin önemini ortaya koymaktadır.

# Yazarın tartışması

Yapılan simülasyon ve gerçek veri analizleri, makine öğrenimi modellerinde sınıflandırma performansının doğrudan verinin taşıdığı etki büyüklüğü ve veri kalitesiyle ilişkili olduğunu göstermektedir. Etki büyüklüğü 0.5'in üzerinde olan veri kümelerinde sınıflandırıcılar %80'in üzerinde yüksek doğruluk oranlarına ulaşırken, etki büyüklüğü düşük ve belirsiz verilerde örneklem sayısını artırmak model başarısını artırmamakta, aksine doğruluk düşük seviyelerde kalmaktadır.

Yazarlar, bu durumu verinin ayırt etme gücü ve rastgele örnekleme dalgalanmaları ile açıklamaktadır. Küçük örneklem boyutlarında (16-64 arası) rastgele örnekleme varyansı son derece yüksek olduğundan başarım değerleri aşırı öğrenme veya yapay dalgalanmalar gösterebilmektedir; fakat verinin kalitesi ve etki büyüklüğü yüksekse, belirlenen kritik örneklem eşiğinden sonra model doğruluğu plato seviyesine oturmakta ve kararlı bir çizgiye kavuşmaktadır.

Elde edilen bu bulgular, literatürdeki örneklem belirleme yaklaşımlarıyla karşılaştırıldığında önemli yenilikler sunmaktadır. Literatürde Button ve arkadaşlarının vurguladığı küçük örneklemlerdeki yanlılık ve yayın kusurları ile Friston'ın önerdiği minimum 16 örneklem eşiği bağlamında, bu çalışma literatürden alınan geçmiş parametrelere bağımlı kalmadan doğrudan mevcut veri üzerinden hem ortalama hem de genel etki büyüklüklerinin ayrı ayrı hesaplanması gerektiğini kanıtlamıştır.

Sonuç olarak yazarlar, araştırmacılar ve dergi editörleri için pratik bir değerlendirme çerçevesi çizmektedir. Karar verilen örneklem büyüklüğünün yeterli sayılabilmesi için etki büyüklüğünün en az 0.5 ve doğruluk oranının en az %80 olması gerektiği; bu koşullar sağlandıktan sonra yapılan örneklem artışlarının %10'dan az değişim yaratarak doyum noktasına ulaştığı ve gereksiz maliyet oluşturduğu vurgulanmaktadır.

# Yazarın sonucu

Yazarlar, makine öğrenimi uygulamalarında karar verilen bir örneklem büyüklüğünün yeterliliğini değerlendirmek için iki temel kriter önermektedir: Birincisi, verinin ortalama veya genel etki büyüklüklerinden en az birinin Cohen ölçeğine göre 0.5 ve üzerinde olması; ikincisi ise makine öğrenimi sınıflandırma doğruluğunun en az %80 seviyesine ulaşması ve örneklem artışıyla doğruluktaki değişimin %10'un altına düşmesidir. Bu eşikler aşıldıktan sonra örneklem sayısını artırmak modele ek bir yarar sağlamamakta ve maliyet-etkinliği düşürmektedir.

# Literatürdeki işlevi

Bu çalışma, makine öğrenimi uygulamalarında örneklem büyüklüğünün yeterliliğini değerlendirmek üzere metodolojik bir standart ve pratik bir değerlendirme çerçevesi sunmaktadır. Biyotıp ve sağlık bilişimi literatüründe sıklıkla karşılaşılan yetersiz örneklem büyüklüğünden kaynaklı veri aşırı öğrenmesi (overfitting) ve yapay yüksek doğruluk oranları ile aşırı büyük örneklemlerin getirdiği yüksek finansal/zamansal maliyetler arasındaki dengesizliği hedef almaktadır. Geleneksel güç analizi yöntemlerinin geçmiş literatürden aktarılan parametreler sebebiyle taşıdığı yanlılıkları aşmak amacıyla, doğrudan mevcut veri kümesinin ortalama ve genel etki büyüklükleri ile sınıflandırma performansını bir arada değerlendiren iki temel kriter tanımlayarak metodolojik literatürde karar destek edici bir işlev üstlenmektedir.

Önceki çalışmalarla ilişkisi: Çalışma, literatürde küçük örneklemlerin istatistiksel güç yetersizliği ve yapay etki şişkinliğine yol açtığını savunan Button ve arkadaşlarının (2013) teorik eleştirileri ile Friston'ın (2012) minimum 16 denekli örneklem önerisini temellendirmektedir. Buna karşın, geleneksel etki büyüklüğü formüllerinde ortalama ve genel değerler arasındaki farkın göz ardı edilmesini eleştirmekte ve verinin ayırt etme gücünü bu iki etki büyüklüğü türünü ayrı ayrı hesaplayarak genişletmektedir. Vabalas ve arkadaşlarının (2019) küçük örneklemlerde sınıflandırıcı performansının aşırı yüksek çıkabileceği yönündeki bulgularını doğrulamakla birlikte, verinin kalitesi ve etki büyüklüğü yüksek olduğunda plato seviyesine ulaşan kritik örneklem eşiğini ampirik olarak kanıtlayarak önceki çalışmalardan ayrılmaktadır.

Literatür taramasına katkısı: Literatür taraması yapacak araştırmacılar için bu eser, makine öğrenimi modellerinde örneklem büyüklüğünün yalnız denek sayısı üzerinden değil, verinin ayırt edici gücü ve etki büyüklüğü ile birlikte değerlendirilmesi gerektiğini gösteren metodolojik bir mihenk taşıdır. Sağlık verileri ve biyoinformatik uygulamalarında yapılan sınıflandırma çalışmalarının geçerliliğini ve tekrarlanabilirliğini sörgülamak için somut ölçütler sunmaktadır. Araştırmacıların literatürdeki yöntemsel yaklaşımları sentezlerken verinin etki büyüklüğü (>= 0.5) ve model doğruluğu (>= %80) ilişkisini metodolojik bir filtre olarak kullanmalarına olanak tanımaktadır.

# Tez ve makale araştırmalarında kullanım

- **Makine öğrenimi çalışmalarında belirlenen örneklem büyüklüğünün yeterliliği verinin etki büyüklüğü ve model doğruluğu ile değerlendirilmelidir.** — Tez veya makalenin yöntem bölümünde örneklem büyüklüğünün nasıl kararlaştırıldığını gerekçelendirirken ve seçilen örneklemin yeterliliğini savunurken kullanılır.
- **Veri kümesinin ortalama veya genel etki büyüklüğünün 0.5 ve üzerinde olması model başarısı için gereklidir.** — Araştırma verilerinin önişleme ve öznitelik seçimi aşamalarında, veri kümesinin ayırt etme gücünü test etmek için normatif bir eşik değer olarak başvurulur.
- **Örneklem büyüklüğü arttıkça doğruluk oranındaki değişim %10'un altına düştüğünde ek örneklem toplamak modele anlamlı katkı sağlamaz.** — Tartışma bölümünde elde edilen model başarımının doyum noktasına ulaştığını ve ek veri toplamanın maliyet-etkin olmadığını savunmak için kullanılır.

# Türetilebilir araştırma soruları

- **EKG sinyallerinden aritmi tespiti yapan derin öğrenme modellerinde, kademeli olarak artırılan örneklem büyüklüklerinin ortalama ve genel etki büyüklükleri ile model performansına etkisi nedir?**
  - Desen: Açık erişimli EKG veri kümelerinden rastgele örnekleme ile 16'dan başlayarak kademeli örneklem grupları oluşturulacak; destek vektör makineleri ve derin sınır ağlarının sınıflandırma doğrulukları ile etki büyüklükleri 10 katlı çapraz doğrulama ile analiz edilecektir. Örneklem büyüklüğü güç analiziyle, nitel veriler ise doygunlukla belirlenecektir.
  - Gerekçe: Makalede MIT-BIH aritmi veri kümesi üzerinde yapılan analizlerde, etki büyüklüğünün 0.5'i geçmesi ve doğruluğun %80 üzerinde plato yapması bulgusuna dayanmaktadır.
- **Kalp krizi tahmin modellerinde öznitelik varyansının değiştirilmesi, ortalama ve genel etki büyüklükleri arasındaki farkı ve sınıflandırma doğruluğunu nasıl etkilemektedir?**
  - Desen: Kardiyovasküler hasta verilerinde öznitelik seçim yöntemleri uygulanarak farklı veri kalitesi seviyeleri (%10, %50, %100) simüle edilecek; 5 farklı makine öğrenimi algoritmasının doğruluk ve etki büyüklüğü değişimleri karşılaştırılacaktır. Örneklem büyüklüğü güç analiziyle belirlenecektir.
  - Gerekçe: Makalenin tartışma bölümünde kalp krizi verisinde ortalama ve genel etki büyüklükleri arasında belirgin fark bulunduğu ve veri kalitesinin performansı doğrudan artırdığı bulgusundan türetilmiştir.
- **Ayırt etme gücü düşük ve etki büyüklüğü 0.2'nin altında olan uyku kalitesi verilerinde örneklem sayısının artırılması sınıflandırma başarısını %80 eşiğine ulaştırabilir mi?**
  - Desen: Uyku günlüğü verileri üzerinden oluşturulan belirsiz veri kümelerinde örneklem sayısı 16'dan 3000'e kadar çıkarılacak; Naive Bayes ve Lojistik Regresyon modellerinin doğruluk oranlarındaki değişim izlenecektir. Örneklem büyüklüğü güç analizi ilkesine göre doğrulanacaktır.
  - Gerekçe: Makalede belirsiz nitelikteki uyku verisinde örneklem sayısı artırılsa dahi etki büyüklüğü ve doğruluğun düşük kaldığı ve doyum noktasına ulaşılamadığı yönündeki açık sınırlılık ve bulgudan türetilmiştir.

# Kaynak izleri

Her iddia, özgün yayının belirtilen sayfasındaki birebir alıntıya bağlıdır.

| Kanıt | Bölüm | PDF sayfası | Basılı sayfa | Alıntı |
|---|---|---|---|---|
| ev-o-1 | Abstract | 1 | — | BMC Bioinformatics (2023) 24:48 https://doi.org/10.1186/s12859-023-05156-9 BMC Bioinformatics Evaluation of a decided sample size in machine learning applications Daniyal Rajput 1, |
| ev-s-1 | Abstract | 1 | — | We examined the average and grand effect sizes and the performance of five ML methods using simulated datasets and three real datasets to derive the criteria for sample size. |
| ev-s-3 | Abstract | 1 | — | Results: The results demonstrate that the effect sizes and the classification accura‐ cies increase while the variances in effect sizes shrink with the increment of samples when th |
| ev-s-4 | Abstract | 1 | — | The sample size is considered suitable when it has appropriate effect sizes ( ≥ 0.5) and ML accuracy ( ≥ 80%). |
| ev-s-5 | Background | 3 | 3 | Button [ 21 ] stated that a minor analytical manipulation could cause a substantial change in true effects, especially with small sample sizes. |
| ev-s-6 | Background | 2 | 2 | Friston [ 10 ] suggested that a minimal sample size for producing statistically significant results is 16 subjects with a good effect size. |
| ev-l-1 | Discussion | 7 | 7 | Discussion This study examined the impact of sample numbers on the effect size and ML classi - fiers’ performance to design criteria for evaluating an appropriate sample size by us |
| ev-l-2 | Discussion | 10 | 10 | Calculate average and grand effect sizes of data. One of the effect sizes of a decided sample size should be equal to or more than 0.5 according to Cohen’s scale |
| ev-l-3 | Discussion | 10 | 10 | ML accuracy of a decided sample size should be equal to or more than 80%. When multiple sample sizes are compared, the change of accuracies should be smaller than 10% with the incr |

# İlgili kavramlar

- [Sözel Olmayan Zekâ Testi Üçüncü Versiyonunun (TONI-3) Türk Ortaokul Öğrencilerindeki Psikometrik Özellikleri](/okf/sosyal-bilimler/egitim-bilimleri/sozel-olmayan-zek-testi-ucuncu-versiyonunun-toni-3-turk-ortaokul-ogrencilerindeki-psikometrik-ozellikleri.md)
- [Erken Cumhuriyet Döneminde Spor: Bir Devletin İdeolojik Aygıtı Olarak Türk Spor Kurumu Dergisi](/okf/sosyal-bilimler/egitim-bilimleri/erken-cumhuriyet-doneminde-spor-bir-devletin-ideolojik-aygiti-olarak-turk-spor-kurumu-dergisi.md)
- [Türk Eğitim Sisteminde Sekülerleşme](/okf/sosyal-bilimler/egitim-bilimleri/turk-egitim-sisteminde-sekulerlesme.md)
- [Kanıta Dayalı Sınıf Yönetimi Ölçeğinin Klasik Test ve Madde Tepki Kuramlarına Göre Geçerlik ve Güvenirlik Kanıtları](/okf/sosyal-bilimler/egitim-bilimleri/kanita-dayali-sinif-yonetimi-olceginin-klasik-test-ve-madde-tepki-kuramlarina-gore-gecerlik-ve-guvenirlik-kanitlari.md)
- [Örgütsel Uygulama Olarak Dönüştürücü Eğitim Liderliği: Okullarda Öğretmen Özerkliğini ve Mesleki Kültürü Yeniden Yapılandırmada Uygulama Kuramı Perspektifi](/okf/sosyal-bilimler/egitim-bilimleri/orgutsel-uygulama-olarak-donusturucu-egitim-liderligi-okullarda-ogretmen-ozerkligini-ve-mesleki-kulturu-yeniden-yapilandirmada-uygulama-kurami-perspektifi.md)
- [Isitme Engelli ve Normal Isiten Basketbol ve Voleybölçularin Tekrarli Aktif Sicrama Performanslarindaki Cok Boyutlu Farklıliklar: Yükseklik, Kuvvet ve Ivme](/okf/sosyal-bilimler/egitim-bilimleri/isitme-engelli-ve-normal-isiten-basketbol-ve-voleybolcularin-tekrarli-aktif-sicrama-performanslarindaki-cok-boyutlu-farkliliklar-yukseklik-kuvvet-ve-ivme.md)
- [COVID-19 Pandemisinin Yükseköğretimde Çevrimiçi Öğrenme Üzerine Etkisi: Bibliyometrik Bir Analiz](/okf/sosyal-bilimler/egitim-bilimleri/covid-19-pandemisinin-yuksekogretimde-cevrimici-ogrenme-uzerine-etkisi-bibliyometrik-bir-analiz.md)
- [Kahramanmaraş Depremleri Sonrası Afrika Ülkelerinden Türkiye'ye Yapılan Yardımlar](/okf/sosyal-bilimler/egitim-bilimleri/kahramanmaras-depremleri-sonrasi-afrika-ulkelerinden-turkiyeye-yapilan-yardimlar.md)

# Şeffaflık

- Analiz tarihi: 2026-08-15T09:05:50.597Z
- Kanıt sayısı: 9
- Üretim sürümü: makale-analizi-v3.0.0
- Kanonik sayfa: https://makaleanalizi.com/sosyal-bilimler/egitim-bilimleri/makine-ogrenimi-uygulamalarinda-karar-verilen-orneklem-buyuklugunun-degerlendirilmesi
