---
type: "Akademik Makale Analizi"
title: "Yazılım Geliştirmede Üretken Yapay Zeka Modellerinin Performans ve Güvenilirliği: C# Tabanlı Bir Analiz"
description: "Yazılım mühendisliği süreçlerinde üretken yapay zeka sistemlerinin ve büyük dil modellerinin kullanımı, kod üretimi, hata ayıklama ve test senaryoları hazırlama aşamalarında geliştirici verimliliğini artırmaktadır. Ancak bu modellerin ürettiği kodların yalnızca işlevsel olarak doğru çalışması yeterl"
resource: "https://makaleanalizi.com/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/yazilim-gelistirmede-uretken-yapay-zeka-modellerinin-performans-ve-guvenilirligi-c-tabanli-bir-analiz"
doi: "10.51354/mjen.1784716"
authors: ["Abdulkadir Şeker", "Halil Kaynarpınar"]
citation: "Şeker, A., Kaynarpınar, H. (2025). The Performance and Reliability of Generative AI Models in Software Development: A C# Based Analysis. . https://doi.org/10.51354/mjen.1784716"
publicationType: "quantitative-empirical"
discipline: "Mühendislik ve Teknoloji"
subDiscipline: "Bilgisayar ve Elektrik Mühendisliği"
evidenceCount: 11
tags: ["Üretken Yapay Zeka", "Büyük Dil Modelleri", "Programlama", "Yapay Zeka Destekli Kodlama"]
timestamp: "2026-09-11T23:52:02.013Z"
---

# Yazılım Geliştirmede Üretken Yapay Zeka Modellerinin Performans ve Güvenilirliği: C# Tabanlı Bir Analiz

Özgün başlık: The Performance and Reliability of Generative AI Models in Software Development: A C# Based Analysis
DOI: https://doi.org/10.51354/mjen.1784716
Künye (APA 7): Şeker, A., Kaynarpınar, H. (2025). The Performance and Reliability of Generative AI Models in Software Development: A C# Based Analysis. . https://doi.org/10.51354/mjen.1784716

Bilim alanı: [Mühendislik ve Teknoloji](/okf/muhendislik-ve-teknoloji/index.md) › Bilgisayar ve Elektrik Mühendisliği

# Alan bağlamı

Yazılım mühendisliği süreçlerinde üretken yapay zeka sistemlerinin ve büyük dil modellerinin kullanımı, kod üretimi, hata ayıklama ve test senaryoları hazırlama aşamalarında geliştirici verimliliğini artırmaktadır. Ancak bu modellerin ürettiği kodların yalnızca işlevsel olarak doğru çalışması yeterli olmayıp; modülerlik, bellek kullanımı, zaman karmaşıklığı, kod okunabilirliği ve sıra dışı sınır senaryolara (edge cases) karşı dayanıklılık gibi yazılım kalite metriklerine uyumu kritik bir tartışma konusudur. Mevcut alan yazında üretken yapay zekanın sunduğu hız ve pratiklik övülmekle birlikte, kod kokuları, mantıksal hatalar, yetersiz istisna yönetimi ve sınır durumlarındaki duyarsızlıklar yazılım güvenilirliği açısından soru işaretleri yaratmaktadır.

# Akademik özet

Yazılım mühendisliği alanında üretken yapay zeka araçlarının hızlı yayılımı, yazılım kalitesi ve kod güvenilirliği konularında kapsamlı değerlendirmeleri zorunlu kılmaktadır. Doğal dil komutlarından kod üreten büyük dil modelleri; basitleştirilmiş prototipleme, hızlı kod tamamlama ve öğrenme süreçlerine katkı sağlasa da, üretilen kodların standart ve uç senaryolardaki niteliği akademik bir araştırma problemi olarak öne çıkmaktadır. Özellikle C# gibi güçlü tip denetimine ve nesne yönelimli mimariye sahip dillerde, modellerin sadece geçerli sözdizimi üretmesi değil, aynı zamanda bellek yönetimi, zaman karmaşıklığı ve hata toleransı gibi kriterleri karşılaması beklenmektedir. Bu durum, yapay zeka modellerinin pratik yazılım geliştirme süreçlerindeki sınırlarını ve yetkinliklerini titizlikle ölçmeyi gerektirmektedir.

İncelenen araştırmada, sektörde yaygın olarak tercih edilen ChatGPT-4o, Gemini 2.5 Flash, Claude 3 ve GitHub Copilot olmak üzere dört farklı üretken yapay zeka modelinin C# dilindeki kodlama performansı deneysel olarak karşılaştırılmıştır. Çalışma kapsamında 10 temel algoritma problemi ve 10 nesneye yönelik programlama (OOP) problemi tasarlanmıştır. Modellerin ürettiği çözümler; Big O zaman karmaşıklığı, bellek kullanımı, kod satır sayısı (LOC), değişken ve metot sayıları ile yürütme süresi gibi nicel metriklerle analiz edilmiştir. Ayrıca her bir problem için tanımlanan uç durumlar (edge cases) üzerinden modellerin istisna yönetimi, veri doğrulama ve mantıksal kararlılık düzeyleri sistematik şekilde test edilerek sayısal başarı oranları hesaplanmıştır.

Elde edilen bulgular, tüm modellerin işlevsel açıdan çalışan çözümler üretebildiğini, ancak gelişmiş yazılım mühendisliği pratikleri ve sınır durum yönetimi açısından belirgin farklar taşıdığını göstermektedir. Temel algoritma uç durumlarında ChatGPT %96 uyum oranıyla en yüksek kararlılığı sergilerken, Gemini %94 ile ikinci sırada yer almış, Copilot %86 ve Claude %82 başarı göstermiştir. Nesneye yönelik programlama uç durumlarında da ChatGPT %90 başarı oranıyla öne çıkmış; Gemini %88, Claude %82 ve Copilot %80 başarı oranına ulaşmıştır. ChatGPT ve Copilot daha kısa ve kompakt kodlar üretirken, Gemini ve Claude modülerlik ve okunabilirlik açısından daha detaylı yapılar sunmuştur. Bununla birlikte, kod yorum satırlarının eksikliği, entegre birim testlerinin üretilmemesi ve bazı uç senaryolarda görülen mantıksal yetersizlikler tüm modellerde ortak kısıtlar olarak saptanmıştır.

Sonuç olarak araştırma, üretken yapay zeka modellerinin yazılım geliştirme süreçlerinde güçlü birer yardımcı araç olmakla birlikte tek başlarına tam güvenilir kod üretemediklerini ortaya koymaktadır. Modellerin ideal çalışma koşullarının ötesinde tipik olmayan sınır senaryolar altında değerlendirilmesinin önemi vurgulanmaktadır. İlgili yazın açısından bu çalışma, C# dilinde geniş kapsamlı bir metrik ve uç durum veri seti sunarak yapay zeka destekli yazılım mühendisliği literatürüne somut bir ampirik katkı sağlamaktadır. Yazılım mimarlarının ve araştırmacıların yapay zeka araçlarını entegre ederken insan denetimini ve etkili komut mühendisliği (prompt engineering) pratiklerini sürece dahil etmelerinin kritik gerekliliği açıkça gösterilmektedir.

# Araştırmanın amacı

Bu çalışmanın temel amacı, ChatGPT-4o, Gemini 2.5 Flash, Claude 3 ve GitHub Copilot modellerinin C# dilindeki temel algoritma ve nesneye yönelik programlama problemlerine ürettikleri çözümleri zaman karmaşıklığı, bellek kullanımı, kod satırı ve uç durum dayanıklılığı açısından karşılaştırmalı olarak analiz etmektir.

# Yöntem ve tasarım

Bu çalışmada nicel deneysel analiz yaklaşımı benimsenerek, ChatGPT-4o, Gemini 2.5 Flash, Claude 3 ve GitHub Copilot yazılım araçlarının C# dilinde ürettikleri çözümler yazılım kalite metrikleri ve uç durum senaryoları açısından karşılaştırılmıştır.

# Bulgular ve önermeler

1. Temel algoritma problemlerinde ChatGPT %96 başarı oranıyla uç durumlara karşı en yüksek uyum ve hata toleransı sergilerken; Gemini %94, Copilot %86 ve Claude %82 başarı oranına ulaşmıştır.
2. Nesne yönelimli programlama (OOP) senaryolarında uç durum uyumluluk oranları ChatGPT için %90, Gemini için %88, Claude için %82 ve Copilot için %80 olarak ölçülmüştür.
3. Kod yalınlığı ve satır sayısı açısından ChatGPT ve Copilot ortalama 12-13 satırla daha özlü çözümler üretirken, Gemini ve Claude ortalama 18-22 satırla daha açıklayıcı ve modüler kod yapıları sunmuştur.
4. İncelemeye alınan tüm modeller koda açıklama satırı ekleme, entegre performans ölçümü sağlama ve birim test geliştirme gibi gelişmiş yazılım mühendisliği uygulamalarında genel yetersizlik göstermiştir.

# Yazarın tartışması

Elde edilen nicel bulgular, yapay zeka modellerinin standart kod senaryolarında yüksek doğruluk sağladığını, ancak uç durum testlerinde belirgin performans farkları ortaya koyduğunu göstermektedir. Özellikle ChatGPT ve Gemini, istisna yönetimi ve sınır değer sınamalarında rakiplerine kıyasla daha kararlı bir grafik çizmiştir.

Yazarlar bu durumu, modellerin eğitim mimarileri ve optimize edildikleri temel hedeflerdeki farklılıklarla açıklamaktadır. ChatGPT-4o'nun yapısal tutarlılığı ve veri doğrulama kabiliyeti yüksek tutulurken, Copilot'un hız ve basitlik odaklı yapısının uç durumlarda güvenlik ve hata denetimi eksikliklerine yol açtığı belirtilmektedir.

Tartışma bölümünde bu sonuçlar mevcut literatürle ilişkilendirilmiş; yapay zeka kaynaklı kodların sıklıkla kural ihlalleri, eksik istisna yönetimi ve kod kokuları barındırdığını belirten Tosi (2024) ve Florez Muñoz vd. (2024) çalışmalarının tespitleriyle örtüştüğü gösterilmiştir.

Sonuç olarak, üretken yapay zekanın yazılım geliştirme süreçlerine entegrasyonunda yalnızca sentaktik doğrulukla yetinilmemeli; yazılım güvenilirliği, uç durum dayanıklılığı ve sürdürülebilirlik ilkeleri doğrultusunda insan merkezli bir doğrulama mekanizması titizlikle uygulanmalıdır.

# Yazarın sonucu

Yazarlar, üretken yapay zeka modellerinin yazılım geliştirme süreçlerinde son derece faydalı yardımcı araçlar olduğunu, ancak bu sistemlerin tam potansiyellerine ulaşabilmesi için insan denetimi, ileri düzey yazılım mühendisliği disiplini ve özellikle etkili komut mühendisliği (prompt engineering) uygulamalarının zorunlu olduğunu vurgulamaktadır.

# Literatürdeki işlevi

Bu araştırma, yazılım geliştirme süreçlerinde kullanılan üretken yapay zeka modellerini yalnızca sentaktik doğruluk düzeyinde değil, aynı zamanda yazılım mühendisliğinin temel yapı taşları olan zaman karmaşıklığı, bellek kullanımı, kod uzunluğu ve en önemlisi sıra dışı sınır senaryolara karşı dayanıklılık çerçevesinde ampirik olarak test eden karşılaştırmalı bir değerlendirme işlevi görmektedir. Alan yazında sıkça yer bulan teorik yaklaşımları somut sayısal veriler ve istatistiksel uç durum analizleriyle destekleyerek yapay zeka kod asistanlarının güvenilirlik sınırlarını netleştirmektedir.

Önceki çalışmalarla ilişkisi: Çalışma, yapay zeka destekli kod üretiminin verimlilik kazanımlarını kabul eden ancak üretilen kodlardaki karmaşıklık ve kod kokusu gibi risklere dikkat çeken Tosi (2024) ile insan gözetiminin ve doğrulama süreçlerinin gerekliliğini savunan Florez Muñoz vd. (2024) gibi öncül literatürün argümanlarını C# diline özgü ampirik bulgularla derinleştirmektedir. Yapay zekanın sunduğu sentaktik başarının arkasındaki yapısal eksiklikleri (modülerlik, istisna yönetimi vb.) göstererek önceki araştırmaların güvenlik ve sürdürülebilirlik kaygılarını doğrulamaktadır.

Literatür taramasına katkısı: Yazılım mühendisliğinde yapay zeka entegrasyonuna odaklanan bir literatür taraması için bu çalışma, popüler dil modellerinin (ChatGPT, Gemini, Claude, Copilot) performans hiyerarşisini hem temel algoritmik mantık hem de nesne yönelimli programlama (OOP) düzeyinde eş zamanlı sunarak kritik bir sentez kaynağı oluşturur. Özellikle uç durum testlerinin (edge cases) metodolojik bir kalite standardı olarak nasıl yapılandırılması gerektiğini göstererek, akademik taramalara yapay zeka çıktılarının doğrulanmasında çok boyutlu bir değerlendirme matrisi kazandırır.

# Tez ve makale araştırmalarında kullanım

- **Üretken yapay zeka modelleri sentaktik olarak doğru kod üretseler de ileri düzey yazılım mühendisliği pratiklerinde yetersizlik göstermektedir.** — Tez çalışmasının literatür taraması bölümünde, büyük dil modellerinin kod üretimindeki yapısal sınırı ve insan denetimi gerekliliği tartışılırken bu çalışmanın ampirik tespiti referans gösterilebilir.
- **Temel algoritma çözümlerinde modeller arasında uç durumlara uyum açısından belirgin performans farkları bulunmaktadır.** — Kendi geliştirdiği yazılım test yöntemini ya da yapay zeka performansını tartışan bir tezde, ChatGPT'nin %96'lık sınır durum başarısı ve diğer modellerle olan hiyerarşisi karşılaştırma verisi olarak kullanılır.
- **Nesne yönelimli programlama mimarilerinde yapay zeka modellerinin uç durumlardaki kararlılığı algoritma görevlerine göre düşüş sergilemektedir.** — OOP yapılarının yapay zeka tarafından inşası sırasındaki istisna yönetimi zayıflıklarını açıklamak için ChatGPT (%90) ve Gemini'nin (%88) başı çektiği başarı oranları ampirik kanıt olarak sunulacaktır.

# Türetilebilir araştırma soruları

- **Üretken yapay zeka modelleri tarafından C# dilinde yazılan Singleton tasarım kalıbı çözümleri, eşzamanlı (multi-thread) erişim uç durumlarında thread-safety ilkelerini ne düzeyde koruyabilmektedir?**
  - Desen: Deneysel tasarımda, ChatGPT-4o, Gemini 2.5, Claude 3 ve Copilot modellerine Singleton kalıbı ürettirilecektir. Üretilen kodlar, .NET 8.0 ortamında paralel test senaryolarına (Task Parallel Library ile 1000 eşzamanlı istek) tabi tutulacak, çoklu örnek oluşturma hataları statik ve dinamik analizlerle test edilecektir.
  - Gerekçe: Makalenin Tablo 22'deki Singleton uç durum analizinde ChatGPT dışındaki modellerin (Gemini, Copilot, Claude) çoklu iş parçacığı senaryolarında başarısız olduğu ve '!' (hatalı sonuç) ürettiği tespitinden yola çıkılarak bu açık sınırlılığın derinleştirilmesi hedeflenmiştir.
- **Rol tanımlama ve az örnekli öğrenme (few-shot prompting) gibi gelişmiş komut mühendisliği yaklaşımları, yapay zeka modellerinin C# OOP kodlarındaki özel istisna (custom exception) fırlatma ve yakalama doğruluğunu ne ölçüde artırır?**
  - Desen: Yarı deneysel desende, doğrudan yönlendirme (direct prompting) ile sistem seviyesinde zenginleştirilmiş yönlendirmeler karşılaştırılacaktır. En az 30 farklı bankacılık ve veri akışı OOP senaryosu üzerinde, modellerin fırlattığı özel istisnaların doğruluğu birim test araçlarıyla ölçülecektir.
  - Gerekçe: Yazarların sonuç kısmında komut mühendisliği becerilerinin (prompt engineering) yapay zeka çıktılarının kalitesini artırmadaki kritik rolüne yönelik vurgusundan ve modellerin istisna yönetimindeki genel yetersizlik bulgularından türetilmiştir.
- **ChatGPT ve Claude modellerinin C# sınıfları için ürettiği birim test kodları, xUnit ortamında çalıştırıldığında ne kadarlık bir kod kapsamı (code coverage) oranı sağlamakta ve uç durumları ne ölçüde yakalayabilmektedir?**
  - Desen: Ampirik-gözlemsel desende, hazır bir C# kütüphanesindeki karmaşık metotlar için yapay zekaya birim testler yazdırılacaktır. Visual Studio Coverage araçlarıyla kod kapsama oranları ölçülecek ve yapay zeka birim testlerinin kalitesi analiz edilecektir.
  - Gerekçe: Çalışmanın Tablo 24'teki karşılaştırmasında, tüm modellerin (ChatGPT, Gemini, Claude, Copilot) birim test geliştirme (Unit Test Development) kriterinde tamamen yetersiz kalmasından ('X' almasından) hareketle bu boşluğu doldurmak üzere tasarlanmıştır.

# Kaynak izleri

Her iddia, özgün yayının belirtilen sayfasındaki birebir alıntıya bağlıdır.

| Kanıt | Bölüm | PDF sayfası | Basılı sayfa | Alıntı |
|---|---|---|---|---|
| ev-o-1 | 1 Introduction | 1 | — | The primary aim of this study is to comparatively analyze the solutions generated by the generative AI models ChatGPT, Gemini, Claud e, and GitHub Copilot for fundamental algorithm |
| ev-o-2 | ABSTRACT | 1 | — | Keywords: GenAI , LLM , Programing , AI - assisted coding . |
| ev-s-1 | 1 Introduction | 1 | — | In this context, a comparative evaluation was conducted on four models using 10 fundamental algorithm problems and 10 object - oriented programming problems in the C# programming l |
| ev-s-2 | 3.1 Selected Tools | 3 | — | The code generation and testing processes were executed locally using Visual Studio Code and the .NET 8.0 SDK to ensure consistent performance measurement across all models. |
| ev-s-3 | 4.2.2 General Evaluation | 9 | — | ChatGPT achieved the highest compliance rate with 96%, closely followed by Gemini with 94%, while Copilot and Claude reached 86% and 82%, respectively. |
| ev-s-4 | 4.3.2 General Evaluation | 14 | — | When examining the success rates, the ChatGPT model demonstrated the highest compliance with 90%, followed by Gemini with 88%, Claude with 82%, and Copilot with 80%. |
| ev-s-5 | 5 Conclusion | 17 | — | However, realizing their full potential requires human intervention, the application of advanced software engineering practices, and particularly the effective use of prompt engine |
| ev-s-6 | 2.2 Software Quality Metrics | 2 | — | Recent research shows that AI - driven systems can contribute positively by improving object - oriented programming metrics and reducing code complexity |
| ev-l-1 | 4.2.2 General Evaluation | 9 | — | Based on the success rates calculated from the number of correct responses to edge cases, ChatGPT achieved the highest compliance rate with 96% |
| ev-l-2 | 4.3.2 General Evaluation | 14 | — | When examining the success rates, the ChatGPT model demonstrated the highest compliance with 90%, followed by Gemini with 88%, Claude with 82%, and Copilot with 80%. |
| ev-l-3 | Abstract | 1 | — | The findings indicate that all models produced functionally valid solutions, yet exhibited limitations in advanced software engineering practices such as modularity, comprehensive  |

# İlgili kavramlar

- [Dinamik Hareket Uyumlaması İçin İnsan İlhamlı Duyumotor Denetleyici: Mafsallı Robot Kolları Üzerine Bir İnceleme](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/dinamik-hareket-uyumlamasi-icin-insan-ilhamli-duyumotor-denetleyici-mafsalli-robot-kollari-uzerine-bir-inceleme.md)
- [Twitch Platformundaki Nefret Baskınları: Canlı Yayın Topluluklarında Gerçek Zamanlı İnsan-Bot Koordineli Saldırıların Anlaşılması](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/twitch-platformundaki-nefret-baskinlari-canli-yayin-topluluklarinda-gercek-zamanli-insan-bot-koordineli-saldirilarin-anlasilmasi.md)
- [Üretken Yapay Zekanın İlaç Yönetimi Görevlerinde Kullanım Bağlamı Değerlendirme Çerçevesi](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/uretken-yapay-zekanin-ilac-yonetimi-gorevlerinde-kullanim-baglami-degerlendirme-cercevesi.md)
- [Zaman Serisi Tahmini İçin Derin Öğrenme: Model Mimarisi Paradigmaları, Özellik Çıkarımı ve Gelecek Yönelimleri Üzerine Kapsamlı Bir İnceleme](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/zaman-serisi-tahmini-icin-derin-ogrenme-model-mimarisi-paradigmalari-ozellik-cikarimi-ve-gelecek-yonelimleri-uzerine-kapsamli-bir-inceleme.md)
- [Betonarme Yapıların Kentsel Dönüşümünde Hızlı Tarama Parametrelerinin Değerlendirilmesi ve Öneriler](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/betonarme-yapilarin-kentsel-donusumunde-hizli-tarama-parametrelerinin-degerlendirilmesi-ve-oneriler.md)
- [Değiştirilmiş Orangutan Optimizasyon Algoritması ile Optimize Edilmiş Kapsül Sınır Ağı Kullanılarak Deniz Kazası Sıcak Noktalarının Öngörücü Analizi](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/degistirilmis-orangutan-optimizasyon-algoritmasi-ile-optimize-edilmis-kapsul-sinir-agi-kullanilarak-deniz-kazasi-sicak-noktalarinin-ongorucu-analizi.md)
- [Dört Boyutlu Kaos Tabanlı Kuantum Görüntü Şifreleme Algoritması](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/dort-boyutlu-kaos-tabanli-kuantum-goruntu-sifreleme-algoritmasi.md)
- [Faslı Öğrencileri Sosyal Medya Tehditlerinden Korumak İçin Bir Siber Güvenlik Farkındalık Çerçevesi Geliştirilmesi](/okf/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/fasli-ogrencileri-sosyal-medya-tehditlerinden-korumak-icin-bir-siber-guvenlik-farkindalik-cercevesi-gelistirilmesi.md)

# Şeffaflık

- Analiz tarihi: 2026-09-11T23:52:02.013Z
- Kanıt sayısı: 11
- Üretim sürümü: makale-analizi-v3.0.0
- Kanonik sayfa: https://makaleanalizi.com/muhendislik-ve-teknoloji/bilgisayar-ve-elektrik-muhendisligi/yazilim-gelistirmede-uretken-yapay-zeka-modellerinin-performans-ve-guvenilirligi-c-tabanli-bir-analiz
