🔬 İstatistik Temelleri

Hipotez Testi Nedir? Kapsamlı Rehber

📅 Güncellendi: 5 Temmuz 2026 ⏱️ 22 dk okuma 🔬 İstatistik Temelleri

Hipotez testi, bir iddia veya varsayımın verilerle desteklenip desteklenmediğini istatistiksel olarak sınamanın sistematik yöntemidir. Araştırmacılar bu yöntemi kullanarak "Gözlemlediğim fark gerçek mi, yoksa tesadüf mü?" sorusunu yanıtlar. Bu kapsamlı rehberde H0/H1 kurgusundan p değerinin gerçek anlamına, istatistiksel güçten p-hacking tuzağına kadar hipotez testinin tüm boyutlarını — sık yapılan yanlış anlamaları düzelterek — ele alıyoruz.

1. Hipotez Testi Nedir? Bilimsel Yöntemin Mantığı

Hipotez testi, bilimsel yöntemin istatistiksel karşılığıdır: bir iddiayı doğrudan kanıtlamaya çalışmak yerine, onun tersini (null hipotezi) çürütmeye çalışırız. Bu ters mantık, Karl Popper'ın "yanlışlanabilirlik" ilkesinden ilham alır — bir teoriyi kesin olarak kanıtlamak imkansızdır, ama onu çürütecek kanıt bulunabilir. Hipotez testi de aynı şekilde, "hiçbir etki yok" varsayımını (H0) veriyle çürütmeye çalışarak dolaylı bir kanıt sunar.

2. H0 ve H1: Sıfır ve Alternatif Hipotez

Hipotez testi iki zıt önerme üzerine kurulur:

  • H₀ (Sıfır Hipotezi): "Herhangi bir etki veya fark yoktur" iddiasıdır. Araştırmacının çürütmeye çalıştığı hipotezdir.
  • H₁ (Alternatif Hipotez): Araştırmacının desteklemeye çalıştığı hipotezdir. "Bir etki veya fark vardır" önermesini içerir.

Örnek: "Yeni ilaç tedavisi kan basıncını düşürür mü?" sorusunda H₀: "İlaç etkisi yoktur", H₁: "İlaç kan basıncını düşürür."

3. Hipotez Testinin Adımları

  1. H₀ ve H₁'i açıkça tanımlayın.
  2. Anlamlılık düzeyini (α, genellikle 0.05) veri toplanmadan önce belirleyin.
  3. Uygun test istatistiğini seçin (t, F, χ², z vb. — bkz. Bölüm 12).
  4. Verileri toplayın ve test istatistiğini hesaplayın.
  5. p değerini hesaplayın ve α ile karşılaştırın.
  6. Karar verin: p < α ise H₀ reddedilir; p ≥ α ise H₀ reddedilemez (H₀ "doğrulanmış" olmaz, yalnızca reddedilecek yeterli kanıt bulunamamıştır).

4. p Değeri Nedir ve Nasıl Hesaplanır?

p değeri, sıfır hipotezi doğru olsaydı mevcut verileri veya daha aşırı bir sonucu elde etme olasılığıdır. Yani "Bu sonuç tesadüfen ortaya çıkabilir miydi?" sorusuna verilen istatistiksel cevaptır.

H₀ Altında Örnekleme Dağılımı kritik değer Red Bölgesi (alan = α) H₀'ın öngördüğü değer (fark=0)
Şekil 1. Test istatistiği kritik değeri aştığında (kırmızı alan), gözlemlenen sonuç H₀ altında çok nadir olduğu için H₀ reddedilir. Bu kırmızı alanın büyüklüğü α (alfa) düzeyini temsil eder.
p DeğeriYorum
p < 0.001Çok güçlü kanıt, H₀ reddedilir
p < 0.01Güçlü kanıt, H₀ reddedilir
p < 0.05Yeterli kanıt, H₀ reddedilir
p ≥ 0.05Yetersiz kanıt, H₀ reddedilemez

💡 Kritik yanlış anlama: p < 0.05 "H₀ yanlış" demek değildir. "Eğer H₀ doğru olsaydı bu sonucu elde etme ihtimali %5'ten düşük" demektir. p değeri "doğruluğun olasılığı" değil, "verilerin H₀ ile ne kadar uyumlu olduğunun ölçüsü"dür — bkz. p Değeri Nedir? yazımızdaki ayrıntılı yanlış anlama listesi.

5. Alfa (α) Düzeyi ve Karar Kuralı

Alfa, araştırmacının önceden belirlediği yanılma payıdır. Sosyal bilimlerde genellikle α = 0.05 kullanılır; tıbbi ve mühendislik araştırmalarında α = 0.01 veya α = 0.001 tercih edilir. p < α olduğunda H₀ reddedilir. Alfa'nın veri toplanmadan önce belirlenmesi kritiktir — sonradan sonuca göre alfa seçmek (örn. p=0.06 çıkınca "α=0.10 kullanalım" demek) ciddi bir metodolojik ihlaldir.

6. Tip I ve Tip II Hata

H₀ Gerçekte DoğruH₀ Gerçekte Yanlış
H₀ ReddedilirTip I Hata (α) — Yanlış PozitifDoğru Karar (Güç, 1−β)
H₀ ReddedilemezDoğru KararTip II Hata (β) — Yanlış Negatif

Tip I hata (alfa hatası), H₀ doğruyken H₀'ı reddetmektir — yanlış pozitif. Tip II hata (beta hatası) ise H₀ yanlışken H₀'ı reddetmemektir — yanlış negatif. İkisi arasında bir denge (trade-off) vardır: alfa'yı küçültmek (daha katı eşik) Tip I hatayı azaltır ama Tip II hata riskini artırır.

7. İstatistiksel Güç (Power) ve Örneklem Büyüklüğü

İstatistiksel güç (1−β), gerçekten var olan bir etkiyi doğru tespit etme olasılığıdır. Güç, dört faktöre bağlıdır:

  • Örneklem büyüklüğü (n): n arttıkça güç artar — en kolay kontrol edilebilen faktördür.
  • Etki büyüklüğü: Gerçek etki ne kadar büyükse, tespit etmek o kadar kolaydır.
  • Alfa düzeyi: Daha yüksek α (daha gevşek eşik) gücü artırır ama Tip I hata riskini de artırır.
  • Ölçüm güvenilirliği: Gürültülü/güvenilmez ölçümler gücü düşürür.

Araştırma tasarımı ipucu: Veri toplamadan önce bir güç analizi (a priori power analysis) yaparak gerekli minimum örneklem büyüklüğünü hesaplayın (%80 güç standart hedeftir). Yetersiz güçle yapılan bir çalışma, gerçek bir etkiyi bile tespit edemeyebilir ("anlamsız" sonuç, etkinin olmadığı anlamına gelmez — sadece testin onu yakalayacak gücü olmayabilir).

8. Tek Kuyruklu vs Çift Kuyruklu Test

Çift Kuyruklu (İki Yönlü) α/2 her iki uçta Tek Kuyruklu (Tek Yönlü) α tamamı tek uçta
Şekil 2. Çift kuyrukluda red bölgesi α/2 olarak iki uca paylaştırılır; tek kuyrukluda α'nın tamamı tek bir yöne (önceden belirlenen) yerleştirilir — bu da tek yönlü testi o yönde daha "güçlü" ama yön yanlışsa tamamen kör yapar.
  • Çift kuyruklu (two-tailed): Farkın yönü bilinmiyor. "A grubu ile B grubu farklı mı?" En yaygın ve varsayılan kullanım.
  • Tek kuyruklu (one-tailed): Farkın yönü önceden, veriye bakmadan belirleniyor. "A grubu B'den büyük mü?" Güçlü bir teorik gerekçe olmadan kullanımı önerilmez — sonradan "tek yönlüye çeviririm" gibi bir seçim p-hacking'in bir türüdür.

9. Güven Aralıkları ile İlişki

%95 güven aralığı, hipotez testiyle matematiksel olarak eşdeğer bilgi taşır: eğer H₀'ın öngördüğü değer (genellikle 0 veya "fark yok") %95 güven aralığının dışındaysa, bu ikili çift kuyruklu test α=0.05'te anlamlıdır. Güven aralıklarının avantajı, yalnızca "anlamlı mı" değil, etkinin büyüklüğü ve kesinliği hakkında da bilgi vermesidir — bu nedenle modern istatistik uygulamalarında p değeriyle birlikte güven aralığı raporlamak standart hale gelmiştir.

10. İstatistiksel Anlamlılık ≠ Pratik Önem

Büyük örneklemlerde küçük ve anlamsız farklar bile istatistiksel olarak anlamlı çıkabilir. Bu nedenle p değerinin yanında mutlaka etki büyüklüğü (Cohen's d, eta-kare, odds ratio vb.) raporlanmalıdır. "İstatistiksel anlamlı" ile "pratik olarak önemli" birbirinden farklı kavramlardır — 100.000 kişilik bir örneklemde 0.5 puanlık bir gelir farkı bile p<0.001 çıkabilir, ama pratikte hiçbir önemi olmayabilir.

11. p-Hacking ve Çoklu Karşılaştırma Sorunu

p-hacking, anlamlı bir p<0.05 sonucu elde edene kadar farklı değişken kombinasyonlarını, alt grupları, kovaryatları veya analiz yöntemlerini deneyerek veriyi "zorlamaktır". Bu, bilimsel yayınlardaki tekrarlanabilirlik krizinin (replication crisis) başlıca nedenlerinden biri olarak gösterilir.

Yaygın p-hacking biçimleri: Veriyi topladıktan sonra hipotezi değiştirmek (HARKing — Hypothesizing After Results are Known), anlamlı çıkana kadar aykırı değerleri farklı kriterlerle çıkarıp eklemek, birden fazla bağımlı değişken denenip yalnızca anlamlı olanı raporlamak, örneklem büyüklüğünü "anlamlı çıkana kadar" artırmak.

Bu sorunu önlemek için: analiz planının veri toplanmadan önce ön-kayıt (pre-registration) yapılması, çoklu karşılaştırmalarda düzeltme (Bonferroni, FDR — bkz. Sıcak Nokta Analizi yazımızdaki FDR bölümü) uygulanması ve keşifsel/doğrulayıcı analizlerin raporda açıkça ayrıştırılması önerilir.

12. Hangi Testi Ne Zaman Kullanmalı?

SenaryoParametrik TestParametrik Olmayan Alternatif
İki bağımsız grup ortalamasıBağımsız örneklem t-testiMann-Whitney U
İki bağımlı (eşleştirilmiş) grupBağımlı örneklem t-testiWilcoxon İşaretli Sıralar
Üç+ bağımsız grup ortalamasıANOVA (bkz. ANOVA Nedir?)Kruskal-Wallis
İki değişken arası ilişkiPearson korelasyonSpearman korelasyon
Kategorik değişkenler arası ilişkiKi-kare (χ²) testi
Sürekli bir sonucu tahmin etmeDoğrusal regresyon

13. SPSS'te Hipotez Testi Örneği

Bağımsız örneklem t-testi örneği üzerinden hipotez testi mantığının SPSS'teki karşılığı:

Analyze Compare Means Independent-Samples T Test…
Test Variable(s): bağımlı (sürekli) değişken
Grouping Variable: grup değişkeni (2 kategori)
OK
Çıktıda: Levene's Test (varyans homojenliği) → uygun satırdaki Sig. (2-tailed) p değeridir

14. Python ile Hipotez Testi Örneği

from scipy import stats import numpy as np # H0: iki grubun ortalaması eşittir | H1: eşit değildir (çift kuyruklu) grup_a = [23, 25, 21, 28, 22, 24] grup_b = [30, 32, 29, 35, 31, 28] # Varyans homojenliği kontrolü levene_stat, levene_p = stats.levene(grup_a, grup_b) # Bağımsız örneklem t-testi t_stat, p_deger = stats.ttest_ind(grup_a, grup_b, equal_var=(levene_p > 0.05)) print(f"t={t_stat:.2f}, p={p_deger:.4f}") # Etki büyüklüğü (Cohen's d) def cohens_d(a, b): n1, n2 = len(a), len(b) havuzlanmis_std = np.sqrt(((n1-1)*np.var(a, ddof=1) + (n2-1)*np.var(b, ddof=1)) / (n1+n2-2)) return (np.mean(a) - np.mean(b)) / havuzlanmis_std print(f"Cohen's d: {cohens_d(grup_a, grup_b):.2f}") # %95 güven aralığı ci = stats.t.interval(0.95, df=len(grup_a)+len(grup_b)-2, loc=np.mean(grup_a)-np.mean(grup_b), scale=stats.sem(grup_a+grup_b)) print(f"%95 GA: {ci}")

15. Yaygın Yanlış Anlamalar

  • "p=0.03, yani etkinin gerçek olma olasılığı %97": Yanlış. p değeri, H₀ doğruyken verinin gözlemlenme olasılığıdır — H₁'in doğru olma olasılığı değildir.
  • "p>0.05, yani H0 doğru": Yanlış. "Reddedilemedi" ile "doğrulandı" aynı şey değildir; yetersiz güç de aynı sonucu verebilir.
  • "Daha küçük p değeri, daha büyük etki demektir": Yanlış. p değeri örneklem büyüklüğünden güçlü şekilde etkilenir; büyük n ile çok küçük bir etki bile çok küçük p verebilir.
  • Sonradan tek kuyrukluya geçmek: Sonucu görüp p'yi anlamlı kılmak için testi tek yönlüye çevirmek ciddi bir p-hacking biçimidir.
  • Yalnızca p değeri raporlayıp etki büyüklüğünü ve güven aralığını atlamak: Modern raporlama standartları (APA 7) her ikisinin de birlikte sunulmasını gerektirir.

Kaynaklar

  • Field, A. (2013). Discovering Statistics Using IBM SPSS Statistics (4th ed.). SAGE.
  • Cohen, J. (1994). The earth is round (p < .05). American Psychologist, 49(12), 997–1003.
  • Wasserstein, R. L., & Lazar, N. A. (2016). The ASA statement on p-values. The American Statistician, 70(2), 129–133.
  • Simmons, J. P., Nelson, L. D., & Simonsohn, U. (2011). False-Positive Psychology. Psychological Science, 22(11), 1359–1366.

İstatistiksel Analizinizi Birlikte Yapalım

Hipotez testi, p değeri yorumlama ve APA formatında raporlama için profesyonel destek.

Hemen Sipariş Ver  Teklif Al