Wilcoxon İşaretli Sıralar Testi Hesaplama

İstatistikSon güncelleme: 22 Ağustos 2026

Wilcoxon işaretli sıralar testi, aynı deneklerden alınan iki ölçüm (öncesi–sonrası, iki farklı yöntem, eşleştirilmiş çiftler) arasındaki farkı sınar. Eşleştirilmiş t testinin parametrik olmayan karşılığıdır ve farkların normal dağıldığı varsayımına ihtiyaç duymaz; yalnızca farkların sıralanabilir olmasını ister.

Test farkların hem işaretini hem de büyüklük sırasını kullanır: farklar hesaplanır, sıfır olan çiftler atılır, kalan farkların mutlak değerleri sıralanır ve pozitif farkların sıra toplamı W⁺ ile negatif farkların sıra toplamı W⁻ karşılaştırılır. Bu araç W⁺, W⁻, raporlanan T = min(W⁺, W⁻), bağ düzeltmeli z, iki kuyruklu p, r etki büyüklüğü, Hodges-Lehmann ortanca farkı güven aralığı ile fark ve işaretli sıra tablosunu birlikte verir.

Her değer bir deneğe aittir; iki ölçümdeki sıralama aynı kişiye karşılık gelmelidir.
1. ölçümle aynı sayıda değer girin; i. değer i. deneğin ikinci ölçümüdür.
SPSS'in 'Asymp. Sig. (2-tailed)' satırı düzeltmesiz z'ye dayanır.
Yanlış pozitif riskini belirler. Sosyal bilimlerde yaygın seçim %5'tir.

Wilcoxon İşaretli Sıralar Testi Formülleri

Farklar:            dᵢ = x₂ᵢ − x₁ᵢ  (dᵢ = 0 olan çiftler atılır)
Sıralama:           |dᵢ| küçükten büyüğe sıralanır, bağlara ortalama sıra
Sıra toplamları:    W⁺ = Σ (dᵢ > 0 olanların sıraları) ,  W⁻ = Σ (dᵢ < 0 olanların sıraları)
Test istatistiği:   T = min(W⁺, W⁻)   ve   W⁺ + W⁻ = n(n+1)/2
Beklenen değer:     μ_W = n(n+1) / 4
Standart sapma:     σ_W = √[ n(n+1)(2n+1)/24 − Σ(t³ − t)/48 ]
z istatistiği:      z = (W⁺ − μ_W) / σ_W
Etki büyüklüğü:     r = |z| / √(2n)   (alternatif gelenek: |z| / √n)
Ortanca kestirimi:  Δ̂ = ortanca[(dᵢ + dⱼ)/2] ,  i ≤ j  (Walsh ortalamaları)

Sıfır farkların atılması Wilcoxon'un klasik yaklaşımıdır; Pratt yöntemi bu çiftleri sıralamaya dahil eder ve biraz farklı p verir. Σ(t³ − t) bağlı mutlak farklar için varyans düzeltmesidir. p değeri normal yaklaşımla hesaplanır; n < 10 iken tam (exact) tablo kullanılmalıdır.

Nasıl Hesaplanır?

  1. Aynı deneklerden alınan iki ölçümü ayrı kutulara, aynı sırayla yapıştırın: i. değerler aynı kişiye ait olmalıdır.
  2. İki ölçümdeki değer sayısı eşit olmalıdır; eksik veri varsa o çifti tamamen çıkarın.
  3. Raporlanacak p değerini seçin: SPSS çıktısıyla karşılaştırma yapacaksanız süreklilik düzeltmesiz sürümü kullanın.
  4. Anlamlılık düzeyini (α) belirleyin; ortanca değişimin güven aralığı 1 − α düzeyinde hesaplanır.
  5. İşaretli sıra tablosunda hangi çiftlerin arttığını, hangilerinin azaldığını ve sıfır farkı nedeniyle atılan çiftleri inceleyin.
  6. T, z ve p ile birlikte r etki büyüklüğünü ve farkların kutu grafiğini okuyun; anlamlılık tek başına değişimin pratik önemini göstermez.

Örnek Hesaplamalar

Eğitim öncesi ve sonrası başarı puanı

12 çiftin 11 tanesinde artış vardır, hiçbirinde azalma yoktur; 1 çiftin farkı sıfır olduğu için atılır ve etkin n = 11 olur. W⁺ = 66, W⁻ = 0 ve T = 0 ile z = 2,949; p = 0,003 çıkar, yani eğitim sonrası puanlar anlamlı biçimde yüksektir. Farkların ortancası 6,00 ve r = 0,629 ile etki büyüklüğü büyüktür; ortanca değişimin %95 güven aralığı 4,50 ile 7,00 puan arasındadır.

T test istatistiği: 0,0 · Pozitif sıra toplamı (W⁺): 66,0 · Negatif sıra toplamı (W⁻): 0,0

İki ölçüm yöntemi arasında fark yok

10 çiftin 5 tanesinde artış, 5 tanesinde azalma görülür; W⁺ = 28, W⁻ = 27 ve T = 27 olur. z = 0,052; p = 0,958 ile iki yöntem arasında sistematik fark yoktur. Farkların ortancası 0 ve r = 0,012 ile etki ihmal edilebilir düzeydedir; ortanca değişimin %95 güven aralığı -1,50 ile 2,00 arasında olup sıfırı kapsar.

T test istatistiği: 27,0 · Pozitif sıra toplamı (W⁺): 28,0 · Negatif sıra toplamı (W⁻): 27,0

Aykırı değerli küçük örneklem — süreklilik düzeltmeli

Sekiz hastanın tamamında ölçüm düşmüştür: W⁺ = 0, W⁻ = 36 ve T = 0. Süreklilik düzeltmeli z = -2,466; p = 0,014 ile düşüş anlamlıdır. Bir hastadaki 42 birimlik uç düşüş ortalamayı çarpıtsa da sıra tabanlı test bundan etkilenmez; farkların ortancası -7,50 ve r = 0,634 ile etki büyüktür. Ortanca değişimin %95 güven aralığı -24,50 ile -5,50 arasındadır.

T test istatistiği: 0,0 · Pozitif sıra toplamı (W⁺): 0,0 · Negatif sıra toplamı (W⁻): 36,0

Sıkça Sorulan Sorular

Wilcoxon işaretli sıralar testi ile Mann-Whitney U testi arasındaki fark nedir?
Wilcoxon işaretli sıralar testi bağımlı (eşleştirilmiş) ölçümler içindir: aynı denek iki kez ölçülmüştür. Mann-Whitney U testi ise birbirinden bağımsız iki grubu karşılaştırır. Adlandırma karışıklığının nedeni, Mann-Whitney U testinin 'Wilcoxon sıra toplamı testi' olarak da anılmasıdır; iki test farklıdır ve tasarıma göre seçilir.
Farkı sıfır olan çiftlere ne oluyor?
Wilcoxon'un klasik yaklaşımında bu çiftler tamamen atılır ve etkin örneklem küçülür; bu araç da aynı yolu izler ve kaç çiftin atıldığını raporlar. Pratt yöntemi ise sıfır farkları sıralamaya dahil edip sıra toplamlarından düşer, bu da biraz daha muhafazakâr bir p üretir. Çok sayıda sıfır fark varsa test gücü ciddi biçimde azalır; böyle durumlarda ölçüm hassasiyetini artırmak gerekir.
Eşleştirilmiş t testi yerine ne zaman bu testi kullanmalıyım?
Farkların dağılımı normallikten belirgin biçimde saptığında, örneklem küçük olduğunda (n < 30) veya farklarda aykırı değer bulunduğunda Wilcoxon tercih edilir. Veri sıralı ölçekteyse (ağrı skoru, memnuniyet derecesi) fark ortalaması zaten anlamlı olmadığı için Wilcoxon doğru seçimdir. Normallik sağlanıyorsa eşleştirilmiş t testi biraz daha güçlüdür.
SPSS, R ve Excel'de aynı sonucu nasıl alırım?
SPSS'te Analyze → Nonparametric Tests → Related Samples yolu izlenir; çıktıdaki 'Asymp. Sig. (2-tailed)' bu araçtaki süreklilik düzeltmesiz p değeridir. R'da wilcox.test(x2, x1, paired = TRUE, correct = FALSE) aynı z ve p'yi verir; conf.int = TRUE eklenirse Hodges-Lehmann güven aralığı da yazdırılır. Excel'de hazır bir fonksiyon yoktur, sıralar elle kurulmalıdır.
Test hangi varsayımlara dayanır?
Çiftler birbirinden bağımsız olmalı, farklar en az sıralı ölçekte bulunmalı ve ortanca farkı yorumu için farkların dağılımı ortanca etrafında yaklaşık simetrik olmalıdır. Normallik gerekmez. Simetri varsayımı da kuşkuluysa yalnızca işaretleri kullanan işaret testi tercih edilir; ancak işaret testi fark büyüklüğünü yok saydığı için daha az güçlüdür.
Etki büyüklüğünü neden iki farklı biçimde raporluyorsunuz?
Alan yazında iki gelenek vardır: Field'ın önerdiği r = |z|/√(2n) toplam gözlem sayısını (her denek iki kez ölçüldüğü için 2n) kullanır; diğer gelenek r = |z|/√n ile çift sayısını kullanır. İkincisi daha büyük değer üretir. Hangi geleneği kullandığınızı yöntem bölümünde açıkça belirtmeniz, sonuçların yanlış karşılaştırılmasını önler.
Üçten fazla tekrarlı ölçüm için ne kullanmalıyım?
Aynı deneklerden üç veya daha fazla koşulda ölçüm alındıysa Friedman testi uygulanır; Wilcoxon'u tüm ikili karşılaştırmalara uygulamak birinci tip hatayı şişirir. Friedman anlamlı çıkarsa ikili karşılaştırmalar Wilcoxon ile yapılıp Bonferroni düzeltmesi uygulanabilir. Parametrik alternatif tekrarlı ölçümler ANOVA'sıdır.