Cohen Kappa Hesaplama

İstatistikSon güncelleme: 22 Ağustos 2026

Cohen kappa (κ), aynı olguları bağımsız olarak sınıflandıran iki gözlemcinin ne ölçüde uyuştuğunu, şans eseri beklenen uyumu düşerek ölçer. İçerik analizinde kodlayıcılar arası güvenirlik, tıpta iki hekimin tanı uyumu, makine öğrenmesinde etiketleyici tutarlılığı hep bu katsayıyla raporlanır.

Ham yüzde uyum yanıltıcıdır: iki gözlemci hiç bakmadan rastgele karar verse bile belirli bir uyum kendiliğinden oluşur. Kappa bu şans payını düşer. Bu araç uyum matrisinizden κ değerini, gözlenen uyum pₒ ile şans uyumu pₑ'yi, asimptotik standart hatayı, z istatistiğini, p değerini, güven aralığını ve marjinaller sabitken ulaşılabilecek en yüksek değer olan κ_max'i hesaplar; Landis-Koch ölçeğinde yorumunu verir.

Kare matris girin: matris[i][j], birinci gözlemcinin i, ikinci gözlemcinin j kategorisine atadığı olgu sayısıdır. Köşegen tam uyumu gösterir. Satır ve sütun kategori sıralaması AYNI olmalıdır.
Virgülle ayırın. Boş bırakırsanız "Kategori 1, Kategori 2, …" kullanılır.
Aralığın gerçek parametreyi kapsama olasılığı.
Yanlış pozitif riskini belirler. Sosyal bilimlerde yaygın seçim %5'tir.

Cohen Kappa Formülleri

Gözlenen uyum:     pₒ = Σᵢ pᵢᵢ  (köşegen oranlarının toplamı)
Şans uyumu:        pₑ = Σᵢ pᵢ. · p.ᵢ  (marjinal oranların çarpımları)
Cohen kappa:       κ = (pₒ − pₑ) / (1 − pₑ)
Güven aralığı:     κ ± z_{1−α/2} · SE(κ)
Test istatistiği:  z = κ / SE₀,  SE₀ = H₀: κ = 0 altındaki standart hata
Ulaşılabilir en üst: pₒ,max = Σᵢ min(pᵢ., p.ᵢ),  κ_max = (pₒ,max − pₑ) / (1 − pₑ)
Yorum ölçeği:      < 0 uyumsuz · 0–0,20 önemsiz · 0,21–0,40 zayıf
                   0,41–0,60 orta · 0,61–0,80 iyi · 0,81–1,00 çok iyi

Standart hata Fleiss, Cohen ve Everitt'in (1969) asimptotik varyans formülüyle hesaplanır; SPSS'in Crosstabs > Kappa çıktısındaki değerle aynıdır. Landis-Koch eşikleri geleneksel ve keyfîdir, alanın klinik önemine göre değişir.

Nasıl Hesaplanır?

  1. İki gözlemcinin sınıflandırmalarını kare bir uyum matrisine dökün: satırlar birinci gözlemcinin, sütunlar ikinci gözlemcinin kategorileridir.
  2. Matrisin her satırını ayrı bir satır olarak kutuya yazın; kategori sıralamasının satır ve sütunlarda aynı olmasına dikkat edin.
  3. Kategori adlarını virgülle ayırarak girin; matris ve grafikler bu adlarla etiketlenir.
  4. Güven düzeyini ve anlamlılık düzeyini seçin, ardından κ değerini güven aralığıyla birlikte okuyun.
  5. Gözlenen uyum ile kappa arasındaki farkı inceleyin: fark büyükse yüzde uyumun ne kadar yanıltıcı olduğunu görürsünüz.
  6. κ_max değerini kontrol edin; 1'in belirgin altındaysa beklenenden düşük çıkan bir κ, gerçek uyumsuzluktan değil marjinal dengesizlikten kaynaklanıyor olabilir.

Örnek Hesaplamalar

İki hekimin tanı uyumu (2×2)

100 olgunun 85'inde iki hekim aynı kararı vermiş; gözlenen uyum %85,00, şans uyumu %50,00'dir. κ = 0,7000 (%95 GA: 0,5607 – 0,8393), z = 7,0353 ve p < 0,001 ile uyum şanstan anlamlı biçimde farklıdır. Landis-Koch ölçeğinde iyi uyum düzeyine karşılık gelir ve κ_max = 0,9000'dir.

Cohen kappa (κ): 0,7000 · %95 güven aralığı: 0,5607 – 0,8393 · Gözlenen uyum (pₒ): %85,00

Üç kategorili içerik kodlaması (3×3)

100 metnin 79'unda iki kodlayıcı aynı kategoriyi seçmiştir: pₒ = %79,00 ve pₑ = %33,80. κ = 0,6828 (%95 GA: 0,5617 – 0,8039) ile iyi uyum elde edilir; p < 0,001'dir. κ_max = 0,9698 olduğundan gözlemcilerin kategori kullanım sıklıkları birbirine yakındır.

Cohen kappa (κ): 0,6828 · %95 güven aralığı: 0,5617 – 0,8039 · Gözlenen uyum (pₒ): %79,00

Kappa paradoksu: yüksek yüzde uyum, düşük kappa

Gözlenen uyum yine %85,00'tir, ancak kategorilerden biri çok baskın olduğu için şans uyumu %78,00'e yükselir ve κ = 0,3182'ye (%95 GA: 0,0566 – 0,5798) düşer. Landis-Koch ölçeğinde bu yalnızca zayıf uyumdur; κ_max = 0,7727 olduğundan marjinal dengesizlik de sonucu aşağı çekmektedir.

Cohen kappa (κ): 0,3182 · %95 güven aralığı: 0,0566 – 0,5798 · Gözlenen uyum (pₒ): %85,00

Sıkça Sorulan Sorular

Yüzde uyum yerine neden kappa kullanılır?
Yüzde uyum şans eseri oluşan uyumu içerir. İki kodlayıcı yazı tura atarak karar verse bile iki kategorili bir görevde ortalama %50 uyum çıkar; kategorilerden biri baskınsa bu oran %80'in üzerine bile çıkabilir. Kappa, gözlenen uyumdan şans uyumunu çıkarıp kalan payı şansın ötesindeki azami uyuma bölerek bu yanılsamayı ortadan kaldırır.
Kappa paradoksu nedir?
Kategorilerden biri çok yaygın olduğunda şans uyumu (pₑ) çok yükselir ve payda küçülür; bu yüzden %90 gibi yüksek bir gözlenen uyuma rağmen kappa 0,20'nin altında kalabilir. Nadir olayların değerlendirildiği tanı çalışmalarında sık karşılaşılır. Bu durumda kappa ile birlikte gözlenen uyumu, marjinal dağılımları ve κ_max değerini de raporlamak gerekir.
κ_max ne işe yarar?
κ_max, satır ve sütun marjinalleri verilmişken ulaşılabilecek en yüksek kappa değeridir. Gözlemciler kategorileri farklı sıklıklarla kullanıyorsa (biri "olumlu" derken diğeri sürekli "nötr" diyorsa) tam uyum matematiksel olarak mümkün değildir ve κ_max 1'in altında kalır. Düşük bir kappa'nın gerçek uyumsuzluktan mı yoksa marjinal dengesizlikten mi kaynaklandığını ancak κ / κ_max oranına bakarak anlarsınız.
Kappa değeri kaç olmalı?
Landis ve Koch'un 1977 ölçeği yaygındır: 0,41–0,60 orta, 0,61–0,80 iyi, 0,81 ve üzeri çok iyi uyum. Ancak bu eşikler keyfîdir. Yayın pratiğinde içerik analizinde 0,80, klinik tanı çalışmalarında 0,60 alt sınır olarak kabul edilir. Kararın sonuçları ne kadar ağırsa beklenen kappa da o kadar yüksek olmalıdır.
İkiden fazla gözlemci varsa ne yapılır?
Cohen kappa yalnızca iki gözlemci içindir. Üç ve daha fazla değerlendirici varsa Fleiss kappa kullanılır; bu ölçü aynı olguları farklı gözlemci gruplarının değerlendirdiği durumda da çalışır. Sıralı ya da sürekli ölçümlerde sınıf içi korelasyon katsayısı (ICC), içerik analizinde ise Krippendorff alfa tercih edilir.
Sıralı kategorilerde hangi kappa kullanılmalı?
Kategoriler sıralıysa (hafif – orta – ağır gibi) basit kappa, "hafif" ile "ağır" arasındaki uyuşmazlığı "hafif" ile "orta" arasındaki kadar cezalandırır; bu bilgi kaybıdır. Bu durumda ağırlıklı kappa kullanılır: doğrusal ağırlıklar komşu kategorilere kısmi puan verir, kuadratik ağırlıklar büyük sapmaları daha sert cezalandırır ve iki kategoride ICC ile aynı sonucu üretir.
SPSS ve R ile aynı sonucu alır mıyım?
Evet. SPSS'te Crosstabs > Statistics > Kappa kutusu işaretlendiğinde aynı κ, asimptotik standart hata, z ("Approx. T") ve p değeri üretilir. R'de psych paketindeki cohen.kappa() veya irr paketindeki kappa2() aynı sonucu verir; psych paketi ayrıca ağırlıklı kappa'yı da raporlar. Küçük farklar yalnızca güven aralığı yönteminden kaynaklanabilir.