Lojistik regresyon nasıl yapılır ve yorumlanır?
Bağımlı değişken evet/hayır olduğunda. Odds oranı ne demek, 1'den küçük çıkarsa ne anlama gelir, hangi uyum ölçüsüne bakılır?
Lojistik regresyon, bağımlı değişkenin iki kategorili olduğu durumlarda (evet/hayır, var/yok, ayrıldı/kaldı) bir olayın gerçekleşme olasılığını yordayan analizdir.
Doğrusal regresyon burada kullanılamaz: 0 ile 1 arasında olması gereken bir olasılık için doğrusal model 1,3 ya da −0,2 gibi anlamsız değerler üretir. Lojistik regresyon bu sorunu, olasılığı logit dönüşümüyle modelleyerek çözer.
Ne zaman kullanılır?
- Bağımlı değişken ikili: İşten ayrıldı mı? Ürünü satın aldı mı? Hastalık var mı?
- Bağımsız değişkenler sürekli, sıralı ya da kategorik olabilir — karışık olması sorun değil
Bağımlı değişken ikiden fazla kategoriliyse multinomiyal lojistik regresyon, kategoriler sıralıysa ordinal lojistik regresyon kullanılır.
Varsayımlar
Doğrusal regresyona göre daha esnektir:
- Bağımlı değişken ikili olmalı
- Gözlemler bağımsız
- Çoklu bağlantı olmamalı — VIF < 10
- Logit ile sürekli yordayıcılar arasında doğrusallık (Box-Tidwell testi ile bakılır; tezlerde sık atlanır)
- Aykırı değerlerin kontrolü
Normallik ve eşvaryanslılık gerekmez — lojistik regresyonun en büyük avantajı budur.
Örneklem büyüklüğü
Buradaki kural, toplam katılımcı sayısı değil az olan kategorideki gözlem sayısıdır. Yaygın ölçüt:
Yordayıcı başına en az 10 olay (events per variable).
300 kişilik bir örneklemde yalnızca 20 kişi "ayrıldı" diyorsa, elinizde 20 olay var demektir; bu da en fazla 2 yordayıcı taşır. Toplam sayıya bakıp "300 kişi var, 8 değişken koyarım" demek yaygın ve ciddi bir hatadır.
SPSS'te nasıl yapılır?
Analyze → Regression → Binary Logistic
- Dependent → ikili bağımlı değişken (0 ve 1 olarak kodlu olmalı; 1 = ilgilendiğiniz olay)
- Covariates → yordayıcılar
- Categorical → kategorik yordayıcıları buraya taşıyın ve referans kategoriyi seçin. Bu adım atlanırsa SPSS kategorik değişkeni sayısal sanır ve sonuçlar anlamsız çıkar.
- Options → Hosmer-Lemeshow goodness-of-fit, CI for exp(B) ve Classification plots
Çıktı nasıl okunur?
Omnibus Tests of Model Coefficients
Modelin bir bütün olarak anlamlı olup olmadığını gösterir. Sig. < .05 ise model, hiç yordayıcı içermeyen boş modelden daha iyidir. Anlamsızsa katsayıları yorumlamaya geçmeyin.
Model Summary
- −2 Log likelihood — küçüldükçe uyum artar, tek başına yorumlanmaz
- Cox & Snell R² — teorik üst sınırı 1 değildir, bu yüzden tek başına kullanılmaz
- Nagelkerke R² — düzeltilmiş sürüm, 0-1 arası. Raporlanan genellikle budur. Doğrusal regresyondaki R² ile aynı şey değildir; "sözde R²" (pseudo) olduğunu belirtmek gerekir.
Hosmer and Lemeshow Test
Sezgiye ters çalışır: anlamsız çıkmasını istersiniz. Sig. > .05 ise model verilere uyuyor demektir. Anlamlı çıkarsa uyum zayıftır.
Büyük örneklemde bu test aşırı duyarlı hâle gelir ve neredeyse her zaman anlamlı çıkar; tek başına karar vermeyin.
Classification Table
Modelin doğru sınıflandırma yüzdesi. Buna bakarken dikkat: kategoriler dengesizse yanıltıcıdır. %90'ı "kalmış" olan bir veride model herkese "kalır" dese %90 doğruluk elde eder ama hiçbir şey öğrenmemiştir. Her iki kategorinin ayrı doğruluk oranına bakın.
Variables in the Equation — asıl tablo
- B — logit ölçeğinde katsayı, doğrudan yorumlanmaz
- Wald ve Sig. — o yordayıcı anlamlı mı
- Exp(B) — odds oranı. Yorumun kalbi burasıdır.
Odds oranı nasıl yorumlanır?
Odds oranı, yordayıcı bir birim arttığında olayın gerçekleşme bahis oranının kaç katına çıktığını söyler.
- Exp(B) = 1 → etki yok
- Exp(B) > 1 → olasılığı artırıyor. 1,45 ise bir birim artış, olayın bahis oranını %45 artırıyor.
- Exp(B) < 1 → olasılığı azaltıyor. 0,70 ise bahis oranı %30 azalıyor (1 − 0,70).
Kategorik yordayıcılarda yorum referans kategoriye göredir: cinsiyette referans "kadın" ise erkekler için Exp(B) = 1,80, "erkeklerde olayın bahis oranı kadınlara göre 1,8 kat" demektir.
%95 güven aralığını mutlaka verin. Aralık 1'i içeriyorsa etki anlamlı değildir — bu, p değerinden bağımsız hızlı bir kontroldür.
Sık yapılan bir yorum hatası: odds oranını "olasılık kaç kat" diye okumak. Odds (bahis oranı) ile olasılık farklı şeylerdir. Olay nadirse ikisi birbirine yaklaşır, yaygınsa ciddi biçimde ayrışır. "Bahis oranı" ifadesini kullanmak daha doğrudur.
Aykırı ve etkili gözlemler
Lojistik regresyon tek tek gözlemlere doğrusal regresyondan daha duyarlıdır; birkaç uç gözlem katsayıları belirgin biçimde kaydırabilir.
Save düğmesinden şunları isteyin:
- Standardized residuals — mutlak değeri 2,5'i aşan gözlemler modelin kötü tahmin ettiği kişilerdir
- Cook's distance — 1'i aşan değerler modele orantısız etki eden gözlemleri işaret eder
- Leverage values — ortalamanın üç katını aşanlar incelenir
Bu gözlemleri bulduğunuzda hemen silmeyin. Önce veri girişi hatası mı diye bakın. Gerçek bir gözlemse silmek yerine, sildiğinizde sonuçların değişip değişmediğini raporlamak (duyarlılık analizi) çok daha savunulabilir bir yaklaşımdır.
Tam ayrışma (complete separation) ayrı bir sorundur: bir yordayıcı bağımlı değişkeni kusursuz ayırıyorsa katsayılar sonsuza gider ve SPSS aşırı büyük standart hatalar üretir. Exp(B) değerinin binlerle ifade edilmesi bunun tipik işaretidir. Çözüm genellikle o değişkeni çıkarmak ya da kategorileri birleştirmektir.
Nasıl raporlanır?
Çalışanların işten ayrılma durumunu yordayan değişkenleri belirlemek amacıyla ikili lojistik regresyon analizi uygulanmıştır. Kurulan model istatistiksel olarak anlamlıdır (χ²(4) = 38,62; p < .001) ve Hosmer-Lemeshow testi modelin verilere uyduğunu göstermektedir (χ²(8) = 6,14; p = .632). Model, ayrılma durumundaki varyansın %19'unu açıklamaktadır (Nagelkerke R² = .19) ve katılımcıların %78,4'ünü doğru sınıflandırmaktadır. Örgütsel bağlılık puanındaki bir birimlik artış, işten ayrılma bahis oranını %38 azaltmaktadır (B = −0,48; Wald = 12,31; p < .001; Exp(B) = 0,62; %95 GA [0,47-0,81]).
Sık yapılan hatalar
- Kategorik değişkenleri Categorical kutusuna koymamak. SPSS onları sayısal sanar; "medeni durum 3" gibi anlamsız bir yorum çıkar.
- Olay sayısını değil toplam N'i esas almak. Az olan kategori küçükse model taşımaz.
- Exp(B)'yi olasılık gibi okumak. Odds ile olasılık farklıdır.
- Nagelkerke R²'yi doğrusal R² gibi sunmak. "Sözde R²" olduğunu belirtin; %19 burada düşük sayılmaz.
- Sınıflandırma yüzdesine dengesiz veride güvenmek.
- Referans kategoriyi belirtmeden yorumlamak. Okuyucu neye göre karşılaştırıldığını bilemez.
Sık sorulan sorular
Nagelkerke R² kaç olmalı? Doğrusal regresyondaki gibi yüksek beklenmez. Sosyal bilimlerde .20 civarı değerler olağandır ve modelin işe yaramadığı anlamına gelmez.
Bağımlı değişkenim 3 kategorili, ne yapmalıyım? Multinomiyal lojistik regresyon (kategoriler sırasızsa) ya da ordinal lojistik regresyon (sıralıysa) kullanın. SPSS'te ikisi de ayrı menüde.
Doğrusal regresyon yapıp yuvarlasam olmaz mı? Olmaz. Sınır dışı olasılıklar üretir, hata terimleri varsayımları ihlal eder ve katsayılar yanlı çıkar.
Hangi yordayıcıları modele koymalıyım? Kuramsal gerekçesi olanları. Adımsal (stepwise) yöntemler veriye göre değişken seçtiği için eleştiri alır; danışmanınız istemedikçe kaçının.
Lojistik regresyonda asıl zorluk hesaplama değil, odds oranını doğru cümleyle anlatmak. Analizinizi APA tabloları ve yorum metniyle birlikte teslim edebiliriz: veri analizi hizmetimiz.