A/B Testini Yanlış Okumak: Erken Durdurma ve Anlamlılık Yanılgısı
Test kazandı diye erken durdurmak, çoğu şirkette var olmayan iyileşmeleri gerçek sanmanın bir numaralı sebebi.
A/B testi, ürün kararlarını sezgiden kurtarmanın en güçlü aracıdır — doğru okunduğunda. Yanlış okunduğunda ise sezgiden daha tehlikelidir, çünkü yanlış karara bilimsel bir görünüm kazandırır. Sahada gördüğümüz en yaygın senaryo şudur: test iki gün sonra kazanır, ekip heyecanla değişikliği yayınlar ve üç ay sonra hiçbir metrikte iyileşme görülmez.

Bir numaralı hata: erken durdurma
Testi izlerken sonuç "anlamlı" göründüğü anda durdurmak, istatistiksel olarak en pahalı alışkanlıktır. Sebebi şudur: sonuçlara ne kadar sık bakar ve istediğiniz sonucu gördüğünüzde durdurursanız, tamamen rastlantısal bir dalgalanmayı gerçek etki sanma olasılığınız o kadar artar. Günde birkaç kez bakıp "kazandı" deyip durdurulan testlerde yanlış pozitif oranı, hedeflenen %5'in çok üzerine çıkar.
Doğru yöntem, örneklem büyüklüğünü ve test süresini başlamadan önce belirlemek ve o noktaya kadar sonuca göre karar vermemektir. Sürekli izleme gerekiyorsa bunun için tasarlanmış yöntemler (sıralı test yaklaşımları) kullanılmalıdır; klasik testi sürekli izleyip erken kesmek bunlarla aynı şey değildir.
Örneklem büyüklüğü: tahminle değil hesapla
"Bin kullanıcı yeter herhalde" cümlesi, çoğu testin daha başlamadan anlamsız olmasının sebebidir. Gereken örneklem, üç şeye bağlıdır: mevcut dönüşüm oranı, tespit etmek istediğiniz en küçük fark ve kabul ettiğiniz hata payları.
Pratik sonuç genellikle şaşırtıcıdır: %2 dönüşüm oranına sahip bir sayfada %10'luk göreli bir iyileşmeyi güvenle tespit etmek, varyant başına on binlerce ziyaretçi gerektirir. Trafiğiniz buna yetmiyorsa yapılacak şey testi yine de çalıştırmak değil, ya daha büyük bir değişiklik denemek ya da metriği hunide daha yukarı taşımaktır (satın alma yerine sepete ekleme gibi).
p değeri ne demek değildir
En yaygın yanlış yorum şudur: "p = 0,03, yani B'nin daha iyi olma olasılığı %97." Bu doğru değildir. p değeri, gerçekte hiç fark yokken bu kadar büyük bir farkı gözlemleme olasılığını söyler. Hipotezin doğru olma olasılığını vermez.
İkinci yaygın hata, anlamlı çıkmayan bir testi "fark yok" diye okumaktır. Anlamsız sonuç, farkın olmadığını değil, mevcut veriyle gösterilemediğini gösterir. Güven aralığına bakmak bu ayrımı netleştirir: aralık dar ve sıfır etrafındaysa gerçekten etki yoktur; geniş ve büyük değerleri kapsıyorsa yalnızca veri yetersizdir.
Çoklu karşılaştırma tuzağı
Tek testte yirmi farklı metriğe bakarsanız, hiçbir gerçek etki olmasa bile bunlardan birinin "anlamlı" çıkması beklenir. Aynı sorun, kullanıcıyı segmentlere bölüp "mobilde kazandı" demeye çalışırken de ortaya çıkar.
Korunma yolu basittir: teste başlamadan tek bir birincil metrik belirleyin. Diğerleri koruma metriği olarak izlenir (bir şeyi bozmadık mı?) ama karar birincil metriğe göre verilir. Segment analizleri hipotez üretmek için değerlidir, karar vermek için değil — bulgu, ayrı bir testle doğrulanmalıdır. Metriklerin ne anlama geldiği konusunda ekipte ortak dil yoksa bu tartışma hiç bitmez; şirket içi veri sözlüğü yazımız bu zemini kurmayı ele alıyor.
Süre ve mevsimsellik
Kullanıcı davranışı hafta içi ve hafta sonu farklıdır; sabah ve gece farklıdır. Salı günü başlayıp perşembe biten bir test, haftanın yalnızca bir dilimini ölçer. Pratik kural, testi tam hafta katlarında çalıştırmak ve en az bir tam haftayı kapsamasını sağlamaktır. Kampanya dönemleri, tatiller ve büyük duyurular test sonuçlarını bozar; bu dönemlerde başlatılan testler ayrıca dikkatle yorumlanmalıdır.
İstatistiksel değil, pratik anlamlılık
Yeterince büyük örneklemle çok küçük farklar bile istatistiksel olarak anlamlı çıkar. Asıl soru şudur: bu fark, uygulama ve bakım maliyetine değer mi? Dönüşümde %0,2'lik bir artış, iki haftalık geliştirme ve kalıcı bir bakım yükü gerektiriyorsa, "kazanan" varyant aslında kaybettiriyor olabilir. Karar tartışmasına her zaman etkinin büyüklüğü ve maliyetiyle birlikte girin.
Teknik doğruluk: test gerçekten çalışıyor mu?
İstatistikten önce gelen bir kontrol vardır: atama gerçekten rastgele mi, aynı kullanıcı her seferinde aynı varyantı görüyor mu, ölçüm iki grupta da aynı şekilde toplanıyor mu? Sık görülen bir bozulma, varyantlardan birinin daha yavaş yüklenmesidir; bu durumda ölçtüğünüz şey tasarım değil hızdır. Terk noktası analizinin ürün dışı bir alandaki uygulaması için oyunda zorluk eğrisi yazımıza bakabilirsiniz. Ölçüm altyapısındaki sessiz kaymalar için veri kayması yazımızdaki izleme mantığı burada da geçerlidir; veri kalitesinin temeli için veri temizleme yazımıza bakabilirsiniz. Analiz araçlarının pratik kullanımı için pandas dokümantasyonu iyi bir başlangıçtır.
Sonuç
A/B testi, disiplinle uygulandığında ürün kararlarının kalitesini kökten değiştirir; disiplinsiz uygulandığında ise yanlış kararlara sahte bir güven kazandırır. Örneklem büyüklüğünü baştan hesaplamak, sonuca bakarak erken durdurmamak, tek bir birincil metrik belirlemek, testi tam haftalara yaymak ve kararı pratik anlamlılığa göre vermek — bu beş kural, yanlış pozitiflerin büyük kısmını ortadan kaldırır. Bir sonraki testinize başlamadan önce tek bir cümle yazın: "Bu testi X kullanıcıya ulaşınca durduracağım ve kararı Y metriğine göre vereceğim." Bu cümle, testin en değerli parçasıdır.
Sık Sorulan Sorular
Önceden hesaplanan örneklem büyüklüğüne ulaşana kadar ve en az bir tam hafta. Haftanın farklı günlerindeki davranış farkı nedeniyle süreyi tam hafta katlarında tutmak yanıltıcı sonuçları azaltır.
Küçük farkları ölçemezsiniz, ancak büyük değişiklikleri test edebilirsiniz. Alternatif olarak metriği huninin daha üst basamağına taşımak (satın alma yerine tıklama) gereken örneklemi belirgin biçimde düşürür.
Hayır. "Fark gösterilemedi" bilgisi de değerlidir ve çoğu zaman gereksiz bir değişikliği yayınlamaktan kurtarır. Başarısız olan test, kararı değiştirmeyen testtir.
Testler birbirinden bağımsız alanlara dokunuyorsa genellikle sorun olmaz. Aynı akışı etkileyen testler eş zamanlı çalıştığında etkiler karışır ve sonuçlar yorumlanamaz hâle gelir.
Yorumlar (0)
Bu yazıya henüz yorum yapılmamış. İlk yorumu siz yazın!
Yorum Yaz
Yorumunuz onaylandıktan sonra yayınlanır. Ekibimiz gerekirse konuyla ilgili bir yanıt da paylaşır.