---
title: "A/B Testini Yanlış Okumak: Erken Durdurma ve Anlamlılık Yanılgısı"
url: "https://cilginyazilim.com/blog/ab-testini-yanlis-okumak-erken-durdurma"
description: "A/B testi sonuçları neden yanıltır? Erken durdurma, çoklu karşılaştırma, örneklem büyüklüğü ve pratik anlamlılık üzerine uygulanabilir bir rehber."
published: "2026-08-06T18:00:00+03:00"
modified: "2026-08-09T03:11:32+03:00"
author: "superadmin"
category: "Yapay Zekâ ve Veri"
tags: ["veri analizi", "veri bilimi", "karar verme", "a/b testi", "istatistik", "deney tasarımı", "p değeri", "örneklem büyüklüğü", "dönüşüm oranı", "erken durdurma", "çoklu karşılaştırma", "ürün geliştirme", "metrik"]
site: "CılgınYazılım"
language: "tr"
---

# A/B Testini Yanlış Okumak: Erken Durdurma ve Anlamlılık Yanılgısı

Test kazandı diye erken durdurmak, çoğu şirkette var olmayan iyileşmeleri gerçek sanmanın bir numaralı sebebi.

**A/B testi**, ürün kararlarını sezgiden kurtarmanın en güçlü aracıdır — doğru okunduğunda. Yanlış okunduğunda ise sezgiden daha tehlikelidir, çünkü yanlış karara bilimsel bir görünüm kazandırır. Sahada gördüğümüz en yaygın senaryo şudur: test iki gün sonra kazanır, ekip heyecanla değişikliği yayınlar ve üç ay sonra hiçbir metrikte iyileşme görülmez.

![A/B testi kuralları listesi](https://cilginyazilim.com/uploads/blog/2026/08/ab-testini-yanlis-okumak-erken-durdurma-ozet.png)
*Sonuçlara sürekli bakmak, yanlış pozitif oranını sessizce katlar.*

## Bir numaralı hata: erken durdurma

Testi izlerken sonuç "anlamlı" göründüğü anda durdurmak, istatistiksel olarak en pahalı alışkanlıktır. Sebebi şudur: sonuçlara ne kadar sık bakar ve istediğiniz sonucu gördüğünüzde durdurursanız, tamamen rastlantısal bir dalgalanmayı gerçek etki sanma olasılığınız o kadar artar. Günde birkaç kez bakıp "kazandı" deyip durdurulan testlerde yanlış pozitif oranı, hedeflenen %5'in çok üzerine çıkar.

Doğru yöntem, örneklem büyüklüğünü ve test süresini *başlamadan önce* belirlemek ve o noktaya kadar sonuca göre karar vermemektir. Sürekli izleme gerekiyorsa bunun için tasarlanmış yöntemler (sıralı test yaklaşımları) kullanılmalıdır; klasik testi sürekli izleyip erken kesmek bunlarla aynı şey değildir.

## Örneklem büyüklüğü: tahminle değil hesapla

"Bin kullanıcı yeter herhalde" cümlesi, çoğu testin daha başlamadan anlamsız olmasının sebebidir. Gereken örneklem, üç şeye bağlıdır: mevcut dönüşüm oranı, tespit etmek istediğiniz en küçük fark ve kabul ettiğiniz hata payları.

Pratik sonuç genellikle şaşırtıcıdır: %2 dönüşüm oranına sahip bir sayfada %10'luk göreli bir iyileşmeyi güvenle tespit etmek, varyant başına on binlerce ziyaretçi gerektirir. Trafiğiniz buna yetmiyorsa yapılacak şey testi yine de çalıştırmak değil, ya daha büyük bir değişiklik denemek ya da metriği hunide daha yukarı taşımaktır (satın alma yerine sepete ekleme gibi).

## p değeri ne demek değildir

En yaygın yanlış yorum şudur: "p = 0,03, yani B'nin daha iyi olma olasılığı %97." Bu doğru değildir. p değeri, *gerçekte hiç fark yokken* bu kadar büyük bir farkı gözlemleme olasılığını söyler. Hipotezin doğru olma olasılığını vermez.

İkinci yaygın hata, anlamlı çıkmayan bir testi "fark yok" diye okumaktır. Anlamsız sonuç, farkın olmadığını değil, mevcut veriyle gösterilemediğini gösterir. Güven aralığına bakmak bu ayrımı netleştirir: aralık dar ve sıfır etrafındaysa gerçekten etki yoktur; geniş ve büyük değerleri kapsıyorsa yalnızca veri yetersizdir.

## Çoklu karşılaştırma tuzağı

Tek testte yirmi farklı metriğe bakarsanız, hiçbir gerçek etki olmasa bile bunlardan birinin "anlamlı" çıkması beklenir. Aynı sorun, kullanıcıyı segmentlere bölüp "mobilde kazandı" demeye çalışırken de ortaya çıkar.

Korunma yolu basittir: teste başlamadan **tek bir birincil metrik** belirleyin. Diğerleri koruma metriği olarak izlenir (bir şeyi bozmadık mı?) ama karar birincil metriğe göre verilir. Segment analizleri hipotez üretmek için değerlidir, karar vermek için değil — bulgu, ayrı bir testle doğrulanmalıdır. Metriklerin ne anlama geldiği konusunda ekipte ortak dil yoksa bu tartışma hiç bitmez; [şirket içi veri sözlüğü](https://cilginyazilim.com/blog/sirket-ici-veri-sozlugu-metrik-tanimlarini-birlestirmek) yazımız bu zemini kurmayı ele alıyor.

## Süre ve mevsimsellik

Kullanıcı davranışı hafta içi ve hafta sonu farklıdır; sabah ve gece farklıdır. Salı günü başlayıp perşembe biten bir test, haftanın yalnızca bir dilimini ölçer. Pratik kural, testi tam hafta katlarında çalıştırmak ve en az bir tam haftayı kapsamasını sağlamaktır. Kampanya dönemleri, tatiller ve büyük duyurular test sonuçlarını bozar; bu dönemlerde başlatılan testler ayrıca dikkatle yorumlanmalıdır.

## İstatistiksel değil, pratik anlamlılık

Yeterince büyük örneklemle çok küçük farklar bile istatistiksel olarak anlamlı çıkar. Asıl soru şudur: bu fark, uygulama ve bakım maliyetine değer mi? Dönüşümde %0,2'lik bir artış, iki haftalık geliştirme ve kalıcı bir bakım yükü gerektiriyorsa, "kazanan" varyant aslında kaybettiriyor olabilir. Karar tartışmasına her zaman etkinin büyüklüğü ve maliyetiyle birlikte girin.

## Teknik doğruluk: test gerçekten çalışıyor mu?

İstatistikten önce gelen bir kontrol vardır: atama gerçekten rastgele mi, aynı kullanıcı her seferinde aynı varyantı görüyor mu, ölçüm iki grupta da aynı şekilde toplanıyor mu? Sık görülen bir bozulma, varyantlardan birinin daha yavaş yüklenmesidir; bu durumda ölçtüğünüz şey tasarım değil hızdır. Terk noktası analizinin ürün dışı bir alandaki uygulaması için [oyunda zorluk eğrisi](https://cilginyazilim.com/blog/oyunda-zorluk-egrisi-oyuncuyu-nerede-kaybediyorsunuz) yazımıza bakabilirsiniz. Ölçüm altyapısındaki sessiz kaymalar için [veri kayması](https://cilginyazilim.com/blog/uretimde-veri-kaymasi-model-bozulmasi) yazımızdaki izleme mantığı burada da geçerlidir; veri kalitesinin temeli için [veri temizleme](https://cilginyazilim.com/blog/veri-analizi-surecinde-en-kritik-asama-veri-temizleme) yazımıza bakabilirsiniz. Analiz araçlarının pratik kullanımı için [pandas dokümantasyonu](https://pandas.pydata.org/docs/) iyi bir başlangıçtır.

## Sonuç

A/B testi, disiplinle uygulandığında ürün kararlarının kalitesini kökten değiştirir; disiplinsiz uygulandığında ise yanlış kararlara sahte bir güven kazandırır. Örneklem büyüklüğünü baştan hesaplamak, sonuca bakarak erken durdurmamak, tek bir birincil metrik belirlemek, testi tam haftalara yaymak ve kararı pratik anlamlılığa göre vermek — bu beş kural, yanlış pozitiflerin büyük kısmını ortadan kaldırır. Bir sonraki testinize başlamadan önce tek bir cümle yazın: "Bu testi X kullanıcıya ulaşınca durduracağım ve kararı Y metriğine göre vereceğim." Bu cümle, testin en değerli parçasıdır.

## Sıkça Sorulan Sorular

### Testi ne kadar süre çalıştırmalıyım?

Önceden hesaplanan örneklem büyüklüğüne ulaşana kadar ve en az bir tam hafta. Haftanın farklı günlerindeki davranış farkı nedeniyle süreyi tam hafta katlarında tutmak yanıltıcı sonuçları azaltır.

### Trafiğim az, A/B testi yapamaz mıyım?

Küçük farkları ölçemezsiniz, ancak büyük değişiklikleri test edebilirsiniz. Alternatif olarak metriği huninin daha üst basamağına taşımak (satın alma yerine tıklama) gereken örneklemi belirgin biçimde düşürür.

### Anlamlı çıkmayan test başarısız mıdır?

Hayır. "Fark gösterilemedi" bilgisi de değerlidir ve çoğu zaman gereksiz bir değişikliği yayınlamaktan kurtarır. Başarısız olan test, kararı değiştirmeyen testtir.

### Aynı anda birden fazla test çalıştırabilir miyim?

Testler birbirinden bağımsız alanlara dokunuyorsa genellikle sorun olmaz. Aynı akışı etkileyen testler eş zamanlı çalıştığında etkiler karışır ve sonuçlar yorumlanamaz hâle gelir.

---

Kaynak: [A/B Testini Yanlış Okumak: Erken Durdurma ve Anlamlılık Yanılgısı](https://cilginyazilim.com/blog/ab-testini-yanlis-okumak-erken-durdurma)
