A/B Testi Nedir?
Kısa tanım
A/B testi, bir sayfanın veya öğenin mevcut sürümü (A, kontrol) ile değiştirilmiş sürümünü (B, varyant) eş zamanlı olarak rastgele ayrılmış ziyaretçi gruplarına gösterip hangisinin belirlenmiş bir metrikte daha iyi sonuç verdiğini istatistiksel olarak ölçen deney yöntemidir. Sonucun tesadüf olmadığından emin olmak için örneklem büyüklüğü testten önce hesaplanır ve test bu büyüklüğe ulaşmadan sonlandırılmaz.
Diğer adları: A/B Testing, split test, bölünmüş test, AB testi, split testing

Deneyin anatomisi
Bir A/B testinin geçerli olması için birkaç koşulun aynı anda sağlanması gerekir. Ziyaretçiler gruplara rastgele atanır ve aynı kişi test boyunca hep aynı sürümü görür. İki sürüm aynı dönemde yayında olur; geçen ayın sonuçlarını bu ayın varyantıyla karşılaştırmak deney değil, önce-sonra karşılaştırmasıdır. Test başlamadan önce tek bir birincil metrik seçilir: örneğin teklif formu gönderen ziyaretçi oranı. Test bittikten sonra “hangi metrik kazandırmış?” diye aramaya çıkmak, tesadüfi farkları başarı sanmanın en kısa yoludur.
Birden fazla öğenin kombinasyonlarını aynı anda deneyen çok değişkenli testler (multivariate) ve sürümleri ayrı URL'lerde sunan split URL testleri aynı ailedendir, ama çok daha fazla trafik gerektirir.
Örneklem büyüklüğü testten önce hesaplanır
Gereken ziyaretçi sayısı dört girdiye bağlıdır: mevcut dönüşüm oranı, yakalamak istediğiniz en küçük fark (minimum detectable effect), anlamlılık düzeyi (genellikle %5) ve istatistiksel güç (genellikle %80). Mevcut oranı %3 olan bir sayfada %3,6'ya, yani göreli %20'lik bir artışa ulaşan farkı yakalamak için bu varsayımlarla her sürüme yaklaşık 14.000 ziyaretçi gerekir. Aranan fark küçüldükçe gerekli trafik hızla büyür; göreli %10'luk bir fark için bu sayı kabaca dört katına çıkar.
“İstatistiksel olarak anlamlı” ifadesi, gözlenen farkın gerçekte hiçbir fark yokken tesadüfen ortaya çıkma olasılığının önceden belirlenen eşiğin altında kaldığı anlamına gelir. Varyantın ne kadar daha iyi olduğunu ya da sonucun iş açısından önemli olduğunu söylemez.
Erken bakma (peeking) ve diğer tuzaklar
- Peeking: Sonuçları her gün kontrol edip ilk “anlamlı” görünen anda testi durdurmak, yanlış pozitif oranını katlar. Klasik (frekansçı) testlerde süre baştan belirlenir ve sonuç ancak hedef örnekleme ulaşınca okunur. Sürekli izleme isteniyorsa buna uygun ardışık test yöntemleri kullanılmalıdır.
- Eksik hafta: Hafta içi ve hafta sonu davranışı farklıdır; test en az bir, tercihen iki tam haftayı kapsamalıdır.
- Yenilik etkisi: Yeni bir tasarım geri dönen kullanıcıların ilgisini ilk günlerde yapay olarak artırabilir.
- Örneklem oranı uyuşmazlığı: %50-%50 bölünmesi gereken trafik %46-%54 geliyorsa atama veya ölçüm bozuktur; sonuçlara güvenilmez.
- Titreme (flicker): İstemci tarafında çalışan test araçları sayfa önce A sürümüyle görünüp sonra B'ye dönüşürken kullanıcıya bunu gösterebilir. Bu hem testi kirletir hem de CLS ve yükleme metriklerini kötüleştirir.
Test yaparken arama motorları
Google'ın site testleri için yönergeleri net: Googlebot'a ziyaretçilerden farklı içerik göstermek (cloaking) spam politikalarına aykırıdır. Varyant ayrı bir URL'deyse orijinal sayfayı gösteren bir canonical URL kullanılmalı, yönlendirme gerekiyorsa kalıcı 301 değil geçici 302 tercih edilmelidir. Test bittiğinde kazanan sürüm yayına alınmalı ve test kodu ile varyant URL'leri gecikmeden kaldırılmalıdır.

