Tasarım KalitesiÖlçüm11 Eylül 2026

Yeni Sürümle 15.804 Siteyi Yeniden Tarıyoruz

Ölçüm motorumuzun yeni sürümü yayında ve tüm site havuzunu baştan tarıyoruz. Bu sürümde motorun kendi kör noktasını bulduk: ölçemediği siteleri ödüllendiriyordu. Nasıl fark ettiğimizi, ne değiştirdiğimizi ve puanların neden hareket edeceğini rakamlarla anlatıyoruz.

Ölçüm motorumuzun yeni sürümü yayında ve 15.804 sitenin tamamını baştan tarıyoruz. Tarama sırayla ilerliyor; bir sitenin puanı yeniden hesaplandığında site sayfasında yeni değerlendirme görünür.

Bu yazıyı, yaptığımız değişikliği kayda geçirmek için yazıyorum. Bir kalite ölçüsünün en önemli özelliği tutarlılığıdır; cetveli değiştiriyorsak bunu sessizce yapmamalıyız.

Motorun kendi kör noktası

Yeni sürüme geçmeden önce, taranmış ilk sitelerin sonuçlarını incelerken beklemediğimiz bir şey gördük. Sitelerin bir kısmında motor, sayfanın davranışını (kaydırma anlatısı, hareket, geçişler) yakalayamıyordu — sayfa çok ağırdı, kendi kaydırma motorunu kullanıyordu ya da açılış perdesi ölçüm penceresini yiyordu. Bu beklenen bir durum. Beklenmeyen, o sitelerin aldığı puandı:

Ölçülen gerçek (183 site)
  • Davranışı ölçülebilen 162 site — ortalama 60,4 puan, %1'i 80 üstü
  • Davranışı ölçülemeyen 21 site — ortalama 71,8 puan, %33'ü 80 üstü

Yani motor, hakkında en az bilgi sahibi olduğu siteleri en çok ödüllendiriyordu. Bir ölçüm sisteminde bundan daha ters bir şey yoktur: belirsizlik prim yapıyordu.

Sebep: tahmini ölçüm sanmak

Davranış yakalanamadığında motor, hareketi sayfanın kodundan tahmin ediyordu — kaç tane @keyframes tanımı var, kaç transform ve transition bildirimi geçiyor, hareket kütüphanesi yüklü mü. Makul bir yedek plan gibi görünüyor. Ama sınadık.

Davranışı başarıyla ölçülmüş 162 sitede aynı tahmin formülünü çalıştırıp gerçek sonuçla karşılaştırdık:

Tahmin ne kadar sapıyordu
  • Gerçek ortalama: 43,7
  • Tahminin dediği: 65,8
  • Sistematik sapma: +22,1 puan — hataların %90'ı yukarı yönlü

Sebebi anlaşılınca basit: hazır temalar yüzlerce transform ve transition bildirimi üretir. Bunlar yazılmış bir hareket koreografisi değil, çerçevenin ürettiği kalıplardır. Tahmin formülü kodun hacmini hareketin varlığı sanıyordu.

Ne değiştirdik

Tahmin formülünü elle yazılmış eğrilerden çıkarıp, ölçülmüş verinin kendisinden türettik. Yeni tahmin, davranışı gerçekten ölçülmüş sitelerin sonuçlarına bakarak kuruldu; bu yöntemin doğal bir özelliği var: tahminin dağılımı gerçeğinkinden dar olur. Yani sistem, emin olmadığı yerde iddiasını kendiliğinden küçültür. Alçakgönüllülük sonradan eklenen bir ceza değil, yöntemin kendi sonucudur.

Formülde tutulan sinyaller ölçümle seçildi, fikirle değil. Hiçbir şey ayırt etmeyen iki sinyali (bir animasyon zamanlayıcısı ve bir tarayıcı API'si) modelden çıkardık; yalnız tek bir sitede görülen bir sinyalden katsayı türetmeyi reddettik — bir örnekten kural çıkarmak ölçüm değil, ezberdir.

Buna ek olarak üç ölçüm hatası düzeltildi:

  • Sayfayı hiç gezemediğimiz durumlar geçerli ölçüm sayılıyordu. Ödüllü bir stüdyo sitesi, sayfanın %0'ını gezebildiğimiz hâlde "kaydırma anlatısı yok" sonucuyla en düşük puanı alıyordu — üstelik yüksek güvenle. Kendinden emin biçimde yanlış olmak, en zararlı hata türüdür. Artık sayfayı anlamlı biçimde gezemediysek çekimser kalıyoruz: yokluğu kanıtlayamayız.
  • Kendi kaydırma motorunu yazan siteler tek adımda pes ettiriyordu. Sayfa kendini yeniden kurduğunda ölçüm zinciri kopuyordu; artık tazeleyip yeniden deniyoruz.
  • Ağır sitelere ayrılan süre yetmiyordu. Taramaların yaklaşık %9'u tam bu aşamada düşüyordu ve düşenler rastgele siteler değil, ölçmeyi en çok istediğimiz ağır ve yaratıcı sitelerdi. Süre sınırını genişlettik.

Sonuç

Elle etiketlenmiş referans setimizde (49 site) ölçtük:

Önce → sonra
  • Kademe uyumu (Spearman ρ): 0,60 → 0,63
  • Ödül düzeyi ile yetkin düzey arasındaki fark: 15,8 → 19,2 puan
  • Ödül düzeyi sitelerin ortalaması: 66,7 → 70,2

Bu son satır bizim için en önemlisi. Önceki sürümde ödül almış sitelerin ortalaması, bir alt kademedeki sitelerin ortalamasının altındaydı — motor en iyi işleri göremiyordu. Artık sıralama doğru yönde.

Tek tek örnekler farkı daha iyi anlatıyor: kendi kaydırma motorunu yazan bir stüdyo sitesi 53'ten 78'e, WebGL ağırlıklı bir başkası 79'dan 86'ya çıktı. Bu siteler değişmedi; onları görebilir hâle geldik.

Puanınız değişebilir

Yeniden tarama sırasında bazı sitelerin puanı yukarı, bazılarının aşağı hareket edecek. İki durumu ayırmak önemli:

Puanı düşenlerin çoğu, davranışı ölçülemediği için eski sürümde fazladan puan almış sitelerdir. Sitede kötüleşen bir şey yok; ölçüm dürüstleşti.

Puanı yükselenler ise çoğunlukla eskiden ölçemediğimiz, hareketi ve kaydırma anlatısı güçlü siteler. Onlarda da değişen site değil, bizim görme kabiliyetimiz.

Geçmiş madalyalar korunuyor

Kritik bir ayrıntıyla bitireyim: her dönemin madalyası kendi cetveliyle okunur. Ölçüm motoru sürüm değiştirdiğinde eşikler de o dönemle birlikte taşınır. Aksi hâlde bir motor güncellemesi, sitelerde hiçbir şey değişmemişken toplu bir "düşüş" gibi görünürdü.

Değişen site değil, cetveldir — ve bunu kayda geçirmek bizim işimiz.